OneCoder Avatar
OneCodercoderli.com · 936 篇博文
🐍

Python 与数据工程

112

Python 实用技术库、MySQL 高性能架构、PostgreSQL、Hadoop/Spark 大数据。

🎯分类筛选(显示 112 / 共 112 篇)
Python 与数据工程 · 技术实战··8 分钟

为Jekyll站添加“相关文章"功能

想为本博客添加相关文章功能,因为本站是通过Jekyll搭建的静态站,所以首先想到通过Jekyll相关插件解决,没想到搜遍全网居然未找到可用的插件,无奈最后手敲实现,以下记录折腾过程。

#Jekyll
为Jekyll站添加“相关文章"功能
Python 与数据工程 · 技术实战··26 分钟

详解SVN与Git相比存在的不足

截至目前,我们已既从整理梳理的SVN和Git在设计理念上的差异,也重点对二者的存储原理和分支管理理念的差异进行深入分析。这些差异也直接造成了SVN和Git在分支合并、冲突解决、历史记录管理以及网络依赖等方面功能的显著区别,也彰显了Git的强大之处,因此最后我们详细总结分析,也算做个阶段性的学习小结:

#SVN#Git
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··6 分钟

Git分支管理基本原理

上文已讨论过svn分支管理的基本原理,本文将继续探讨Git分支管理的基本原理,以便后续进行进一步的理解和对比:

#SVN#Git
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··5 分钟

SVN分支管理基本原理

学习完svn和git的版本管理理念上的差异后,自然的我们再进一步对比svn和git在分支管理上的原理差异,这种差异正是由二者版本管理理念和存储方式差异造成的,今天我们先研究一下svn的分支管理原理:

#SVN#Git
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··11 分钟

Git版本管理基本原理

上文已经研究分析了SVN增量式版本管理的基本原理,今天再进一步研究分析下Git快照式存储的基本原理:

#SVN#Git
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··5 分钟

SVN版本管理基本原理

之前在做svn和git差异分析的时候提到二者的数据存储模型有差异,svn增量(差异)存储,git快照存储。为了进一步搞清这里的差异,我分别对svn和git的存储原理进行了学习和梳理,总结如下:

#SVN#Git
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··5 分钟

SVN与Git功能差异对比分析

最近在调研学习Git管理和分支模型相关内容,外延到了SVN和Git差异、工作原理等相关细节,学习整理如下。 SVN(Subversion)与 Git 的最大不同,主要包括以下几个方面:

#SVN#Git
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··37 分钟

Python实战-生成版本排期Excel

最新工作很忙,需要做一个整体项目和版本排期的大表。幸亏之前学了一点Python,尝试用Python处理数学,生成所需要表格。主要用到了pandas、xlsxwriter等工具包。代码并不具备什么通用性,可能写的也很啰嗦,不过好在也算用Python为自己做了一项实用的工作。下面代码中,一些工作信息隐去了。

#Python
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··15 分钟

Python瞎学瞎用

很久没有更新博客了,有年底很忙的原因,也有在学习用Python瞎鼓捣点什么的因素,其实我并没有停止学习。 学了一段时间Python,本身有开发基础,总想着用Python鼓捣点什么我自己用的上的东西,所以从去年11月开始,就开始学习研究Python GUI编程,现在每天学学写写,走走停停,也算有所积累吧。 当然,还没什么...

#Python
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··4 分钟

Python练习-常用内建模块contextlib

最近很忙,距离上一篇博文过去已经10多天了,不想荒废。今天继续学习Python常用内置模块contextlib。其实主要是学习了contextlib这个模块中@contextmanager这个注解的使用。

#Python
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··4 分钟

Python练习-常用内建模块itertools

本部分学习Python常用内建模块itertools。itertools中提供了很多有用迭代器方法,用于生成和处理序列。直接通过代码学习

#Python
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··3 分钟

Python练习-常用内建模块hmac

本部分学习Python内置模块hmac。实际hmac是承接hashlib中的md5等摘要算法加salt的操作。对该操作进行了封装,使用起来更加通用方便。在学些了之前内容的基础上,本部分内容比较简单直接。直接看代码即可。

#Python
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··5 分钟

Python练习-常用内建模块hashlib

本部分学习Python常用内置模块hashlib。主要封装了md5、sha1等常用的摘要算法。摘要算法主要用来判断文本、代码等是否被修改,以及利用其不可逆性,用于在数据库中密文保存密码。

#Python
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··7 分钟

Python练习-常用内建模块struct

本部分学习Python内置模块struct。struct模块可以方便快速的处理字节,如将一个整数转化为字节数组的表示等。 传统情况下,如果我们想将一个32位的整数,用1个由4个字节组成的字节数组表示的话,需编写如下代码:

#Python
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··6 分钟

Python练习-常用内建模块base64

本部分学习Python中关于base64编码的基本操作。关于这部分内容,除了基本的base64操作外,我还查阅了一些资料,了解了base64的一些基础常识,比如:base64是因为什么出现的?编码规则等。我觉得了解了事务的背景,对于理解、掌握和应用该技术,是非常必要和有帮助的。

#Python
Python练习-常用内建模块base64
Python 与数据工程 · 技术实战··4 分钟

Python练习-常用内建模块collections

本部分学习Python常用内建模块collections。collections模块中提供了很多集合相关的类,如namedtuple、OrderDict、ChainMap以及Count等。便于针对特定使用场景,高效的进行集合操作。 一、namedtuple namedtuple是一个函数,它用来创建一个自定义的tupl...

#Python
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··7 分钟

Python练习-常用内置模块datetime

本部分学习Python常用内置模块datetime。通过datetime模块,我们可以很方便的操作日期、时间戳已经时区转换等操作。 构建datetime对象 注意到datetime是模块,datetime模块还包含一个datetime类,通过from datetime import datetime导入的才是datet...

#Python
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··6 分钟

Python练习-正则表达式

本部分练习通过Python使用正则表达式。正则表达式是编程里一个很常用,很基础的知识,这里不做赘述。具体规则可以查阅关于正则学习的相关资料。这里重点练习通过Python编程使用正则表达式的方法。

#Python
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··8 分钟

Python练习-分布式任务

本部分练习Python分布式任务。在Python的multiprocessing模块中,提供了BaseManager类,可以非常简单快速的创建分布式调度任务。 思想也很简单,服务端开启端口,注册信息传递的队列,接收端链接对应地址和端口,拿到队列,获取其中传递的信息,进行对应处理即可。 如果有结果传回,可以在注册一个队列...

#Python
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··7 分钟

Python练习-多线程

本部门练习Python多线程操作,Python中得多线程虽然为真正得POSIX 多线程,但是由于全局进程锁GIL得存在,在计算密集型业务中,并不能发挥真正并发的作用。 Python中的多线程主要通过threading模块实现,结果操作与Java多线程和Python多进程类似。

#Python
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··8 分钟

Python练习-多进程

本部门学习Python多进程编程,若在linux环境下,可以使用fork函数,windows环境下没有该函数,可通过Process模块实现。

#Python
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··5 分钟

Python练习-json操作

本部门学习Python的json转换操作。跟之前学的通过bytes的序列化接口非常类似。只是在类转换的时候略有不同。 一、dict对象转换 对于dict对象,可直接进行通过json.dumps/json.dump接口转换字符串或保存到文件中。

#Python
Python练习-json操作
Python 与数据工程 · 技术实战··4 分钟

Python练习-序列化

本部分学习Python序列化相关操作。序列化主要是为了将内存中的对象持久化到磁盘(文件)以便于后续从文件中恢复对象。可用于对象持久化和网络传输。 本文主要学习字节流序列化操作。Python中用字节流序列化对象用pickle模块。

#Python
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··7 分钟

Python练习-IO操作 StringIO、BytesIO

本部分学习Python的IO操作,包括StringIO、BytesIO以及文件(夹)操作3个部分。

#Python
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··2 分钟

Python练习-文件读写

本部门练习Python文件读写操作。与Java类似,需要注意文件打开后的关闭操作。

#Python
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··12 分钟

Python练习-调试和测试

本部分学习Python代码调试和测试方法。可用的代码调试方法有: print打印 logging记录 pdb调试/pdb.settrace() unittest单元测试等。 样例代码如下:

#Python
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··5 分钟

Python练习-错误处理

本部分练习python中的异常处理,相当于Java中的try...catch...finally,不同的是: 1.Python中的语句是try....except....finally 2.Python中有try....except...else...finally语句,期中else语句是当没有异常捕获时执行; 3.P...

#Python
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··3 分钟

Python练习-type 和 metaClass

本部分学习用Type和metaClass动态创建类,添加属性和方法。 输出如下:

#Python
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··3 分钟

Python练习-定制类和枚举

本部分学习Python中定制类和枚举部分。定制类其实就是类似Java中复写String,HashCode等方法,不过更灵活,可覆盖的方法更多。

#Python
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··5 分钟

Python练习-高级面向对象

本部分练习Python高级面向对象内容,主要学习slots和@property相关用法,详见代码:

#Python
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··4 分钟

Python练习-面像对象基础

本部分练习Python面像对象编程基础知识。练习代码如下:

#Python
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··3 分钟

Python练习-模块和初级面像对象

本部分练习Python模块和初级面像对象相关知识。练习代码如下:

#Python
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··8 分钟

python练习-函数式编程(二)

本部门练习Python函数式编程,第二部分。

#Python
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··8 分钟

python练习-函数式编程(一)

本部分练习Python函数式编程。练习高阶函数、map、reduce等常用函数。

#Python
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··5 分钟

python练习-Hello World

#Python
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··2 分钟

TensorFlow's Hello World Mnist数据集下载错误问题解决

部署Anaconda 科学计算包,并通过 部署tensorflow相关包。在ipython环境下执行下列命令下载训练数据包 结果报错, [Errno 104] Connection reset by peer ![错误信息][1] <!--break-- 从错误信息看,应该网络问题。仔细查看错误堆栈,找到了 anaco...

#TensorFlow#Python
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··7 分钟

【翻译】 TensorFlow如何工作

学习TensorFlow过程中读的一篇文章,索性就翻译出来,虽然收获感觉不是很大。 原文地址:How TensorFlow Works https://github.com/nfmcclure/tensorflowcookbook/blob/master/01Introduction/01HowTensorFlowWo...

#TensorFlow#翻译
【翻译】 TensorFlow如何工作
Python 与数据工程 · 技术实战··12 分钟

Scala学习笔记 - 函数

Scala做为支持函数式编程的语言,函数自然是其核心的特性,因此笔者对函数部分的学习自然会更加认真细致一些。但也仅仅是基础部分。 <!--break-- 函数基础 先看一段代码: 这段代码包含关于scala函数若干知识点。 函数声明和调用 跟Java一样,函数都需要有参数和返回值。遵循scala一贯的语法,类型在后,变...

#Scala
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··12 分钟

Scala学习笔记-基础语法

上手学习Scala语言。先熟悉一下语法。对于Scala笔者也是完全的新手,对scala的设计思想和实现原理没有太多了解。错误在所难免,还望发现后不吝指教。 <!--break-- Hello World 基础环境配置直接利用IntelliJ提供的Scala插件,会自动下载Scala开发包并配置好开发环境。直接从我们熟悉...

#Scala
Scala学习笔记-基础语法
Python 与数据工程 · 技术实战··7 分钟

Zabbix源码编译安装

Zabbix 源码编译部署说明。 <!--break-- 源码编译 源码下载 创建zabbix用户 安装MySQL zabbix-server需要数据库 配置数据存放目录,修改/ete/my.cnf 初始化zabbix mysql数据库 安装依赖库 编译Zabbix Server和 Agent 配置zabbix ser...

#Zabbix
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··3 分钟

Elasticsearch 集群部署说明

记录Elasticsearch集群搭建的过程。 <!--break-- 安装JDK 8 官方推荐的版本是1.8.073 以上。因此首先安装jdk。安装之前下载的jdk-8u77版 安装ElasticSearch 下载安装包 解压 修改config/elasticsearch.yml配置文件 启动 注意,不能以root身...

#Elasticsearch
Elasticsearch 集群部署说明
Python 与数据工程 · 技术实战··4 分钟

CentOS下vsftpd服务配置说明

项目需要用到分用户的FTP服务器,因此花了一天时间学习了vsftpd服务的搭建和配置说明。记录如下。 <!--break-- 安装 配置虚拟用户 虚拟用户即可以登录Ftp,不能登录系统。配置原理即开启vsftpd的虚拟用户功能,并配合pam管理用户认证 修改配置文件/etc/vsftpd/vsftpd.conf 安装B...

#Linux
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··16 分钟

yum安装MySQL5.7

CentOS6.5系列默认安装的是MySQL5.1版本,并且默认的repo里也没有高版本的MySQL。 <!--break-- 卸载低版本MySQL 先通过 命令查到mysql安装包详细的名称。然后用命令 卸载即可 添加MySQL5.7 Repo源 在目录/etc/yum.repos.d/下新建mysql-commun...

#MySQL
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··3 分钟

事无巨细 Spark 1.6.1 集群环境搭建

还是在之前的Hadoop集群环境上继续搭建Spark-1.6.1环境 下载安装 下载Spark并解压 <!--break-- 改个舒服的名字 配置环境变量 同样,修改.bashrc文件 添加内容 立即生效 配置Spark 拷贝一份配置文件模版 修改slaves内容如下 其余走默认(这点来看,Spark真的很方便),将安...

#Spark
事无巨细 Spark 1.6.1 集群环境搭建
Python 与数据工程 · 技术实战··7 分钟

事无巨细 Apache Kafka 0.9.0.1 集群环境搭建

Kafka集群环境依赖于Zookeeper环境。因此我们的环境搭建实际分为两部分。Zookeeper环境搭建和Kafka环境搭建。 <!--break-- Zookeeper 3.4.8集群搭建 部署安装包 下载 解压 配置Zookeeper 按照理解,应该只需制定Zookeeper集群的节点信息即可。老套路,拷贝配置...

#Kafka
事无巨细 Apache Kafka 0.9.0.1 集群环境搭建
Python 与数据工程 · 技术实战··4 分钟

事无巨细 HBase-1.2.1 集群搭建

继续搭建HBase集群环境。HBase版本也比较杂,目前也有两大稳定的分支,1.1.x和1.2.x。从官方文档了解到,支持Hadoop2.6.1+对应版本应该是1.2.x系列,因此这里选择1.2.1稳定版。1.1.x在Hadoop 2.6.1+上是未测试的。 <!--break-- 下载HBase 同样,通过镜像站下载...

#HBase
事无巨细 HBase-1.2.1 集群搭建
Python 与数据工程 · 技术实战··14 分钟

事无巨细 Hive1.2.1 Hiveserver搭建详解

上文介绍了Hadoop2.6.4集群搭建的详细步骤。现在我们在此基础上,搭建Hiveserver。同样,事无巨细,难免跑题。 <!--break-- 环境需求列表 - Hive1.2版本开始,依赖Java1.7+,0.14-1.1版本依赖Java1.6+。推荐用Java1.8 - 推荐使用Hadoop2.x 系列。Hi...

#Hive
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··16 分钟

事无巨细 Hadoop2.6.4 环境搭建步骤详解

本文详细记录了OneCoder通过自己的Mac环境,在开发服务器(CentOS 6.5)上搭建Hadoop的详细过程。因为事无巨细,所以可能会”跑题”。 ssh连接免密码配置 由于配置过程中需要频繁的进行ssh连接到开发服务器执行命令以及通过scp命令向服务器拷贝文件等依赖ssh连接的操作。所以,配置本地环境跟服务器之...

#Hadoop
事无巨细 Hadoop2.6.4 环境搭建步骤详解
Python 与数据工程 · 技术实战··5 分钟

Docker下搭建DNS服务器dnsmasq

为方便Hadoop集群管理,决定利用docker环境手动搭建一个DNS服务器。 1. 配置容器 选择andyshinn/dnsmasq的docker镜像,2.75版本。执行命令 本以为顺利完成,结果报错: docker: Error response from daemon: failed to create endp...

#Docker
Docker下搭建DNS服务器dnsmasq
Python 与数据工程 · 技术实战··4 分钟

镜像博客站点解决百度Spider无法爬取Github Pages问题

最近,不知是因为哪根筋的问题,我突然去百度统计关注了一下博客的访问情况。意外的发现博客的访问量较之以前大减,而且几乎看不到来自百度搜索的访问。我意识到,这应该我博客的百度索引出现了问题。去百度站长工具查询索引量,果然不出所料 从3月7日开始,索引量瞬间归零。我努力的回忆当时发生了什么。突然想起我的一篇日记<a href...

#Github Pages#Spider
镜像博客站点解决百度Spider无法爬取Github Pages问题
Python 与数据工程 · 技术实战··22 分钟

Thymeleaf 3 迁移指南

2016年2月23日,Thymeleaf 发布了 3.0 Beta2版,此迁移指南重点翻译自官方手册:Thymeleaf 3 ten-minute migration guide。 十分钟迁移到Thymeleaf 3 如果你是打算从Thymeleaf2迁移到Thymeleaf3的用户。首先,一个好消息是你当前的Thym...

#Thymeleaf
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··2 分钟

Github时区问题 新文章无法显示

昨天把博客迁移到Github,本来一切安好。今天就遇到新发的文章在列表上刷不出来,把github的help都快翻烂了,也没找到解决方案,还给github的support发了邮件。。。 偶然在Jekyll官网的3.0升级指南里,看到一个关于时区问题的说明。给头里的date部分加上了+0800是时区标识。 date: 20...

#Github Pages#Jekyll
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··2 分钟

Hue3.9配置 MacOSX

用Hue管理Hadoop、HBase等集群环境。 参考官方文档: http://gethue.com/how-to-configure-hue-in-your-hadoop-cluster/ http://gethue.com/start-developing-hue-on-a-mac-in-a-few-minutes...

#Hue#Mac
Hue3.9配置 MacOSX
Python 与数据工程 · 技术实战··3 分钟

MacPorts 迁移至 EI Capitan

老版本的MacPorts在EI Capitan下有兼容性问题。今天运行报错如下: Error: Current platform "darwin 15" does not match expected platform "darwin 14" Error: If you upgraded your OS, please...

#Mac
MacPorts 迁移至 EI Capitan
Python 与数据工程 · 技术实战··2 分钟

Postgresql 9.4 文档阅读笔记-第十一章 索引

索引类型 - B-tree,Hash, GiST, SP-GiST, GIN。默认是B-tree B-tree - 适合处理等值和范围查询。支持的操作符: <, <=, =, =, , in, between, is null, is not null。 like和 操作支持从前匹配,如:foo% 、^foo。 B-t...

#PostgreSQL
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··5 分钟

Postgresql 9.4 文档阅读笔记-第八章 数据类型

numeric - 可以存储非常大数据,并且可存储高精度数据。numeric(precision, scale)例如:23.5141 precision=6, scale=4 可存储NaN值,代表not-a-number。在Postgresql中NaN和NaN数值是相等的,并且大于其他任何值。

#PostgreSQL
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··5 分钟

博客从wordpress迁移到Github.io、GitCafe

最近博客(www.coderli.com) 被几个流氓IP爬的厉害,流量超标。促使我萌生了将博客迁移到github.io的想法。整个迁移过程OneCoder之前也是不熟悉的,不过思路是清晰的。

#Jekyll#Github Pages
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··4 分钟

Windows下 Apache Http Server+ Tomcat 整合配置

可能网上已经有很多教程,这里只是记录OneCoder自己的搭建过程。 需要模拟实际环境进行一些验证工作,这里搭建环境也力图简便。没有自己编译Apache Http Server,而是下载了一个编译好的安装包:https://mirror.bit.edu.cn/apache//httpd/binaries/win32/h...

#Tomcat
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··8 分钟

Mock Server- Moco 使用指南

项目里需要使用Mock Server(Mock Server是做什么的,您可以Google一下),这也是我个人比较喜欢的做法。这里我们选择的是Moco,OneCoder其实也没用过,所以就先学习一下。 官方地址:https://github.com/dreamhead/moc Moco服务端就是一个独立的jar包。通过...

#Moco
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··3 分钟

jQuery Template 上手体验

项目里用到了jQuery template这个插件,对我来说也算新鲜,学习记录一下。 这里使用的jQuery Template插件是指:https://github.com/BorisMoore/jquery-tmpl 如果您使用过模版引擎,估计对此也不会陌生。这个插件的用法其实很简单,通过下面代码相信就可以明白用法:...

#jQuery
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··14 分钟

zTree 上手记录

由于工作需要,前端基本瞎的我也需要学习一些前端的知识。第一课就是zTree,因为我要做一个树。 zTree官网为:<a href="http://www.ztree.me/v3/main.php#zTreeInfo"http://www.ztree.me/v3/main.php#zTreeInfo</a 官网下载的包里...

#zTree
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··4 分钟

关于Shurnim-storage项目更新和喜获奖

<p 前端时间参加了又拍云存储的开发者大赛,没想到今天公布名单居然得了一等奖,小意外:)</p <p shurnim项目介绍:</p <p <a href="http://www.coderli.com/onecoder-shurnim-storage"http://www.coderli.com/onecoder-s...

#随笔
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··5 分钟

OneCoder的shurnim-storage项目

<h1 shurnim-storage</h1 <p <img alt="" src="/images/oldposts/rEBO.jpg" style="width: 180px; height: 180px;" /</p <h3 背景介绍</h3 <p Shurnim,是我和我老婆曾经养过的一只仓鼠的名字。</p...

#随笔
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··26 分钟

为项目编写Readme.MD文件

了解一个项目,恐怕首先都是通过其Readme文件了解信息。如果你以为Readme文件都是随便写写的那你就错了。github,oschina git gitcafe的代码托管平台上的项目的Readme.MD文件都是有其特有的语法的。称之为Markdown语法。语法规则详见:Markdown 官方教程 如果直接记语法,那似...

#Markdown
为项目编写Readme.MD文件
Python 与数据工程 · 技术实战··14 分钟

自定义xsd文件及使用

<p 需要规范用户开发并行计算任务的配置文件的格式,自然考虑定义任务配置的xsd文件。对于xsd的介绍可以参考:<br / http://www.w3school.com.cn/schema/schemaexample.asp<br / 这里,<a href="http://www.coderli.com"OneCod...

#XML
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··2 分钟

又拍云存储试用体验

<p 首先,感谢又拍云存储赞助的存储空间。让我的小站以可以体验一下CDN加速的快感。<br / <br / 虽然我是第一次使用又拍云,甚至是第一次使用云存储,但是上手起来还是很迅速的。这得益于又拍云后台操作的简便,以及详细的操作说明。<br / 又拍云的空间分两类,一种是文件类的,一种是图片类的。主要的区别就是图片类空...

#站点运营
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··4 分钟

Flume(ng) 自定义sink实现和属性注入

最近需要利用flume来做收集远端日志,所以学习一些flume最基本的用法。这里仅作记录。 远端日志收集的整体思路是远端自定义实现log4j的appender把消息发送到flume端,flume端自定义实现一个sink来按照我们的规则保存日志。 自定义Sink代码: 实现Configurable接口,即可在初始化时,通...

#Flume
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··2 分钟

Mac os下修改path环境变量

不是什么高级的方法,只是我才刚会而已。记录一下。 修改:/etc/paths文件,跟windows一样增加你想要配置到path下的目录即可。

#MacOS
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··3 分钟

CentOS下 PostgreSQL部署记录

MySQL License收费的问题越来越现实了。PostgreSQL成了最好的替代方案。 部署环境:CentOS6.3 x64。PostgreSQL版本:9.2.4-1。 CentOS的Develop包模式行可能已经带了PostgreSQL数据库,不过版本较老,这里还是要全新部署一个。官网提供了很多的部署方式,这里笔...

#PostgreSQL
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··3 分钟

Mac OS下 Redis2.6.14部署记录

部署一个Redis作为缓存进行验证,记录部署过程。 官网: http://redis.io/ 目前最近稳定版为2.6.14。解压,进入目录。按照README文件的指引进行编译和验证。 在解压后的根目录执行 <p style="text-align: center;" <img alt="" src="/images/o...

#Redis
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··9 分钟

CentOS下 Storm0.8.2 环境搭建记录

<p Storm是Twitter开源的一个实时计算框架,它需要依赖Zookeeper,ZeroMQ;同时还需要你的系统环境中有Java和Python。所以整个搭建步骤如下:</p <blockquote <p 1. 搭建Zookeeper集群。<br / 2. 在控制节点机[ Nimbus ]和工作节点机[ Super...

#Storm
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··3 分钟

Cloudera CDH4卸载

<p 记录卸载过程和问题。现有环境Cloudera Manager + (1 + 2 )的CDH环境。</p <p 1、先在Manage管理端移除所有服务。<br / 2、删除Manager Server<br / 在Manager节点运行</p <p 如果没有该脚本,则可以手动删除,先停止服务:</p <p 然后删除...

#Hadoop
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··3 分钟

Mac下 Hbase部署简介(Mac OSX 10.8.3 + HBase-0.94.6)

<p 1、安装JDK。之前在部署Hadoop的时候已经安装完成。<br / 2、下载解压HBase。<br / 3、配置HBase数据存储路径,虽然单机模式可以使用本地文件系统,不过OneCoder还是配置HDFS文件系统。<br / 修改hbase-site.xml</p <p 这里hdfs路径跟之前hadoop环境...

#HBase
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··2 分钟

《HighPerformance MySQL》概译 事务日志

<p 事务日志使得事务更加高效。每次数据改变的时候,存储引擎可以在内存中修改数据拷贝而不用每次都修改磁盘上数据。这速度很快。随后存储引擎会修改记录写入事务日志,该日志是在磁盘上的从而完成持久化。这也是相对高效的过程。因为,追加日志事件产生的是连续的小范围磁盘上的I/O操作,而不是大范围的随机I/O操作。然后,在随后的某...

#翻译#MySQL
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··3 分钟

《HighPerformance MySQL》概译 死锁

<p 当多个事务同时持有和请求同一资源上的锁而产生循环依赖的时候就产生了死锁。死锁发生在事务试图以不同的顺序锁定资源。以StockPrice表上的两个事务为例:</p <blockquote <p 事务1<br / START TRANSACTION;<br / UPDATE StockPrice SET close...

#翻译#MySQL
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··6 分钟

Mac下 Hadoop部署简介(Mac OSX 10.8.3 + Hadoop-1.0.4)

<p OneCoder在自己的笔记本上部署Hadoop环境用于研究学习,记录部署过程和遇到的问题。</p <p 1、安装JDK。<br / 2、下载Hadoop(1.0.4),在Hadoop中配置JAVAHOME环境变量。修改hadoop-env.sh文件。<br / export JAVAHOME= /Library...

#Hadoop
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··2 分钟

HBase“扫描器”scanner使用和优化

<p HBase在扫描数据的时候,使用scanner表扫描器。HTable通过一个Scan实例,调用getScanner(scan)来获取扫描器。可以配置扫描起止位,以及其他的过滤条件。通过迭代器返回查询结果,使用起来虽然不是很方便,不过并不复杂。但是这里有一点可能被忽略的地方,就是返回的scanner迭代器,每次调用...

#HBase
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··8 分钟

《HighPerformance MySQL》概译 隔离等级

<p <strong隔离等级</strong</p <p class="p1" 隔离其实比它看起来复杂。SQL标准定义了四种隔离级别,决定了数据变化在事务内外可见或不可见。低级别的隔离等级会有更好的并发支持和更低的资源消耗。</p <blockquote <p class="p1" &nbsp; &nbsp; &nbs...

#翻译#MySQL
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··4 分钟

《HighPerformance MySQL》概译 事务

<p <strong事务</strong</p <p 事务是一组被看做一个整体的SQL请求。该组SQL被看成是原子的。如果所有的SQL都正常执行则数据确认请求,如果其中的任何一个失效,则所有的SQL都不生效。也就是说要么全成功,要么全失效。</p <p 本节并不是针对MySQL的,如果你已经事务的ACID特性了解,那么...

#翻译#MySQL
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··3 分钟

《HighPerformance MySQL》概译 锁的粒度

<p 一种提高共享资源并发效率的方式是合理的规划锁的范围。仅仅锁住你要修改的部分当然比全表锁住要好。所以,我们尽可能的最小化锁的范围,因为不相干的部分,本身也互不干扰。</p <p 不过,也要考虑到,锁是消耗资源的。每种锁的操作都有消耗,例如:获得锁,检查锁是否可用,释放锁等。如果系统花了过多的资源在锁的操作上,那么并...

#翻译#MySQL
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··8 分钟

HBase 利用Coprocessor实现聚合函数

<p HBase默认不支持聚合函数(sum,avg等)。可利用HBase的coprocessor特性实现。这样做的好处是利用regionserver在服务端进行运算。效率高,避免客户端取回大量数据,占用网络带宽,消耗大量内存等。</p <p 实现方式:</p <p 利用HBase提供的endPoint类型的Aggreg...

#HBase
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··2 分钟

《High Performance MySQL》概译 读/写锁

<p 今天在微博看到消息该书的中文版已经翻译完成即将发售,所以OneCoder不再进行全文翻译,只会以类似读书笔记的方式记录文章大意和自己的理解。每天阅读的不会太多,因为只是休息的时候阅读,学习的重心最近在Hadoop上。</p <p <strong读写锁</strong</p <br / <p 多个用户同时读取邮件的...

#翻译#MySQL
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··2 分钟

《High Performance MySQL》翻译(3) 第一章 并发控制

<p <br / <strong并发控制</strong</p <p 任何时刻当不止一个请求想要同时修改数据时候就产生了并发控制问题。从本章我们的观点来看,MySQL需要在两层关注这个问题:服务层和存储引擎层。并发控制是一个大话题,有很多相关的理论文献发表。所以,我们仅简介一下MySQL处理并发读写的方式。你将在本章的...

#翻译#MySQL
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··2 分钟

《High Performance MySQL》翻译(2) 连接管理和安全 优化和执行

<p 接上篇,第一章 MySQL架构和历史</p <p <strong连接管理和安全</strong</p <p <br / 每个客户连接在服务内部都有一个独立的线程处理。查询在这个单独的线程内运行,线程轮流在CPU或核心上运行。线程在服务端被缓存,所以不必针对每个新来线程进行创建和销毁。(注2)。<br / 当客户端...

#翻译#MySQL
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··3 分钟

High Performance MySQL 翻译 第一章 MySQL架构和历史 - 逻辑架构

《High Performance MySQL》是OneCoder正在阅读的书,利用茶余饭后时间进行的阅读和翻译,日积月累。 MySQL与其他数据库服务有很大的不同,它的架构特性使得它在广泛领域内成为一种实用而&ldquo;廉价&rdquo;的选择。MySQL并不是完美的,但是他足够灵活以适应特定的需求环境,如网络应用...

#翻译#MySQL
High Performance MySQL 翻译 第一章 MySQL架构和历史 - 逻辑架构
Python 与数据工程 · 技术实战··3 分钟

Linux 指定MySQL服务运行的CPU核心(数)

<p 最近在利用mysqlslap对MySQL进行性能测试,但是测得的TPS、QPS的benchmark数据,从趋势上就跟网上&ldquo;权威&rdquo;的测试数据不同。这让OneCoder十分怀疑测试数据的准确性。</p <p 在定位问题的过程中,在独立于MySQL Server的机器上执行mysqlslap测试...

#MySQL
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··2 分钟

MySQL 用户并发数限制问题解决

<p 对MySQL进行并发测试过程中遇到的一个小问题,记录一下。</p <p 用mysqlslap进行并发访问测试,在1024线程的时候报错:</p <blockquote <p bin/mysqlslap: Error when connecting to server: 1135 Can&#39;t create...

#MySQL
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··10 分钟

MySQL5.6.10 NoSQL API访问方式体验

<p MySQL 近期发布5.6的GA版本,其中确实有很多不错的特性值得关注和尝试。NoSQL API的支持就是其中一个比较不错的亮点,我们这就来尝试一下。详细的特性介绍可访问:<a href="http://dev.mysql.com/tech-resources/articles/mysql-5.6.html"ht...

#MySQL
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··10 分钟

MySQL性能测试—前期知识储备

<p 今天是妇女节,先祝所有过节的女同胞们节日快乐:)</p <p 即将对MySQL进行性能测试。所以事先对MySQL的测试工作进行一番了解。主要考察性能测试的工具,MySQL的关键指标,以及一些基础的Benchmark数据,为测试用例和场景的规划做些准备。</p <p 先说说考量的指标(转载,网址找不到了,抱歉)</...

#MySQL
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··15 分钟

MySQL Cluster写入效率测试

<p MySQL Cluster使用到目前为止遇到渴望得到答案的问题,也是直接影响使用的问题就是MySQL Cluster的写入效率问题和Cluster是否适合大数据存储、如何配置存储的问题。</p <!--break-- <p 在之前的测试中MySQL Cluster的写入效率一直不佳,这也是直接影响能否使用MySQ...

#MySQL
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··4 分钟

MySQL主从配置-Amoeba读写分离验证

<p 继续我们的验证工作,这次是搭建MySQL的主从配置,再利用Amoeba实现读写分离,搭建一个相对有实际意义的MySQL集群环境。</p <p MySQL的主从配置比较简单,网上也有很多的文章,这里不多介绍。基于之前的介绍的环境考虑:</p <blockquote <p 10.4.44.206 主-写<br / 1...

#MySQL
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··5 分钟

MySQL-Amoeba负载均衡、读写分离功能验证

<p 由于MySQL Cluster自身就实现了数据的自动同步等功能,在此之上架一层Amoeba基本只起到了分担SQL层负载的的作用,所以我们很有必要基于传统的单点MySQL服务之上的 Amoeba都能帮我们做些什么。</p <p 环境搭建的过程不再赘述,我们在两个新的虚拟机上启动两个独立的MySQL服务,然后配置在...

#MySQL
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··7 分钟

MySQL Cluster SQL节点负载均衡、读写分离验证-基于Amoeba

<p 龙年完成的Amoeba环境初步搭建工作,蛇年开始进行读写分离和负载均衡的验证工作。先祝大家蛇年一切顺利。上回的工作我们只是完成Amoeba框架的引入,但是并不满足读写分离场景的要求,因为最基本的,SQL节点只有一个。<br / 所以,我们首先需要添加一个SQL节点,具体操作不再赘述。添加,重启后,MySQL Cl...

#MySQL
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··6 分钟

MacOS下纯shell模式Github使用简介

<p 为了同步在MacOS下和Windows下编写的C++练习代码,同时也想多学一些命令行的操作,<a href="http://www.coderli.com"OneCoder</a决定鼓捣一下Mac OS X下的Git代码管理,抛弃以往完全依赖工具界面的操作方式,完全采用shell的操作模式,加深理解。</p <p...

#Git
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··6 分钟

MySQL Cluster读写分离验证-Amoeba环境搭建

<p 对MySQL Cluster的学习还在继续,这次<a href="http://www.coderli.com"OneCoder</a是利用Amoeba搭建一个可读写分离、均衡负载的MySQL集群环境。</p <p 跟MySQL Cluster一样,安装的过程就是下载、解压、配置、启动。<br / Amoeba官...

#MySQL
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··8 分钟

MySQL Cluster 使用小测小结(3)-数据节点添加和数据分配

<p 继续<a href="http://www.coderli.com"OneCoder</a之前提出的要验证的问题,为了方便测试MySQL Cluster的数据分片功能,我们设置集群节点配置如下:</p <blockquote <p NoOfReplicas=1&nbsp;&nbsp;&nbsp;<br / Dat...

#MySQL
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··7 分钟

MySQL Cluster 使用小测小结(2)

<p 承接之前的初测,题目本来想叫深入测试的,不过想想太大了,就还叫使用的一个小结吧。</p <p 在扩充数据节点之前,<a href="http://www.coderli.com"OneCoder</a向数据库中又写入900w的数据,总量达到1kw。每批次写入20w的数据,写入时间大致如下:</p <blockqu...

#MySQL
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··16 分钟

MySQL Cluster 初用初测小结

<p 基于上篇搭建的环境,验证一些基本功能和性能需求。这里先说一下功能使用的问题。<a href="http://www.coderli.com"OneCoder</a也是第一次用。摸索着来,仅做一个记录。</p <p 从部署图就可知道,对数据库的请求操作发生在SQL节点上。为了达到试验效果,这里又追加了一个sql节点...

#MySQL
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··11 分钟

CentOS下 MySQL Cluster NDB 7.2 部署实践

<p 实验需要,<a href="http://www.coderli.com"OneCoder</a打算亲自部署一下MySQL Cluster环境。VMware环境中,虚拟化三台CentOS5.4 x64虚拟机。</p <blockquote <p 10.4.44.201 SQL<br / 10.4.44.202 D...

#MySQL
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··9 分钟

海量数据测试,利用数据库查询拷贝快速构造测试数据

这也是<a href="http://www.coderli.com"OneCoder</a在数据测试过程中遇到的问题,不一定有多少普试性,但是也许可以解决你的问题。 海量数据测试,数据导入一般是非常耗时的过程。<a href="http://www.coderli.com"OneCoder</a这里面对大约2T左右数...

#Hive
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··6 分钟

HBase利用bulk load批量导入数据

<a href="http://onecoder"OneCoder</a只是一个初学者,记录的只是自己的一个过程。不足之处还望指导。 看网上说导入大量数据,用bulk load的方式效率比较高。bulk load可以将固定格式的数据文件转换为HFile文件导入,当然也可以直接导入HFile文件。所以<a href="h...

#HBase
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··7 分钟

RESTful 接口规范

<a href="http://www.coder.com"OneCoder</a最近一直在使用Restful API,最近正好看到一篇自定义restful接口规范的&ldquo;抛砖引玉&rdquo;得的文章,索性翻译一下,与大家分享。 原文地址:<a href="http://java.dzone.com/arti...

#Restful
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··3 分钟

Eclipse4.2 Juno + Tomcat7.0.30启动Tomcat报APR版本错误问题解决

本来<a href="http://www.coderli.com"OneCoder</a是在一遍搭建一个J2EE的开发环境,一遍记录过程以跟大家分享。没想到这个过程中,遇到了很多细节的错误,考虑到如果和原来的主线任务文章混在一起,有点让人不知所措的感觉,所以<a href="http://www.coderli.co...

#Tomcat
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··4 分钟

OneCoder翻译-MySQL 的不良用法 Group By

<a href="http://www.coderli.com"OneCoder</a最近打算坚持每周左右至少翻译一篇技术文章,不管是从学习技术和学习英语的角度,对自己都会是一个提高。水平有限,如果您觉得翻译太过粗糙,甚至错误,还望不吝指出,<a href="http://www.coderli.com"OneCode...

#MySQL
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··2 分钟

Eclipse小技巧 增加JVM参数显示状态条

动手来为你的Eclipse增加一个能显示当前Eclipse使用的JVM配置的工具条吧。简单的很。 在eclipse根目录下建立一个文件,文件名options,不要加后缀直接保存,文件内容 修改eclipse目录下的eclipse.ini文件,在文件起始部分添加如下内容: 重启即可。

#Eclipse
Eclipse小技巧 增加JVM参数显示状态条
Python 与数据工程 · 技术实战··12 分钟

OneCoder翻译 每个程序员必知的知识,UniCode和字符集(下)

接上篇:《<a href="http://www.coderli.com/translate-unicode-encoding-partone/" target="blank"《OneCoder翻译 每个程序员必知的知识,UniCode和字符集(上)》</a - 原文地址:<a href="http://www.joe...

#Unicode
OneCoder翻译 每个程序员必知的知识,UniCode和字符集(下)
Python 与数据工程 · 技术实战··13 分钟

OneCoder翻译 每个程序员必知的知识,UniCode和字符集(上)

今天在处理了一个编码的问题,激发了笔者强烈的弄清编码问题的好奇心。遂先有了前面强烈推荐的文章:字符编码介绍 通俗易懂 强烈推荐。下面是上篇文章中提到的延伸阅读里,第一篇文章的翻译。水平有限,各位看官,勉强理解一下,错误之处还望指出。 - 原文地址:<a href="http://www.joelonsoftware.c...

#Unicode
OneCoder翻译 每个程序员必知的知识,UniCode和字符集(上)
Python 与数据工程 · 技术实战··2 分钟

方向,坚持和等待

转眼间工作两年有余。这两年多,很充实,收获很多。感谢一切帮助我的人。 一直非常喜欢钻研和学习,但是一直觉得自己需要一个明确的方向。否则,会事倍功半。有一本署名是自己的书,一直是我的理想。 昨天,有幸和《Java加密与解密的艺术》的作者<a href="http://snowolf.iteye.com/" target=...

#杂文
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··2 分钟

云计算开源产品推荐 - CloudStack项目简介

CloudStack是思杰(Citrix)旗下的一款开源的虚拟化环境管理软件。核心代码用Java开发。CloudStack的目标是成为一个可以部署并管理大量的虚拟机网络资源,具有高可用和扩展性的云计算管理平台。目前已经支持许多主流的虚拟化平台,如:VMware、Oracle VM、KVM、XenServer、Xen。C...

#CloudStack#云计算
🐍 PythonPython 与大数据
Python 与数据工程 · 技术实战··5 分钟

开发人员应留意的开源软件许可证简介

作为一个Java开发人员,开发中总会依赖很多的项目(jar包),一般来说这些项目大部分都是开源的,但是开源不等于随意使用甚至商用。开源软件都有着自己的许可证,不同的许可证自然约束也是不同的。稍不留神,可能会自讨苦吃。 先引用百度百科的开源软件的定义: <strong<a href="http://baike.baidu...

#GPL#开发协议
🐍 PythonPython 与大数据