星期二, 十一月 24, 2015
自夸
李舰和我合写的一本书在2015年的7月份上市了,今天来自推一下这本书。此书是面向于初学者,提供宽而浅的导论性质读物。
http://book.douban.com/subject/26576631/
数据科学是将数据转化为行动的艺术,是综合了统计学、计算机科学和领域知识的新兴学科。数据科学与很多传统学科的最大区别在于其为应用而生,因此本书一切从实际应用出发,以R语言为核心工具,介绍了各类分析方法的实现及其在各领域的应用情况。
如果是初学者,可以从“编程篇”开始阅读,了解R语言的基本特点。如果是程序员,在迅速掌握语法后,可以深入研究“模型篇”,学习如何用统计学和其他流行的分析方法来描绘复杂的数据世界。如果关心数据价值的落地,“应用篇”必不负你所望,金融、制药、文本挖掘、社交网络、地理信息、高性能计算、可重复研究,这些最热门的行业和应用领域的案例将会为你带来数据应用的最真实的体验。
本书适用于所有对数据应用感兴趣的读者,也适合作为统计和数据分析的实务操作型课程的教材。
星期六, 十月 11, 2014
python的数据科学资源
python和R是数据科学家手中两种最常用的工具,R已经介绍的太多了,后续我们来玩玩python吧。从出身来看,R是统计学家写的,python是计算机科学家写的,两者的出生背景不一样,随着数据爆发,python也慢慢发展,逐渐在数据科学中找到了一席之地。
包:
python也有非常多的扩展包,不过用于数据分析的并不象R那么品种繁多。常用的:
numpy:提供最基本的数值计算,使向量化计算成为可能。
scipy:提供了包括最优化在内的科学计算函数,不用自己写啦。
pandas:提供了类似dataframe的数据结构,处理表格数据非常方便。
matplotlib:画图必备,但用起来感觉不如ggplot2啊。
statsmodel:提供包括回归、检验等多种统计分析函数,python也能干R的活。
sklearn:数据挖掘必备,各种函数非常丰富,文档齐全,看得出CS出品就是不一样啊。
书:
python的数据方面书还不算很多,不过很有CS的味道,就是用show me the code,公式不多,这点我很喜欢。
现有可以找到的书基本上分为三类,一类是用基本语法实现统计分析和科学计算,例如下面的:
Think Stats
Think Bayes
Numerical Python
A Primer on Scientific Programming with Python
另一类是以介绍一些包为目的,带有一些案例,例如:
Introduction to Python for Econometrics, Statistics and Data Analysis
numpy begin guide
Python for Data Analysis
matplotlib cookbook
Learning scikit learn Machine Learning
python text processing with nltk 2.0 cookbook
Social Network Analysis for Startups
最后一类是专门讲数据挖掘、机器学习的书:
下面五本书都是讲如何用基本语料来实现机器学习算法的,非常有帮助
机器学习实战
集体智慧编程
Data Science from Scratch
Machine Learning in Python
Machine Learning An Algorithmic Perspective
如果是希望对理论有更多了解:
《数据挖掘导论》 作者:pang-Ning Tan
《统计学习方法》 李航
《The Elements of Statistical Learning》
吴恩达在cousera上的公开课
林轩田在cousera上的公开课
Notebook:
python的一大妙处就是ipython notebook,它可以把代码及其结果都存在一个网页上,方便分享学习。网上有非常多的notebook,其中成体系而又精彩的有下面三个:
https://github.com/datadave/GADS9-NYC-Spring2014-Lectures
http://blog.yhathq.com/posts/data-science-in-python-tutorial.html
http://slendermeans.org/pages/will-it-python.html
更多资源,请参见github上的一个列表
https://github.com/jonathan-bower/DataScienceResources
have fun!
包:
python也有非常多的扩展包,不过用于数据分析的并不象R那么品种繁多。常用的:
numpy:提供最基本的数值计算,使向量化计算成为可能。
scipy:提供了包括最优化在内的科学计算函数,不用自己写啦。
pandas:提供了类似dataframe的数据结构,处理表格数据非常方便。
matplotlib:画图必备,但用起来感觉不如ggplot2啊。
statsmodel:提供包括回归、检验等多种统计分析函数,python也能干R的活。
sklearn:数据挖掘必备,各种函数非常丰富,文档齐全,看得出CS出品就是不一样啊。
书:
python的数据方面书还不算很多,不过很有CS的味道,就是用show me the code,公式不多,这点我很喜欢。
现有可以找到的书基本上分为三类,一类是用基本语法实现统计分析和科学计算,例如下面的:
Think Stats
Think Bayes
Numerical Python
A Primer on Scientific Programming with Python
另一类是以介绍一些包为目的,带有一些案例,例如:
Introduction to Python for Econometrics, Statistics and Data Analysis
numpy begin guide
Python for Data Analysis
matplotlib cookbook
Learning scikit learn Machine Learning
python text processing with nltk 2.0 cookbook
Social Network Analysis for Startups
最后一类是专门讲数据挖掘、机器学习的书:
下面五本书都是讲如何用基本语料来实现机器学习算法的,非常有帮助
机器学习实战
集体智慧编程
Data Science from Scratch
Machine Learning in Python
Machine Learning An Algorithmic Perspective
下面三本都是应用了成熟的机器学习库
Building Machine Learning Systems with Python
mastering machine learning with scikit-learn
scikit-learn Cookbook
《数据挖掘导论》 作者:pang-Ning Tan
《统计学习方法》 李航
《The Elements of Statistical Learning》
吴恩达在cousera上的公开课
林轩田在cousera上的公开课
python的一大妙处就是ipython notebook,它可以把代码及其结果都存在一个网页上,方便分享学习。网上有非常多的notebook,其中成体系而又精彩的有下面三个:
https://github.com/datadave/GADS9-NYC-Spring2014-Lectures
http://blog.yhathq.com/posts/data-science-in-python-tutorial.html
http://slendermeans.org/pages/will-it-python.html
更多资源,请参见github上的一个列表
https://github.com/jonathan-bower/DataScienceResources
have fun!
星期三, 一月 29, 2014
《R语言与Bioconductor生物信息学应用》已经出版
《R语言与Bioconductor生物信息学应用》一书主要是使用R语言来解决生物信息学问题。主要作者是两位在生物信息学界有极深造诣的科研人士,高山和欧剑虹,这二位的博客地址如下:
http://blog.sciencenet.cn/u/gaoshannankai
http://pgfe.umassmed.edu/ou/
我本人也完成了其中部分章节的写作。此书的特点在于:
http://blog.sciencenet.cn/u/gaoshannankai
http://pgfe.umassmed.edu/ou/
我本人也完成了其中部分章节的写作。此书的特点在于:
- 从实际课题出发,提出解决这个问题的思路,结合用到的原理或基础知识,但更偏重整个解决问题的框架和流程,选用R这种简单易学但功能强大的语言,把讲解延伸到具体程序代码,让读者100%经历整个课题研究过程。
- 最大的创新点是:实际课题直接来作者发表的SCI文章,全部都是真枪实弹,不杜撰所谓“实际应用”。国内外尚未见到与SCI文章紧密结合的生物信息书籍。
- 本书是多名R领域专家(全部都是一线科研工作者)通过互联网联手写作。在前期网上调研的基础上,尽量在本书内突出大多数人普遍关心而又难找相关资料的问题。
- 所见即所得,学到的知识可以通过简单编程(仅仅代码拷贝粘贴)加以实现,印象深刻,学了不会忘。提出三板斧学习法,让无基础的人也能编程。
- 本书作者通过QQ群直接面向读者答疑,并且共享了大量的参考资料和习题答案。使用正版书籍的读者都可以入群享受最好的服务。不在书中罗列基础知识凑字数,也不使用光盘,既能减轻读者负担,又能保护环境。
星期日, 一月 19, 2014
一份数据挖掘小书评
书看得多了,渐渐有了品味,所以看那些英文版的时候也不再有很膜拜的感觉。不过再差的书,总会有些许长处或教训,值得借鉴。下面列出一些在数据挖掘实现方面的书,主要是基于R和python的。
- Data mining with R Learning with Case studies: 我的启蒙书,很好的案例教学,这种书应该出更多些。
- Data Mining Applications with R: 风格类似上面,多人合作的案例讲解,非常不错,就是每个例子略为简短了一点。
- Machine Learning for Hackers: 也是以案例为主,但是内容质量不能保持在同一水准上,代码讲的比较细。
- An Introduction to Statistical Learning: 比较系统的讲解了统计学习的内容,以及相应的R包函数,优点在于有习题。
- Machine Learning with R: 同样是系统的列出各机器学习算法对应的R包函数,直观理解很好,而且讲了一些caret包的使用。比较新的书。
- Applied predictive modeling: 对预测算法讲的最细,涉及R包最多,由于作者是caret的开发者,所以要学习caret则必看此书。
- Big Data Analytics with R and Hadoop: 刚出的大数据挖掘书籍,讲解了如何用RHadoop来整合R和hadoop,什么时候会有R和spark的书出来啊。
- programming_collective_intelligence: 有些年头的书了,但确实是经典,原理讲的简洁,就讲python代码实现,喜欢这种风格。
- Machine Learning in Action: 和上面风格类似,不过实现是主要基于python的numpy库,这样代码量要精简很多,也很好。
- Python for data analysis: 主要讲pandas库,精彩例子不多,可以直接去看帮助文档。
- Learning scikit-learn Machine Learning: 主要以scikit-learn扩展库为工具做机器学习,比较简单,可以直接去看帮助文档。
- Building Machine Learning Systems with Python: 和上面那本类似,讲函数功能为主,原理直觉没涉及到。
星期六, 五月 11, 2013
星期四, 二月 21, 2013
R语言资源
以前人的烦恼是没有书可读,现在人的烦恼是书太多了。关于R语言的书已经出版很多了,博主大约读过其中的四十多本,但是书在精,而不在多,学在透,而不在速。把有限的时间放到无限的书海中,这不是阅读的真意。本着造福学习者的角度,博主精选出十二本R书。什么是好书的标准?我以为是:有案例,有代码,有习题,有讲解,逻辑清楚,排版精良,体系完备,互有补充,内容千锤百炼,值得反复揣摩。书单均为英文版,都可以从网上找到。当然这份书单的选择是有主观偏见的。
星期六, 十二月 22, 2012
新书推荐:脏数据手册
当你学完一本数据分析软件教程,在电脑上做完了所有的练习题,志得意满地准备去处理实际问题时候,你会被真实世界的“脏数据”所震惊。例如那些随处可见的缺失和格式不一的数据会让分析工作举步维艰,但脏数据的陷阱远不止这些。初入数据江湖的白板青年很需要一本江湖经验手册来帮助成长,而《Bad Data Handbook》正好满足了这种需要。
该书由十九位江湖高手合力联手写成,作者包括了数据分析领域的数据科学家和统计学、物理学、经济学的学术专家,他们分享了自己在处理非常规数据问题的经验和技巧。例如对数据进行分析前的观察测试,如何处理棘手的表格数据,应付各种编码问题,进行网页数据抓取,处理文本数据,以及一些数据质量控制的方法。这些秘诀在一般的传统教科书上是难以见到的。正所谓江湖险恶,要行走数据江湖则必看此书。
星期五, 十二月 07, 2012
推荐两本python书
星期三, 十一月 21, 2012
新书推荐:数据之魅
在amazon书店里头,如果将统计类和数据挖掘类书籍除外的话,还真没有一本正经八百讲数据分析的书。不过《Data Analysis with Open Source Tools》倒是填补了这个空白。一般说到数据分析,可能要么是概念和公式推导居多,要么是软件教程和计算代码居多,这本书的写作风格和内容则大不一样,作者是以一种诚恳的态度在和你聊数据分析的事情,而不是以一种教科书的形式讲技术细节。它的重点在于作者的行业经验和心得。该书提出了很多很好的行业见解,而且知识覆盖范围极广,甚至包括了一些数据建模和BI的东西,不然也不会号称是程序员和数据科学家的指南手册了。
星期四, 十一月 01, 2012
果壳中的R第二版新鲜出炉
《R in Nutshell》是O'REILLY公司出版的果壳系列图书之一。该系列图书的特点是知识覆盖面广,讲解全面细致,索引、参考资料以及进一步阅读都包括在内,是非常难得的桌头参考书籍。 《R in Nutshell》也继承了该系列的特点,从简单的R入门知识、R语法、数据整理和可视化,到统计回归、机器学习均有涉及,还包括了代码优化、生物计算和Hadoop的相关内容。
之前统计之都团队正组织翻译出版此书,不过英文第二版正酝酿出来,所以翻译工作暂时停下来。近日在网上看到英文第二版终于出来了,抽时间翻看一下,发现改进不少。特地搬到网盘上供各位下载。
相对于第一版来说,新版本增加了两个完整的章节,即ggplot2绘图和Hadoop。这样使可视化部分终于完整的包括了基本绘图、Lattice包和ggplot2包。而且在大数据背景下,hadoop相关知识的引入也称得上是与时俱进。
新版本还修改完善部分代码,并重新安排了篇章结构。例如原来的第11章high-performance改写后成为了第24章optimizing R progrmas。
此外还增加了一些热门R包的介绍,例如plyr和reshape。在回归模型中则增加了弹性网glmnet。这样总页数从原来第一版的636增加到第二版的722。
总而言之,有此书在手则基本不需要其它的R语言资料了。不过对于新人仍建立先选用较薄的入门小册子。例如《R for beginners》和《R导论》,它们都有中文版。
星期日, 八月 19, 2012
新书推荐:数据新闻手册
如果你和我一样是数据爱好者,那么一定会经常造访卫报的数据博客栏目,去看看他们是如何用不同来源的数据制作有趣的新闻。你一定想知道,他们是如何提出问题的?如何采集数据?又如何整理和分析数据,并最终用可视化方法来展现到读者面前的。答案就在《数据新闻手册》这本书中。
星期五, 七月 13, 2012
O'Reilly新书推荐:用R和Ruby来探索万物
这本书绝对是个另类,它并不以严肃的学术研究或商业项目作为主题,而是以好玩为宗旨。用R和Ruby这两种免费工具,来探索我们身边的各种数据资源。
首先作者用两章篇幅对Ruby和R作了一个介绍。之后第三章来解决办公室内的洗手间数量问题,用Ruby来模拟人们上洗手间的次数,然后用R来绘制各种可能的情况。第四章建立了一个简单的经济动态系统,其中包括了生产者、消费者、价格和市场,并对这些因素进行了模拟。第五章比较有趣,作者用Ruby中的mail库获取了安然丑闻中的电邮数据,然后用R进行了电邮的时间分布描述和文本挖掘。最有Geek味道的是第六章,作者自制声频拾取器测量自己的心跳,并用Ruby来处理音频文件,最后用R绘制出了心跳波形,还分析了自己的心率数据。最后两章同样是模拟,简单模拟分析了生物迁徙和人类社会的进化。
这本书立意非常新奇有趣,但称不上非常有Discovery的感觉,因为它并非用大量的篇幅来介绍如何挖掘真实世界的数据,很多章节内容是用Ruby来进行动态模拟,然后用R中的ggplot2包来可视化展现。不过其中的第五章和第六章还是很精彩的。下载本书电子版
此外,如果想学习用R来抓取真实数据进行分析,我建议看这个小册子Data_Mashups_in_R
星期二, 五月 15, 2012
分享几本数据挖掘书籍
The Elements of Statistical Learning: Data Mining, Inference, and Prediction
广受推崇的统计学习书籍,重视理论基础,图文并茂,各种算法讲解清晰。但没有涉及实务中的问题,如特征选择。
星期一, 四月 23, 2012
星期三, 四月 18, 2012
30个免费数据资源网站
人们都喜欢听故事而不是看数字和公式,数据可视化可能是讲故事的终级神器。但这里有个前提条件,你首先得拥有数据。获取可靠的数据涉及到多个步骤,找到数据、整理清洁数据、转换为合适的格式等等。数据准备往往是数据分析工作中非常让人头疼的方面。随着全世界对数据资源的重视,现在有很多新的公开数据源可供研究者使用。下面就是visual.ly归纳的三十个免费的数据资源网站。本文进行了翻译和补充。
1 政府数据
- Data.gov:这是美国政府收集的数据资源。声称有多达40万个数据集,包括了原始数据和地理空间格式数据。使用这些数据集需要注意的是:你要进行必要的清理工作,因为许多数据是字符型的或是有缺失值。
- Socrata:它是探索政府相数据的另一个好地方。Socrata的一个了不起的地方是,他们有不错的可视化工具,使研究数据更为容易。
- 一些城市都有自己的数据门户网站设置,可供访问者浏览城市的相关数据。例如,在旧金山数据网站,你可以获得很多数据,从犯罪统计到城市的停车位。
- 联合国有关网站,例如世界卫生组织提供了丰富的数据资源,从死亡率到世界饥饿统计数字。
- 美国人口普查局也有相当多的生活数据,例如收入、种族、教育、人口和商业信息。
星期五, 三月 30, 2012
新书推荐:Machine Learning in Action
如果你经常阅读原版书籍,那你应该对那些印制精美的封面有很深刻的印象。例如O'Reilly的软件开发系列,都是采用最为简洁的黑白铜版画,主题是一两只珍稀动物。而另一家著名出版商Manning出的软件系列图书,封面上的图案均选自1799年初版于西班牙马德里的一本各地服装简编。这些丰富生动的图片表明了世界各个区域的独特个性。使用这种封面设计意在让这本简编中的图片重现于世,由此来庆祝计算机业的创意、进取和乐趣。
Manning的实战系列(IN ACTION),是为了使用户能快速上手,以解决实际中遇到的问题。基本上该系列书不大适合零基础的入门读者;目标读者是那些对书中知识有基础的了解,并有过简单的模仿实践,但是无法真正将该技术应用于实践的中初级读者。《Machine Learning in Action》正是这样一本中级进阶图书。它将基本的机器学习理论与实际的运用工具(Python)相结合。该书回避了复杂的数学原理(如果你需要机器学习背后的数学知识,可以参考The Elements of_Statistical Learning),提供了大量的案例和代码来实现各种机器学习算法。你可以略加改动就可以将这些代码用于数据处理、分析和可视化工作中。即使你不用Python也很有参考价值。
星期四, 三月 01, 2012
重磅推荐:《机器学习之黑客帝国》
好吧,我承认这个书名翻译的有点霸气,但它的确是配得上这个名头。《Machine Learning for Hackers》是由O'Reilly出版的关于机器学习领域中R语言应用的新书。 在这里所谓的“黑客”并非是喜欢侵入计算机的那帮人,而是那些“喜欢用新技术来解决问题”的人。而机器学习通常与数据挖掘、知识发现等术语一同使用,往往被认为是一个黑箱,它们广泛利用各种算法来进行数据预测或分类。
这本书利用了统计分析方法来打开这个黑箱,并解决现实生活中的预测和分类问题。该书并没有过分纠缠于公式与原理,也绝不仅是提供一个菜单式操作的傻瓜书。该书取中庸之道,以机器学习的原理应用为重点,结合大量R语言编程和案例,使读者更好地理解如何解决问题,以及为什么可以这样做。本书重点不仅覆盖了各种建模方法,而且而示范了真实的数据分析工作中会遇到的障碍,例如数据清理和转换。
这本书利用了统计分析方法来打开这个黑箱,并解决现实生活中的预测和分类问题。该书并没有过分纠缠于公式与原理,也绝不仅是提供一个菜单式操作的傻瓜书。该书取中庸之道,以机器学习的原理应用为重点,结合大量R语言编程和案例,使读者更好地理解如何解决问题,以及为什么可以这样做。本书重点不仅覆盖了各种建模方法,而且而示范了真实的数据分析工作中会遇到的障碍,例如数据清理和转换。
星期二, 二月 21, 2012
新书推荐:大数据时代的工具集
该书简要介绍了60多种大数据相关的工具,从NoSQL到MapReduce,以及各种机器学习和可视化工具。初看这本书封面的时候很容易被唬住,以为又是O'Reilly出的一本大作。实际上它只是一本超薄的小册子,或者更准确的说,是一篇超长的文章。对于业界专家来讲,这本书可能不值一晒,但对于想跨进Big Data大门的初学者,此书还是有一些参考价值。至于在哪可以得到这本书,你懂的。
星期五, 二月 03, 2012
星期六, 十二月 17, 2011
新书推荐:《Visualize This》
这是一个数据的时代,各种数据铺天盖地涌现出来,如何从中获取有用的信息?人类的大脑喜欢图形,因此将数据可视化或许是种方法。数据可视化是美学、数据分析和专业知识的结合,能以清晰简明而优美的方式讲述数据背后的故事。
如果你对数据可视化感兴趣,那么向你推荐Visualize This这本书。作者Nathan Yau是加州大学洛杉矶分校统计学博士生。同是也是flowingdata.com的创建者。
如果你对数据可视化感兴趣,那么向你推荐Visualize This这本书。作者Nathan Yau是加州大学洛杉矶分校统计学博士生。同是也是flowingdata.com的创建者。
订阅:
博文 (Atom)










