第一句子大全,网罗天下好句子,好文章尽在本站!

大数据中用于硬核数据分析最适合的语言和工具包

时间:2010-07-15

自1997年以来,作为昂贵的统计软件,如Matlab和SAS的免费替代品,它渐渐风靡全球

友情提示:本文共有 2740 个字,阅读大概需要 6 分钟。

在巨大的数据集中进行筛选的最好工具是什么?

R语言

在这些语言名单中,如果R语言排第二,那就没其他能排第一。自1997年以来,作为昂贵的统计软件,如Matlab和SAS的免费替代品,它渐渐风靡全球。

在过去的几年时间中,R语言已经成为了数据科学的宠儿——数据科学现在不仅仅在书呆子一样的统计学家中人尽皆知,而且也为华尔街交易员,生物学家,和硅谷开发者所家喻户晓。各种行业的公司,例如Google,Facebook,美国银行,以及纽约时报都使用R语言,R语言正在商业用途上持续蔓延和扩散。

R语言有着简单而明显的吸引力。使用R语言,只需要短短的几行代码,你就可以在复杂的数据集中筛选,通过先进的建模函数处理数据,以及创建平整的图形来代表数字。它被比喻为是Excel的一个极度活跃版本。

R语言最伟大的资本是已围绕它开发的充满活力的生态系统:R语言社区总是在不断地添加新的软件包和功能到它已经相当丰富的功能集中。据估计,超过200万的人使用R语言,并且最近的一次投票表明,R语言是迄今为止在科学数据中最流行的语言,被61%的受访者使用(其次是Python,39%)。

此外,它的身影也渐渐出现在了华尔街。以前,银行分析师会全神贯注于Excel文件直到深夜,但现在R语言被越来越多地用于金融建模R,特别是作为一种可视化工具,Niall O’Connor,美国银行的副总裁如是说。 “R语言使我们平凡的表格与众不同,”他说。

R语言的日渐成熟,使得它成为了数据建模的首选语言,虽然当企业需要生产大型产品时它的能力会变得有限,也有的人说这是因为它的地位正在被其他语言篡夺。

“R更适合于做一个草图和大概,而不是详细的构建,”Michael Driscoll,Metamarkets的首席执行官说。 “你不会在谷歌的网页排名以及Facebook的朋友推荐算法的核心找到R语言。工程师会用R语言做原型,然后移交给用Java或Python写的模型。”

话说回来,早在2010年,Paul Butler就以R语言打造了全球的Facebook地图而著名,这证明了该语言丰富的可视化功能。尽管他现在已经不像以前那样频繁地使用R语言了。

R正在一点点地过时,因为它的缓慢和处理大型数据集的笨重,那么,他使用什么代替呢?请继续阅往下看。

Python

如果说R语言是一个神经质又可爱的高手,那么Python是它随和又灵活的表兄弟。作为一种结合了R语言快速对复杂数据进行挖掘的能力并构建产品的更实用语言,Python迅速得到了主流的吸引力。Python是直观的,并且比R语言更易于学习,以及它的生态系统近年来急剧增长,使得它更能够用于先前为R语言保留的统计分析。

这是这个行业的进步。在过去的两年时间中,从R语言到Python已经发生了非常明显的转变,在数据处理中,在规模和复杂性之间往往会有一个权衡,于是Python成为了一种折中方案。IPython notebook和NumPy可以用作轻便工作的一种暂存器,而Python可以作为中等规模数据处理的强大工具。丰富的数据社区,也是Python的优势,因为可以提供了大量的工具包和功能。

美国银行使用Python在银行的基础架构中构建新的产品和接口,同时也用Python处理财务数据。Python广泛而灵活,因此人们趋之若鹜。

不过,它并非最高性能的语言,只能偶尔用于大规模的核心基础设施,Driscoll这样说道。

Julia

虽然当前的数据科学绝大多数是通过R语言,Python,Java,MatLab和SAS执行的。但依然有其他的语言存活于夹缝中,Julia就是值得一看的后起之秀。

业界普遍认为Julia过于晦涩难懂。但数据骇客在谈到它取代R和Python的潜力时会不由得眉飞色舞。Julia是一种高层次的,极度快速的表达性语言。它比R语言快,比Python更可扩展,且相当简单易学。

它正在一步步成长。最终,使用Julia,你就能够办到任何用R和Python可以做到的事情,但是至今为止,年轻人对Julia依然犹豫不前。Julia数据社区还处于早期阶段,要能够和R语言和Python竞争,它还需要添加更多的软件包和工具。

虽然年轻,但它正在掀起浪潮并且非常有前途,

JAVA

Java,以及基于Java的框架,被发现俨然成为了硅谷最大的那些高科技公司的骨骼支架。 如果你去看Twitter,LinkedIn和Facebook,那么你会发现,Java是它们所有数据工程基础设施的基础语言。

Java不能提供R和Python同样质量的可视化,并且它并非统计建模的最佳选择。但是,如果你移动到过去的原型制作并需要建立大型系统,那么Java往往是你的最佳选择。

hadoop 和 Hive

一群基于Java的工具被开发出来以满足数据处理的巨大需求。Hadoop作为首选的基于Java的框架用于批处理数据已经点燃了大家的热情。Hadoop比其他一些处理工具慢,但它出奇的准确,因此被广泛用于后端分析。它和Hive——一个基于查询并且运行在顶部的框架可以很好地结对工作。

Scala

Scala是另一种基于Java的语言,并且和Java相同的是,它正日益成为大规模机器学习,或构建高层次算法的工具。它富有表现力,并且还能够构建健壮的系统。

Java就像是建造时的钢铁,而Scala则像黏土,因为你之后可以将之放入窑内转变成钢铁。

Kafka 和 Storm

那么,当你需要快速实时的分析时又该怎么办呢?Kafka会成为你的好朋友。它大概5年前就已经出现了,但是直到最近才成为流处理的流行框架。

Kafka,诞生于LinkedIn内部,是一个超快速的查询消息系统。Kafka的缺点?好吧,它太快了。在实时操作时会导致自身出错,并且偶尔地会遗漏东西。

有精度和速度之间有一个权衡, “因此,硅谷所有的大型高科技公司都会使用两条管道:Kafka或Storm用于实时处理,然后Hadoop用于批处理系统,此时虽然是缓慢的但超级准确。”

Storm是用Scala编写的另一个框架,它在硅谷中因为流处理而受到了大量的青睐。它被Twitter纳入其中,勿庸置疑的,这样一来,Twitter就能在快速事件处理中得到巨大的裨益。

鼓励奖

MatLab

MatLab一直以来长盛不衰,尽管它要价不菲,但它仍然被广泛使用在一些非常特殊的领域:研究密集型机器学习,信号处理,图像识别,仅举几例。

Octave

Octave和MatLab非常相似,但它是免费的。不过,它在学术性信号处理圈子之外很少见到。

GO

GO是另一个正在掀起浪潮的后起之秀。它由Google开发,从C语言松散地派生,并在构建健壮基础设施上,正在赢得竞争对手,例如Java和Python的份额。

本文如果对你有帮助,请点赞收藏《大数据中用于硬核数据分析最适合的语言和工具包》,同时在此感谢原作者。

本内容不代表本网观点和政治立场,如有侵犯你的权益请联系我们处理。
网友评论
网友评论仅供其表达个人看法,并不表明网站立场。
相关阅读
为什么说Python是学习人工智能的第一语言?

为什么说Python是学习人工智能的第一语言?

...,提供了一种有效的MatLab开源替代方案。它也可以和图形工具包一起使用,如PyQt和wxPython。Matplotlib主要的作用就是强大的数据可视化~在做数据分析的时候可以用各种图表(条形图,散点图,条形图,饼图,堆叠图,3D图和地图图...

2024-01-04 #经典句子

自然语言理解

自然语言理解

...何用代码实现即可。3.3 代码实现gensim是一款开源的Python工具包,用于从非结构化文本中无监督地学习文本隐层的主题向量表示,支持包括TF-IDF、LSA、LDA和Word2Vec在内的多种主题模型算法,并提供了诸如相似度计算、信息检索等常...

2023-06-11 #经典句子

AI自然语言处理(NLP)领域常用的16个术语

AI自然语言处理(NLP)领域常用的16个术语

...种原因,目前NLU还远达不到人类的表现。13.自然语言处理工具包(NLT)在自然语言处理领域,NLT是最常使用的一个Python库,包含Python模块,数据集和教程等内容。14.TransformerTransformer是一个完全基于注意力机制的编解码器模型,它抛...

2023-01-22 #经典句子

百度NLP主任架构师全面讲解百度语义表示技术及最新进展

百度NLP主任架构师全面讲解百度语义表示技术及最新进展

...题模型整理为工业应用工具,对外开源了百度NLP主题模型工具包FAMILIA。3、基于DNN的语义表示技术:Word Embedding深度学习技术兴起,基于Word Embedding的表示占了主流,此类技术在各种NLP任务中也表现出色。从NNLM到现在BERT的技术,...

2023-12-23 #经典句子

解读AI手语翻译机的技术硬核

解读AI手语翻译机的技术硬核

...数据将达到9亿。与此同时,手语作为听障者使用较多的语言,能正确理解手语的健全人士却寥寥无几。5月16日,腾讯优图实验室联合深圳市信息无障碍研究会发布“优图AI手语翻译机”。据官方资料显示,用户通过面对翻译机摄...

2023-05-21 #经典句子

NLP中的文本分析和特征工程

NLP中的文本分析和特征工程

...没有一个通用的停止词列表。我们可以使用NLTK(自然语言工具包)为英语词汇创建一个通用停止词列表,它是一套用于符号和统计自然语言处理的库和程序。lst_stopwords = nltk.corpus.stopwords.words("english") lst_stopwords让我们删除第一个新...

2023-09-17 #经典句子

一文讲透“软件定义中台” 这可能是最硬核的中台建设方法论了

一文讲透“软件定义中台” 这可能是最硬核的中台建设方法论了

...智”。通过“上云”、“用数”、“赋智”,用很简洁的语言为企业的数字化转型指明了关键路径。更进一步,2020年8月, 国务院国资委颁布的《关于加快推进国有企业数字化转型工作的通知》更明确地提出需要探索和构建适应...

2016-03-15 #经典句子

你最关心的马蜂窝事件舆论全景图在这里 用文本挖掘一挖到底

你最关心的马蜂窝事件舆论全景图在这里 用文本挖掘一挖到底

...率较高的词汇,进行文本相似度计算。技术原理是用Python工具包Gensim跑多种主题算法。我们选取了“马蜂窝+数据造假”作为检索条件,按照「马蜂窝」「数据造假」的关联词的相关程度,从高到低排序。「承认」「指控」「维...

2017-06-27 #经典句子