幾乎所有行業(yè)都在發(fā)展大數(shù)據(jù)和數(shù)據(jù)科學(xué)

責(zé)任編輯:editor004

2014-03-21 11:01:42

摘自:CSDN

根據(jù)最新的思科全球云指數(shù)報(bào)告,預(yù)計(jì)到2017年年底,全球數(shù)據(jù)中心年均IP流量將達(dá)到7.7ZB。數(shù)據(jù)也不再是存儲在一個地方,隨著這些數(shù)據(jù)的增長以及云計(jì)算的發(fā)展,這些數(shù)據(jù)實(shí)現(xiàn)了分布式存儲。

根據(jù)最新的思科全球云指數(shù)報(bào)告,預(yù)計(jì)到2017年年底,全球數(shù)據(jù)中心年均IP流量將達(dá)到7.7ZB??傮w而言,數(shù)據(jù)中心IP流量在2012年到2017年之間將以25%的復(fù)合年均增長率(CAGR)增長。

現(xiàn)在增長的速度更快,而且組織需要依靠大量的數(shù)據(jù)集幫助它們運(yùn)營、量化和發(fā)展業(yè)務(wù)。在過去幾年里,大型數(shù)據(jù)庫經(jīng)歷了從GB到TB再到PB級的發(fā)展過程。

此外,數(shù)據(jù)也不再是存儲在一個地方,隨著這些數(shù)據(jù)的增長以及云計(jì)算的發(fā)展,這些數(shù)據(jù)實(shí)現(xiàn)了分布式存儲。

幾乎所有行業(yè)都在發(fā)展大數(shù)據(jù)和數(shù)據(jù)科學(xué)

科學(xué):大型強(qiáng)子對撞機(jī)每秒大約進(jìn)行6億次碰撞。因此,只有當(dāng)傳感器流數(shù)據(jù)小于0.001%的時(shí)候才有效,從四個大型強(qiáng)子對撞機(jī)實(shí)驗(yàn)中產(chǎn)生的數(shù)據(jù)意味著每年將產(chǎn)生25PB的數(shù)據(jù)(統(tǒng)計(jì)于2012年),此外備份還會產(chǎn)生大量數(shù)據(jù),備份后的數(shù)據(jù)有可能達(dá)到200PB。研究:美國航空航天局的氣候模擬中心(NCCS)在其超級計(jì)算機(jī)平臺上存儲了約32PB的氣候觀測和模擬數(shù)據(jù)。私有/公共:亞馬遜每天處理的后端操作達(dá)數(shù)百萬,此外還有超過50萬個第3方賣家的查詢操作。亞馬遜的核心技術(shù)運(yùn)行在基于Linux的數(shù)據(jù)庫系統(tǒng)上,截至2005年,亞馬遜擁有世界上三個最大的Linux數(shù)據(jù)庫,容量分別達(dá)到了7.8TB、18.5TB、24.7TB。

組織被迫尋找新的創(chuàng)造性方法來管理和控制如此龐大的數(shù)據(jù),目的不只是為了整理數(shù)據(jù),而是要分析和挖掘數(shù)據(jù)來進(jìn)一步發(fā)展業(yè)務(wù),因此,一些開源大數(shù)據(jù)技術(shù)值得考慮:

Apache HBase:這個大數(shù)據(jù)管理平臺建立在谷歌強(qiáng)大的BigTable管理引擎基礎(chǔ)上。作為具有開源、Java編碼、分布式多個優(yōu)勢的數(shù)據(jù)庫,Hbase最初被設(shè)計(jì)應(yīng)用于Hadoop平臺,而這一強(qiáng)大的數(shù)據(jù)管理工具,也被Facebook采用,用于管理消息平臺的龐大數(shù)據(jù)。

Apache Storm:用于處理高速、大型數(shù)據(jù)流的分布式實(shí)時(shí)計(jì)算系統(tǒng)。Storm為Apache Hadoop添加了可靠的實(shí)時(shí)數(shù)據(jù)處理功能,同時(shí)還增加了低延遲的儀表板、安全警報(bào),改進(jìn)了原有的操作方式,幫助企業(yè)更有效率地捕獲商業(yè)機(jī)會、發(fā)展新業(yè)務(wù)。

Apache Spark:該技術(shù)采用內(nèi)存計(jì)算,從多迭代批量處理出發(fā),允許將數(shù)據(jù)載入內(nèi)存做反復(fù)查詢,此外還融合數(shù)據(jù)倉庫、流處理和圖計(jì)算等多種計(jì)算范式,Spark用Scala語言實(shí)現(xiàn),構(gòu)建在HDFS上,能與Hadoop很好的結(jié)合,而且運(yùn)行速度比MapReduce快100倍。

Apache Hadoop:該技術(shù)迅速成為了大數(shù)據(jù)管理標(biāo)準(zhǔn)之一。當(dāng)它被用來管理大型數(shù)據(jù)集時(shí),對于復(fù)雜的分布式應(yīng)用,Hadoop體現(xiàn)出了非常好的性能,平臺的靈活性使它可以運(yùn)行在商用硬件系統(tǒng),它還可以輕松地集成結(jié)構(gòu)化、半結(jié)構(gòu)化和甚至非結(jié)構(gòu)化數(shù)據(jù)集。

Apache Drill:你有多大的數(shù)據(jù)集?其實(shí)無論你有多大的數(shù)據(jù)集,Drill都能輕松應(yīng)對。通過支持HBase、Cassandra和MongoDB,Drill建立了交互式分析平臺,允許大規(guī)模數(shù)據(jù)吞吐,而且能很快得出結(jié)果。

Apache Sqoop:也許你的數(shù)據(jù)現(xiàn)在還被鎖定于舊系統(tǒng)中,Sqoop可以幫你解決這個問題。這一平臺采用并發(fā)連接,可以將數(shù)據(jù)從關(guān)系數(shù)據(jù)庫系統(tǒng)方便地轉(zhuǎn)移到Hadoop中,可以自定義數(shù)據(jù)類型以及元數(shù)據(jù)傳播的映射。事實(shí)上,你還可以將數(shù)據(jù)(如新的數(shù)據(jù))導(dǎo)入到HDFS、Hive和Hbase中。

Apache Giraph:這是功能強(qiáng)大的圖形處理平臺,具有很好可擴(kuò)展性和可用性。該技術(shù)已經(jīng)被Facebook采用,Giraph可以運(yùn)行在Hadoop環(huán)境中,可以將它直接部署到現(xiàn)有的Hadoop系統(tǒng)中。通過這種方式,你可以得到強(qiáng)大的分布式作圖能力,同時(shí)還能利用上現(xiàn)有的大數(shù)據(jù)處理引擎。

Cloudera Impala:Impala模型也可以部署在你現(xiàn)有的Hadoop群集上,監(jiān)視所有的查詢。該技術(shù)和MapReduce一樣,具有強(qiáng)大的批處理能力,而且Impala對于實(shí)時(shí)的SQL查詢也有很好的效果,通過高效的SQL查詢,你可以很快的了解到大數(shù)據(jù)平臺上的數(shù)據(jù)。

Gephi:它可以用來對信息進(jìn)行關(guān)聯(lián)和量化處理,通過為數(shù)據(jù)創(chuàng)建功能強(qiáng)大的可視化效果,你可以從數(shù)據(jù)中得到不一樣的洞察力。Gephi已經(jīng)支持多個圖表類型,而且可以在具有上百萬個節(jié)點(diǎn)的大型網(wǎng)絡(luò)上運(yùn)行。Gephi具有活躍的用戶社區(qū),Gephi還提供了大量的插件,可以和現(xiàn)有系統(tǒng)完美的集成到一起,它還可以對復(fù)雜的IT連接、分布式系統(tǒng)中各個節(jié)點(diǎn)、數(shù)據(jù)流等信息進(jìn)行可視化分析。

MongoDB:這個堅(jiān)實(shí)的平臺一直被很多組織推崇,它在大數(shù)據(jù)管理上有極好的性能。MongoDB最初是由DoubleClick公司的員工創(chuàng)建,現(xiàn)在該技術(shù)已經(jīng)被廣泛的應(yīng)用于大數(shù)據(jù)管理。MongoDB是一個應(yīng)用開源技術(shù)開發(fā)的NoSQL數(shù)據(jù)庫,可以用于在JSON這樣的平臺上存儲和處理數(shù)據(jù)。目前,紐約時(shí)報(bào)、Craigslist以及眾多企業(yè)都采用了MongoDB,幫助他們管理大型數(shù)據(jù)集。(Couchbase服務(wù)器也作為一個參考)。

在我們這個DOD(data-on-demand)社會,每天都有大量的數(shù)據(jù)產(chǎn)生,并且大量的數(shù)據(jù)被收集在主要IT系統(tǒng)中。無論是社交媒體的照片還是國際商店交易信息,大量高質(zhì)量、可量化的數(shù)據(jù)每天都在爆炸性增加,應(yīng)對的唯一方法就是快速部署一個高效的管理方案。

切記,除了要對數(shù)據(jù)進(jìn)行快速的分類和組織,IT管理人員必須具有挖掘信息并將其應(yīng)用到業(yè)務(wù)中的能力。商業(yè)智能和數(shù)據(jù)量化背后的科學(xué)將繼續(xù)發(fā)展和擴(kuò)大,企業(yè)取得競爭優(yōu)勢的關(guān)鍵在于能否對它們的數(shù)據(jù)進(jìn)行很好的管理。

歷數(shù)大數(shù)據(jù)領(lǐng)域不可忽視的十大巨頭

Amazon Web Services

Forrester稱EMR有很好的市場前景。很多公司基于EMR為客戶提供服務(wù),有一些公司將EMR應(yīng)用于數(shù)據(jù)查詢、建模、集成和管理。而且AWS還在創(chuàng)新,F(xiàn)orrester稱未來EMR可以基于工作量的需要自動縮放調(diào)整大小。亞馬遜計(jì)劃為其產(chǎn)品和服務(wù)提供更強(qiáng)大的EMR支持,包括它的RedShift數(shù)據(jù)倉庫、新公布的Kenesis實(shí)時(shí)處理引擎以及計(jì)劃中的NoSQL數(shù)據(jù)庫和商業(yè)智能工具。不過AWS還沒有自己的Hadoop發(fā)行版。

Cloudera

Hortonworks

IBM

Intel

MapR Technologies

Microsoft

微軟也有一些其他的項(xiàng)目,包括名為Polybase的項(xiàng)目,讓Hadoop查詢實(shí)現(xiàn)了SQLServer查詢的一些功能。Forrester說:“微軟在數(shù)據(jù)庫、數(shù)據(jù)倉庫、云、OLAP、BI、電子表格(包括PowerPivot)、協(xié)作和開發(fā)工具市場上有很大優(yōu)勢,而且微軟擁有龐大的用戶群,但要在Hadoop這個領(lǐng)域成為行業(yè)領(lǐng)導(dǎo)者還有很遠(yuǎn)的路要走。”

Pivotal Software

Teradata

AMPLab

鏈接已復(fù)制,快去分享吧

企業(yè)網(wǎng)版權(quán)所有?2010-2024 京ICP備09108050號-6京公網(wǎng)安備 11010502049343號