国产一区二区免费在线视频,九一免版日本黄色一级片,午夜av免费观看

幾乎所有行業(yè)都在發(fā)展大數(shù)據(jù)和數(shù)據(jù)科學(xué)

責(zé)任編輯：editor004

2014-03-21 11:01:42

摘自：CSDN

根據(jù)最新的思科全球云指數(shù)報(bào)告，預(yù)計(jì)到2017年年底，全球數(shù)據(jù)中心年均IP流量將達(dá)到7.7ZB。數(shù)據(jù)也不再是存儲在一個地方，隨著這些數(shù)據(jù)的增長以及云計(jì)算的發(fā)展，這些數(shù)據(jù)實(shí)現(xiàn)了分布式存儲。

根據(jù)最新的思科全球云指數(shù)報(bào)告，預(yù)計(jì)到2017年年底，全球數(shù)據(jù)中心年均IP流量將達(dá)到7.7ZB?？傮w而言，數(shù)據(jù)中心IP流量在2012年到2017年之間將以25%的復(fù)合年均增長率（CAGR）增長。

現(xiàn)在增長的速度更快，而且組織需要依靠大量的數(shù)據(jù)集幫助它們運(yùn)營、量化和發(fā)展業(yè)務(wù)。在過去幾年里，大型數(shù)據(jù)庫經(jīng)歷了從GB到TB再到PB級的發(fā)展過程。

此外，數(shù)據(jù)也不再是存儲在一個地方，隨著這些數(shù)據(jù)的增長以及云計(jì)算的發(fā)展，這些數(shù)據(jù)實(shí)現(xiàn)了分布式存儲。

幾乎所有行業(yè)都在發(fā)展大數(shù)據(jù)和數(shù)據(jù)科學(xué)

科學(xué)：大型強(qiáng)子對撞機(jī)每秒大約進(jìn)行6億次碰撞。因此，只有當(dāng)傳感器流數(shù)據(jù)小于0.001%的時(shí)候才有效，從四個大型強(qiáng)子對撞機(jī)實(shí)驗(yàn)中產(chǎn)生的數(shù)據(jù)意味著每年將產(chǎn)生25PB的數(shù)據(jù)（統(tǒng)計(jì)于2012年），此外備份還會產(chǎn)生大量數(shù)據(jù)，備份后的數(shù)據(jù)有可能達(dá)到200PB。研究：美國航空航天局的氣候模擬中心（NCCS）在其超級計(jì)算機(jī)平臺上存儲了約32PB的氣候觀測和模擬數(shù)據(jù)。私有/公共：亞馬遜每天處理的后端操作達(dá)數(shù)百萬，此外還有超過50萬個第3方賣家的查詢操作。亞馬遜的核心技術(shù)運(yùn)行在基于Linux的數(shù)據(jù)庫系統(tǒng)上，截至2005年，亞馬遜擁有世界上三個最大的Linux數(shù)據(jù)庫，容量分別達(dá)到了7.8TB、18.5TB、24.7TB。

組織被迫尋找新的創(chuàng)造性方法來管理和控制如此龐大的數(shù)據(jù)，目的不只是為了整理數(shù)據(jù)，而是要分析和挖掘數(shù)據(jù)來進(jìn)一步發(fā)展業(yè)務(wù)，因此，一些開源大數(shù)據(jù)技術(shù)值得考慮：

Apache HBase：這個大數(shù)據(jù)管理平臺建立在谷歌強(qiáng)大的BigTable管理引擎基礎(chǔ)上。作為具有開源、Java編碼、分布式多個優(yōu)勢的數(shù)據(jù)庫，Hbase最初被設(shè)計(jì)應(yīng)用于Hadoop平臺，而這一強(qiáng)大的數(shù)據(jù)管理工具，也被Facebook采用，用于管理消息平臺的龐大數(shù)據(jù)。

Apache Storm：用于處理高速、大型數(shù)據(jù)流的分布式實(shí)時(shí)計(jì)算系統(tǒng)。Storm為Apache Hadoop添加了可靠的實(shí)時(shí)數(shù)據(jù)處理功能，同時(shí)還增加了低延遲的儀表板、安全警報(bào)，改進(jìn)了原有的操作方式，幫助企業(yè)更有效率地捕獲商業(yè)機(jī)會、發(fā)展新業(yè)務(wù)。

Apache Spark：該技術(shù)采用內(nèi)存計(jì)算，從多迭代批量處理出發(fā)，允許將數(shù)據(jù)載入內(nèi)存做反復(fù)查詢，此外還融合數(shù)據(jù)倉庫、流處理和圖計(jì)算等多種計(jì)算范式，Spark用Scala語言實(shí)現(xiàn)，構(gòu)建在HDFS上，能與Hadoop很好的結(jié)合，而且運(yùn)行速度比MapReduce快100倍。

Apache Hadoop：該技術(shù)迅速成為了大數(shù)據(jù)管理標(biāo)準(zhǔn)之一。當(dāng)它被用來管理大型數(shù)據(jù)集時(shí)，對于復(fù)雜的分布式應(yīng)用，Hadoop體現(xiàn)出了非常好的性能，平臺的靈活性使它可以運(yùn)行在商用硬件系統(tǒng)，它還可以輕松地集成結(jié)構(gòu)化、半結(jié)構(gòu)化和甚至非結(jié)構(gòu)化數(shù)據(jù)集。

Apache Drill：你有多大的數(shù)據(jù)集？其實(shí)無論你有多大的數(shù)據(jù)集，Drill都能輕松應(yīng)對。通過支持HBase、Cassandra和MongoDB，Drill建立了交互式分析平臺，允許大規(guī)模數(shù)據(jù)吞吐，而且能很快得出結(jié)果。

Apache Sqoop：也許你的數(shù)據(jù)現(xiàn)在還被鎖定于舊系統(tǒng)中，Sqoop可以幫你解決這個問題。這一平臺采用并發(fā)連接，可以將數(shù)據(jù)從關(guān)系數(shù)據(jù)庫系統(tǒng)方便地轉(zhuǎn)移到Hadoop中，可以自定義數(shù)據(jù)類型以及元數(shù)據(jù)傳播的映射。事實(shí)上，你還可以將數(shù)據(jù)（如新的數(shù)據(jù)）導(dǎo)入到HDFS、Hive和Hbase中。

Apache Giraph：這是功能強(qiáng)大的圖形處理平臺，具有很好可擴(kuò)展性和可用性。該技術(shù)已經(jīng)被Facebook采用，Giraph可以運(yùn)行在Hadoop環(huán)境中，可以將它直接部署到現(xiàn)有的Hadoop系統(tǒng)中。通過這種方式，你可以得到強(qiáng)大的分布式作圖能力，同時(shí)還能利用上現(xiàn)有的大數(shù)據(jù)處理引擎。

Cloudera Impala：Impala模型也可以部署在你現(xiàn)有的Hadoop群集上，監(jiān)視所有的查詢。該技術(shù)和MapReduce一樣，具有強(qiáng)大的批處理能力，而且Impala對于實(shí)時(shí)的SQL查詢也有很好的效果，通過高效的SQL查詢，你可以很快的了解到大數(shù)據(jù)平臺上的數(shù)據(jù)。

Gephi：它可以用來對信息進(jìn)行關(guān)聯(lián)和量化處理，通過為數(shù)據(jù)創(chuàng)建功能強(qiáng)大的可視化效果，你可以從數(shù)據(jù)中得到不一樣的洞察力。Gephi已經(jīng)支持多個圖表類型，而且可以在具有上百萬個節(jié)點(diǎn)的大型網(wǎng)絡(luò)上運(yùn)行。Gephi具有活躍的用戶社區(qū)，Gephi還提供了大量的插件，可以和現(xiàn)有系統(tǒng)完美的集成到一起，它還可以對復(fù)雜的IT連接、分布式系統(tǒng)中各個節(jié)點(diǎn)、數(shù)據(jù)流等信息進(jìn)行可視化分析。

MongoDB：這個堅(jiān)實(shí)的平臺一直被很多組織推崇，它在大數(shù)據(jù)管理上有極好的性能。MongoDB最初是由DoubleClick公司的員工創(chuàng)建，現(xiàn)在該技術(shù)已經(jīng)被廣泛的應(yīng)用于大數(shù)據(jù)管理。MongoDB是一個應(yīng)用開源技術(shù)開發(fā)的NoSQL數(shù)據(jù)庫，可以用于在JSON這樣的平臺上存儲和處理數(shù)據(jù)。目前，紐約時(shí)報(bào)、Craigslist以及眾多企業(yè)都采用了MongoDB，幫助他們管理大型數(shù)據(jù)集。（Couchbase服務(wù)器也作為一個參考）。

在我們這個DOD（data-on-demand）社會，每天都有大量的數(shù)據(jù)產(chǎn)生，并且大量的數(shù)據(jù)被收集在主要IT系統(tǒng)中。無論是社交媒體的照片還是國際商店交易信息，大量高質(zhì)量、可量化的數(shù)據(jù)每天都在爆炸性增加，應(yīng)對的唯一方法就是快速部署一個高效的管理方案。

切記，除了要對數(shù)據(jù)進(jìn)行快速的分類和組織，IT管理人員必須具有挖掘信息并將其應(yīng)用到業(yè)務(wù)中的能力。商業(yè)智能和數(shù)據(jù)量化背后的科學(xué)將繼續(xù)發(fā)展和擴(kuò)大，企業(yè)取得競爭優(yōu)勢的關(guān)鍵在于能否對它們的數(shù)據(jù)進(jìn)行很好的管理。

歷數(shù)大數(shù)據(jù)領(lǐng)域不可忽視的十大巨頭

Amazon Web Services

Forrester稱EMR有很好的市場前景。很多公司基于EMR為客戶提供服務(wù)，有一些公司將EMR應(yīng)用于數(shù)據(jù)查詢、建模、集成和管理。而且AWS還在創(chuàng)新，F(xiàn)orrester稱未來EMR可以基于工作量的需要自動縮放調(diào)整大小。亞馬遜計(jì)劃為其產(chǎn)品和服務(wù)提供更強(qiáng)大的EMR支持，包括它的RedShift數(shù)據(jù)倉庫、新公布的Kenesis實(shí)時(shí)處理引擎以及計(jì)劃中的NoSQL數(shù)據(jù)庫和商業(yè)智能工具。不過AWS還沒有自己的Hadoop發(fā)行版。

Cloudera

Hortonworks

IBM

Intel

MapR Technologies

Microsoft

微軟也有一些其他的項(xiàng)目，包括名為Polybase的項(xiàng)目，讓Hadoop查詢實(shí)現(xiàn)了SQLServer查詢的一些功能。Forrester說：“微軟在數(shù)據(jù)庫、數(shù)據(jù)倉庫、云、OLAP、BI、電子表格（包括PowerPivot）、協(xié)作和開發(fā)工具市場上有很大優(yōu)勢，而且微軟擁有龐大的用戶群，但要在Hadoop這個領(lǐng)域成為行業(yè)領(lǐng)導(dǎo)者還有很遠(yuǎn)的路要走。”

Pivotal Software

Teradata

AMPLab

Hadoop SQL技術(shù) 大數(shù)據(jù) Redshift