大数据在各行各业中取得了迅猛发展,许多组织都被迫寻找新的创造性方法来管理和控制如此庞大的数据,当然这么做的目的不只是管理和控制数据,而是要分析和挖掘其中的价值,来促进业务的发展。着眼大数据,过去几年内产生了许多颠覆性技术,比如Hadoop、MongDB、Spark、Impala等,了解这些前沿技术还有助于你更好的把握大数据发展趋势。诚然,想了解一件事物,首先要了解与该事物有关的人。因此,要想了解大数据,光了解技术是远远不够的,本文中大数据领域的十个巨头,将有助于你更深入掌握大数据这个行业的发展形势。
大数据领域的十大开源技术
根据最新的思科全球云指数报告,预计到2017年年底,全球数据中心年均IP流量将达到7.7ZB。总体而言,数据中心IP流量在2012年到2017年之间将以25%的复合年均增长率(CAGR)增长。
现在增长的速度更快,而且组织需要依靠大量的数据集帮助它们运营、量化和发展业务。在过去几年里,大型数据库经历了从GB到TB再到PB级的发展过程。
此外,数据也不再是存储在一个地方,随着这些数据的增长以及云计算的发展,这些数据实现了分布式存储。
几乎所有行业都在发展大数据和数据科学
科学:大型强子对撞机每秒大约进行6亿次碰撞。因此,只有当传感器流数据小于0.001%的时候才有效,从四个大型强子对撞机实验中产生的数据意味着每年将产生25PB的数据(统计于2012年),此外备份还会产生大量数据,备份后的数据有可能达到200PB。
研究:美国航空航天局的气候模拟中心(NCCS)在其超级计算机平台上存储了约32PB的气候观测和模拟数据。