数据湖(英語:data Lake)是指以檔案以其原始格式(如BLOB或檔案等)儲存的數據儲存庫或是系统 。数据湖多半會將所有的数据统一存储,包括源系统資料、感測器資料、社會資料等資料的原始副本,也包括用于、可视化、和机器学习等流程之转换后数据。数据湖也可能包括关系数据库的结构化数据(行与列)、半结构化的数据(CSV、日志、XML、 JSON)及非结构化数据 (电子邮件、文件、PDF)及二进制数据(图像、音频、视频)等。数据湖可能是「on premises」(指在組織的資料中心裡),也可能放在雲端(使用Amazon、微軟或是Google的雲端服務)。
构建不良的数据湖又称为数据沼泽。用户或是无法访问这样的数据湖,或是数据湖内的数据没什么价值。
背景
据称此术语由James Dixon为了与数据集市对比而提出,当时他是Pentaho的首席技术官。数据集市相对较小,包含从原始数据提取出来的有价值的属性。在推广数据湖的时候,他认为,数据集市有几个固有的问题,例如信息孤岛。普华永道称,数据湖可以"解决数据孤岛。" 在其数据湖研究中,他们指出,企业"开始使用一个单一的、基于Hadoop的存储库来存放和提取数据。"
Hortonworks, 谷歌, Oracle, Microsoft, Zaloni, 天睿动力的技术,Cloudera和亚马逊都有数据湖的产品。
示例
许多公司使用Azure Data Lake和 亚马逊云服务 Lake Formation之类的云存储服务,或者Apache Hadoop之类的分布式文件系统 学术界对于数据湖的兴趣也正在兴起。比如,Cardiff 大学的个人数据湖,它定位于管理个人大数据,提供收集,管理和分享个人数据的单一入口。
早期的数据湖(Hadoop 1.0)在批量数据处理方面能力有限,仅有(MapReduce) 这一个数据处理范式。数据湖的访问者必须具备用Java实现MapReduce的能力,以及掌握一些高层工具,比如Apache Pig和Apache Hive(他们本身是面向批处理的)。
批评
大多數情況下,管理不善的數據湖被稱為「數據沼澤」。
在2015年6月,David Needle表示"所谓的数据湖"是"一个(相比之下)更具争议性的方法来管理大数据"。
普华永道也在它们的研究中谨慎地指出,并不是所有的数据湖行动都是成功的。他们引用Sean Martin,剑桥语义的首席技术官的话:{{Cquote|我们看见顾客们创造大型数据坟场,把所有的数据都扔进 Hadoop distributed file system (HDFS) 里,希望以后能派上用场。但是数据从此就失去了踪迹。
最主要的挑战不是创造数据湖,而是能从中获益。
麥肯錫指出數據湖應該被視為一種在企業內部提供業務價值的服務模式,而不是技術成果。
参考文献
评论 (0)