标签:#Hadoop

共 14 篇文章

Cuneiform语言

Cuneiform是用于大规模科学数据分析的开源。 它是促进并行计算的静态类型的纯函数式编程语言。它的特征是有个全功能的,允许用户集成来自很多外部编程语言的软件。Cuneiform在组织层面上提供了一些设施,如条件分支和通用递归,使其具有图灵完备性。 概述 Cuneiform尝试拉近在科学工作流程系统如、或Galaxy,与大规模数据分析程序模型如MapReduce或Pig Latin之间的间隙,同时提供函数式编程语言的通用性。 Cune…

Giraph

Giraph 是一个迭代的系统。 Apache Giraph 是一个Apache项目,用于对大数据执行图形处理。 Giraph 的目的是为了解决大规模图的分布式计算问题,能够通过隐藏分布式和并行计算的细节以及提供一套用于描述图算法的 API。总的来说,Giraph 拥有了相对好的可扩展性,能够一定程度降低分布式图计算的使用门槛。 概述 Giraph 计算的输入是由点和两点之间直连的边所组成的图,例如,点可以表示人,边可以表示朋友请求。每…

Apache Beam

Apache Beam是一个开源统一编程模型,用于定义和执行数据处理管道,包括ETL、批处理和流(连续)处理。 Beam流水线是使用提供的SDK之一定义的,并在Beam支持的一个运行器(分布式处理后端)中执行,包括、Apache Flink、Apache Gearpump(孵化中)、、Apache Spark和Google Cloud Dataflow。 它被称为“大数据的超级API”。 历史 Apache Beam数据流模型基于以前关…

Trino

Trino 是一个 开源 的分布式 SQL 查询引擎。目的是能够快速方便地对分布存储在一个或多个异构数据源的大型数据集进行查询. Trino 不仅能够查询储存在不同的存储系统(如 HDFS、Amazon S3、谷歌云存储 或Microsoft Azure Blob 存储 或 格式存储的开源列式存储数据文件格式(如 或 )的数据湖。Trino 还能进行联邦查询,查询不同数据源(如 MySQL、PostgreSQL、Cassandra、Ka…

Deeplearning4j

Deeplearning4j是为Java和Java虚拟机编写的开源深度学习库,是广泛支持各种深度学习算法的运算框架。Deeplearning4j可以实施的技术包括受限玻尔兹曼机、深度置信网络、深度自动编码器、堆叠式降噪自动编码器、循环神经张量网络,以及word2vec、doc2vec和GloVe。这些算法全部包括分布式并行版本,与Hadoop和Spark集成。Skymind是Deeplearning4j的商业支持机构。 简介 Deepl…

MapR

MapR是一所美国企业管理软件公司、全球三大Hadoop开源大数据软件的提供商之一,总部位于美国加州圣何塞市,主要参与大数据的安全优化与开发、销售Apache Hadoop的衍生软件。MapR和Apache Hadoop一起参加过HBase、Apache Hive、Apache ZooKeeper等项目的研发。MAPR曾被亚马逊云服务选择为亚马逊弹性云EC2的升级版本。MapR称,目前为止该公司的付费认证客户总数已达500家。 MapR…

Apache HBase

HBase是一个开源的非关系型分布式数据库(NoSQL),它参考了谷歌的BigTable建模,实现的编程语言为 Java。它是Apache软件基金会的Hadoop项目的一部分,运行于HDFS文件系统之上,为 Hadoop 提供类似于BigTable 规模的服务。因此,它可以對稀疏文件提供極高的容錯率。 HBase在列上实现了BigTable论文提到的压缩算法、内存操作和布隆过滤器。HBase的表能够作为MapReduce任务的输入和输出…

Apache Hadoop

Apache Hadoop是一款支持數據密集型分佈式應用程序并以Apache 2.0許可協議發佈的開源軟體框架,有助于使用许多计算机组成的网络来解决数据、计算密集型的问题。基于MapReduce计算模型,它为大数据的分布式存储与处理提供了一个软件框架。所有的Hadoop模块都有一个基本假设,即硬件故障是常见情况,应该由框架自动处理。 Apache Hadoop的核心模块分为存储和计算模块,前者被称为Hadoop分布式文件系统(HDFS)…

Apache Spark

Apache Spark是一個開源叢集運算框架,最初是由加州大學柏克萊分校AMPLab所開發。相對於Hadoop的MapReduce會在執行完工作後將中介資料存放到磁碟中,Spark使用了記憶體內運算技術,能在資料尚未寫入硬碟時即在記憶體內分析運算。Spark在記憶體內執行程式的運算速度能做到比Hadoop MapReduce的運算速度快上100倍,即便是執行程式於硬碟時,Spark也能快上10倍速度。Spark允許用戶將資料加載至叢集…

Gremlin

Gremlin是Apache软件基金会下的Apache TinkerPop开发的图遍历语言和虚拟机。Gremlin适用于基于OLTP的图数据库以及基于OLAP的图处理器。Gremlin的函数式语言和自动机基础使Gremlin能够自然地支持指令式和声明式查询、主机语言不可知性、用户定义的领域特定语言、可扩展的编译器/优化器、单机和多机运行模型、混合深度和广度优先评估以及图灵完备性。 作为一个解释性的类比,Apache TinkerPop和…

Apache Sqoop

Apache Sqoop是用于在关系型数据库和Hadoop之间传输数据的开源工具。 该项目始于2009年,在2021年6月结束,并被移至Apache Attic。 概要 Sqoop支持增量更新,将新记录添加到最近一次的导出的数据源上,或者指定上次修改的时间戳。导入也可以填充Hive或HBase中的表。 导出则支持将Hadoop的数据放入关系数据库中。Sqoop得名于“SQL-to-Hadoop”。Sqoop于2012年3月成为顶级Apa…

Apache ZooKeeper

Apache ZooKeeper是Apache软件基金会的一个软件项目,它为大型分布式计算提供开源的分布式配置服务、同步服务和命名注册。 ZooKeeper曾经是Hadoop的一个子项目,但现在是一个独立的顶级项目。 ZooKeeper的架构通过冗余服务实现高可用性。因此,如果第一次无应答,客户端就可以询问另一台ZooKeeper主机。ZooKeeper节点将它们的数据存储于一个分层的命名空间,非常类似于一个文件系统或一个前缀树结构。客…

Presto (SQL查询引擎)

Presto是一种用于大数据的高性能分布式SQL查询引擎。其架构允许用户查询各种数据源,如Hadoop、AWS S3、Alluxio、MySQL、Cassandra、Kafka和MongoDB。甚至可以在单个查询中查询来自多个数据源的数据。Presto是Apache许可证下发布的社区驱动的开源软件。 历史 Presto最初是Facebook为数据分析师设计和开发的,用于在Apache Hadoop中的大型数据仓库上运行交互式查询。在Pr…

Apache Hive

Apache Hive是一个建立在Hadoop架构之上的数据仓库。它能够提供数据的精炼,查询和分析。Apache Hive起初由Facebook开发,目前也有其他公司使用和开发Apache Hive,例如Netflix等。亚马逊公司也开发了一个定制版本的Apache Hive,亚马逊网络服务包中的Amazon Elastic MapReduce包含了该定制版本。 [https://hive.apache.org/ hive]是基于Had…