数据湖(Data Lakes)是AI基础设施的重要组成部分,使企业能够管理和存储大规模数据,以满足数据密集型AI模型的需求。
这份榜单聚焦于当前拥有最令人印象深刻、最庞大且最具创新性数据湖存储系统的公司,包括AWS、IBM和谷歌。
数据湖是一个集中式存储库,能够以原始格式保存海量数据,直至需要进行分析。与传统数据仓库要求数据在存储前进行结构化处理不同,数据湖可容纳来自各种来源的结构化、半结构化和非结构化数据。
本质上,这使得数据湖非常适合那些拥有海量数据资产,且在存储方面需要灵活解决方案的组织,即使他们不确定未来将如何利用这些数据。
到2025年,数据湖(Data Lakes)已成为AI公司的宠儿,没有海量数据,其技术便无法运行。近年来,"湖仓一体"架构的成熟对AI领域尤为重要,这种混合模型融合了数据湖的原始灵活性与数据仓库的事务完整性。
现代AI既需要巨大的规模,也需要可靠的数据保障,这是传统架构无法提供的组合。在这份榜单中,我们将深入探讨数据湖,并重点介绍一些在架构和应用方面的最佳范例。
10、Dremio
成立时间: 2015年
总部: 美国加利福尼亚州圣克拉拉
CEO: 森杜尔·塞拉库马尔
显著特点: 高性能SQL查询引擎,可直接在数据湖上查询数据,无需复制数据。
Dremio定位于"简便开放的湖仓一体平台",专注于直接在数据湖存储上实现快速性能,无需复杂的数据迁移。其突出特点是一个高性能SQL引擎,让商业智能分析师能够使用Tableau等熟悉工具访问数据。通过创建"优化数据物化视图",Dremio能够简化从原始数据到洞察的路径,挑战更复杂、依赖重型管道的架构,吸引那些优先考虑自助分析和速度的组织。

9、Teradata Vantage
成立时间: 1979年
总部: 美国加利福尼亚州圣地亚哥
CEO: 史蒂夫·麦克米伦
显著特点: 适用于混合云和数据湖分析的大规模并行处理架构。
作为传统数据仓库领域的巨头,Teradata通过Vantage平台实现了产品演进,该平台专为混合多云时代设计。通过合作,Vantage将其传奇的大规模并行处理引擎与Teradata的数据湖源集成,使其能够就地查询数据,无论数据位于本地还是云端。通过采用Apache Iceberg和Delta Lake等开放格式,Teradata能够为其庞大的企业客户群提供现代化分析路径,而无需放弃对其强大生态系统数十年的投入。

8、Oracle云基础设施数据湖 (OCI Data Lake)
成立时间: 2016年
总部: 美国德克萨斯州奥斯汀
CEO: 克莱·马古尔克 & 迈克·西西里亚
显著特点: 与Oracle自主数据仓库深度集成,提供统一的湖仓一体体验。
Oracle在企业级市场的深厚根基是其数据湖解决方案的重要部分,该方案构建在Oracle云基础设施之上。其优势在于与Oracle庞大产品组合(尤其是自主数据仓库)的无缝集成。这使得企业能够创建一个统一的数据平台,让数据从业务系统流入数据湖,再进入经过整理的分析环境。凭借批量和实时摄取工具、托管的Apache Spark服务以及深度AI/ML集成,OCI为其庞大的现有客户群提供了一个引人注目的全栈解决方案。

7、IBM watsonx.data
成立时间: 2023年
总部: 美国纽约州阿蒙克
CEO: 阿文德·克里希纳
显著特点: 基于开放湖仓一体架构构建的专用数据存储,专门用于扩展AI工作负载。
IBM的解决方案是专为AI时代打造的。Watsonx.data是一个基于开放湖仓一体架构构建的数据存储,旨在无论数据位于何处,都能扩展AI工作负载。其数据湖系统能够分离计算、存储和元数据,为各种混合云环境提供灵活性。通过集成Presto和Spark等多种查询引擎,并拥抱Iceberg等开放格式,IBM成功为商业智能以及企业级生成式AI所需的高要求数据准备和治理任务提供了统一的访问入口。

6、Cloudera数据平台(CDP)
成立时间: 2008年
总部: 美国加利福尼亚州圣克拉拉
CEO: 查尔斯·桑斯伯里
显著特点: 适用于混合多云环境的统一数据架构,提供一致的企业级安全与治理。
由大数据先驱Cloudera和Hortonworks合并而成的Cloudera数据平台,是混合云和本地数据湖领域最令人印象深刻的领导者之一。CDP提供了一个从私有数据中心延伸到公有云的统一数据架构,通过其共享数据体验提供一致的安全和治理。这使其成为金融和医疗等受严格监管的大型行业的首选平台,这些行业需要对数据(无论其物理位置如何)进行精细控制,同时仍能利用云原生分析。

5、谷歌云 BigLake
成立时间: 2022年
总部: 美国加利福尼亚州山景城
CEO: 桑达尔·皮查伊
显著特点: 用于多云分析的统一存储引擎,支持跨GCP、AWS和Azure查询,无需移动数据。
谷歌的BigLake是针对多格式、多云数据挑战的一个优雅解决方案。它作为一个统一的存储引擎,允许组织跨谷歌云、AWS和Azure分析数据,而无需移动或复制数据。通过将来自各种云对象存储和开放格式的数据呈现为统一表,BigLake使得能够使用BigQuery等熟悉工具进行强大的跨平台分析。这种方法提供了细粒度的安全性,并通过打破传统上隔离云数据生态系统的壁垒,加速了AI计划的推进。

4、微软 Azure Data Lake Storage
成立时间: 2019年
总部: 美国华盛顿州雷德蒙德
CEO: 萨提亚·纳德拉
显著特点: 专为大数据分析性能优化的分层命名空间,与整个Azure生态系统深度集成。
微软的Azure Data Lake Storage是深度融入Azure生态系统的企业的基础数据湖。它构建在Azure Blob存储之上,其关键创新是一个分层命名空间,极大地提升了大数据分析工作负载的性能。然而,ADLS不仅仅是一个存储层。它与整个Azure服务套件深度集成,包括Synapse Analytics、Databricks和Azure Machine Learning。这种紧密集成使其成为一个极其强大且可扩展的基础,用于在单一、统一的云环境中构建端到端AI应用。

3、Snowflake
成立时间: 2012年
总部: 美国蒙大拿州波兹曼
CEO: 斯里达尔·拉马斯瓦米
显著特点: 多集群共享数据架构,实现存储与计算解耦,提供近乎无限的并发扩展能力。
Snowflake以其云原生架构革新了数据仓库领域,目前正积极扩张以图主导数据湖领域。其平台巧妙地将存储与计算解耦,允许团队独立且并发地扩展资源,消除了资源争用。尽管历史上更偏向专有格式,但Snowflake正在迅速拥抱开放格式,其Snowpark产品允许数据科学家直接在数据上运行Python、Java和Scala代码。Snowflake以其简洁性、性能和强大的数据共享能力而闻名,正努力使自己成为组织所有数据的单一统一平台,从结构化商业智能到非结构化AI工作负载。

2、Databricks Delta Lake
成立时间: 2019年
总部: 美国加利福尼亚州旧金山
CEO: 阿里·戈德西
显著特点: 提供ACID事务和可扩展元数据管理的开源存储层,构成现代湖仓一体的基础。
源于Apache Spark的创造者,Databricks是我们所熟知的现代数据湖仓一体架构的设计师。其核心是Delta Lake,一个开源存储层,为存储在云对象存储中的数据带来ACID事务、可扩展的元数据管理和时间旅行功能。该系统将不可靠的数据湖转变为流处理和批量分析的单一可信源。Databricks平台专为要求最严苛的AI和机器学习工作负载而构建,为数据工程师和数据科学家提供了一个协作环境,用于大规模构建、训练和部署模型,同时倡导开放标准。

1、亚马逊云科技(AWS,S3 & Lake Formation)
成立时间: 2006年
总部: 美国华盛顿州西雅图
CEO: 马特·加尔曼
显著特点: 亚马逊S3基础对象存储与AWS Lake Formation的结合,提供简化、集中化的数据湖治理。
可以说,AWS是构建当今市场众多解决方案的基础层。在其基础设施上运行着超过一百万个数据湖(Data Lakes),亚马逊S3已成为云对象存储的事实标准,提供无与伦比的可扩展性、耐用性和成本效益。然而,真正的力量来自其周围的生态系统。AWS Lake Formation简化了构建、保护和治理数据湖的复杂任务,而诸如用于ETL的AWS Glue、用于无服务器查询的Athena以及用于机器学习的SageMaker等服务可无缝集成,共同打造了一个无与伦比的端到端数据与AI平台。

(素材来自:AI magazine 全球储能网、新能源网综合)
本文由智算芯能前沿网编辑整理,转载请注明出处。
