在上周的数据+AI峰会上,Databricks发布了数据湖事务分析处理(LTAP),一种旨在将运营和分析工作负载统一到单一数据副本上的新架构。该公告体现Databricks关注的企业日益面临的挑战:让AI应用在不依赖日益复杂的数据管道的情况下,同时访问运营数据和分析数据。
![]()
传统架构通常依赖运营数据库、分析平台和数据管道协同工作——但作为各自独立的系统。Databricks表示,随着AI智能体和应用对事务数据和分析数据的访问速度要求越来越高,这种方案正变得日益困难。
"数十年来,复杂的数据基础设施是团队被迫缴纳的负担税。"Databricks联合创始人兼CEO Ali Ghodsi说。"然后智能体来了。几个月内,组织实际上将劳动力翻了一番,只是增加的不是人类。智能体以人类团队从未有过的速度编写代码、拨打电话、运行循环。驱动上一个计算时代的基础设施现在成了谁也承受不起的瓶颈。LTAP消除了它。"
Databricks Lakebase和Neon产品管理总监Brian Clark解释了为什么公司认为运营系统与分析系统之间的更紧密集成已成为AI时代的必需,而不仅仅是一种架构偏好。
在Databricks的大部分历史中,公司专注于分析和数据工程。近期大量重心放在AI上。然而,运营数据库始终游离于平台之外,通常由第三方系统处理,通过管道和集成将数据输入分析环境。
![]()
Clark表示,随着客户将AI应用推向生产环境,Databricks越来越看到该模式的局限性。
"当数据库始终存在于合作伙伴空间中时,这是不可行的。"Clark说,运营系统与分析系统之间需要更紧密集成。
据Clark介绍,随着组织超越仪表板和批处理分析转向生产AI工作负载,运营数据库变得越来越重要。Databricks的回应是更深入地扩展到应用基础设施领域。公司引入了服务级别协议、机器学习端点和旨在支持运营用例的能力。
"整个技术栈正在走向生产化,"Clark说。
因此,Databricks得出结论:运营数据库不能再作为松散连接的外部组件存在。相反,它们需要成为更广泛平台架构的一部分,尤其是因为AI应用越来越依赖事务数据和分析数据。
挑战不仅在于运营系统与分析系统是分离的,更在于连接它们日益增长的复杂性。
"传统方法往往创建大量管道来移动数据。"Clark说。随着组织在运营数据库、分析平台、ML系统和其他应用之间移动数据,这些连接会变得日益难以管理。据Clark介绍,随着AI加速开发周期,挑战变得更加严峻。
"当你把数据从数据湖(Lakebase)移到湖屋(lakehouse),再回到其他系统、一个ML管道,你有所有这些不同的东西,当智能体参与进来加速开发时,模式会变化、管道会断裂,而且断裂得比以前更快。"Clark说。
Databricks认为LTAP可以通过最小化独立系统间的数据移动需求来帮助解决这些问题。Clark表示,目标是创建"不需要管道的默认模式。"
![]()
"我们将有不需要管道的默认模式。比如这些数据会自动存在于你的湖屋中,你不需要做任何事来管理它,"Clark说。
Clark表示,AI智能体也在创造新的基础设施需求,包括在隔离的数据库环境中工作的能力。
"智能体喜欢分支,因为它本质上是一个隔离环境,"Clark说。"你可以拿一个数据库,创建一个分支,这是一个完整的副本。"
据Clark介绍,这些隔离环境允许智能体在不影响生产工作负载的情况下进行实验。Clark认为AI可以从根本上改变企业对数据基础设施的思考方式。
![]()
他提到了与一位评估Lakebase跨云灾备能力的客户的对话。虽然该功能最初为弹性恢复而设计,但客户看到了另一个用例:将数据库迁移到更近、更便宜的可用GPU。
"他们说,这太完美了,因为我们正在到处寻找便宜的GPU,"Clark说。"有时候其他云有便宜且可用的GPU资源。所以我们希望能够把数据库移到GPU最便宜的地方。"
这段对话突显了AI如何重塑基础设施决策。将数据库绑定在单一云环境中不再是目标。组织越来越希望基于算力资源的可用性灵活地移动工作负载。
"我认为因为这个原因事情会变得更加流动,"Clark说。"如果你不能去GPU便宜的地方,你要么花更多钱,要么影响业务。"
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.