数据湖仓(data lakehouse)已成为企业分析的核心。但仍存在一个盲区:非结构化文件数据。大多数组织在将结构化数据导入 Snowflake 和 Databricks 等平台方面做得还不错。但对于分布在 NAS 系统和混合云存储中的数十亿文件,情况就不一样了——其中许多仍未与分析系统和 AI 打通。
![]()
Komprise 正试图用其全新的透明文件表(Transparent File Tables)来弥合这一差距。该方案的核心思路是将企业文件数据呈现为 Apache Iceberg 表,可以直接查询,而无需先迁移底层文件内容。
挑战的根源
企业文件数据本身的特性就是挑战的来源。与数据库中的结构化数据不同,非结构化数据通常缺乏一致的 schema(模式),且分散在多个存储系统中。这意味着将 PB 级文件拷贝到湖仓中可能需要数周甚至数月,在任何分析或 AI 工作启动之前就会产生大量时间成本。
IDC 常被引用的一项统计数据指出:超过 80% 的企业数据是非结构化的。然而,据 Komprise 统计,目前这些数据中不到 1% 被用于 AI。
该公司表示,Transparent File Tables 通过暴露结构化的元数据层、同时保持底层文件不动,来解决这一挑战。
"企业 99% 的非结构化数据对 AI 和分析来说一直是'暗数据',原因在于发现和生成 schema 并迁移数据,本质上极其复杂且成本高昂,"Komprise CEO 兼联合创始人 Kumar K. Goswami 表示。
"Komprise 将海量PB 级企业非结构化数据,以一种数据团队可以轻松、透明访问的形态呈现给分析系统。Transparent File Tables 为 AI 开启了一个全新的世界。"
![]()
工作原理
在底层,Komprise 将跨本地和云存储的企业文件数据索引到其所谓的全局元数据库(Global Metadatabase)中。Transparent File Tables 暴露经过增强的元数据和指向原始文件的指针,为分析平台提供基于文件的数据的结构化视图。
Komprise 表示,这为用户提供了更简便的体验。他们可以直接从 Snowflake 和 Databricks 等熟悉工具中查询企业文件数据。如果 AI 应用需要完整文件,则只检索相关数据。
应用场景
公司强调了几个潜在用例:
"制药公司的数据分析师可以在Snowflake 或 Databricks 中为药物研究项目创建仪表盘,通过查询 Komprise Transparent File Table 获取每台仪器和实验室生成的项目文件,"Komprise 在新闻稿中表示。"然后分析师可以将这些数据与 ERP 系统中的财务表以及 Benchling 中的仪器信息关联起来,从而在单一界面中融合来自不同来源的结构化和非结构化数据。"
类似地,在媒体和娱乐行业,AI 智能体可以利用项目元数据仅定位特定项目所需的脚本,而无需搜索整个归档库。
![]()
更大的行业趋势
这一发布反映了企业 AI 面临的更广泛挑战。虽然各组织多年来一直在推进数据库现代化和建设数据湖仓,但大量机构知识仍然存在于基于文件的内容中,难以纳入分析工作流。
行业已经涌现出越来越多的工具,聚焦于 AI-ready 的数据准备、元数据管理和开放表格式。许多厂商不再将越来越大的数据集搬入集中式仓库,而是寻求让现有企业数据在原地更容易被发现和查询。
Komprise 将这一思路又向前推进了一步,瞄准了历来更难与分析平台集成的文件数据领域。
随着企业将 AI 项目从试点推向生产,降低非结构化数据准备的时间和成本,可能将与 AI 模型或计算基础设施的进步同等重要。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.