近日,在 2026 云栖大会"Agent 驱动的全模态大数据计算创新"论坛上,阿里云宣布自研大数据平台 ODPS 战略升级,面向 Agentic AI 时代全面重构数据基础设施。ODPS 旗下三款核心产品 ODPS-MaxCompute、ODPS-Hologres、ODPS-DataWorks 协同发布,以 Agent 原生架构与全模态计算能力为核心,为大模型数据精炼、具身智能、自动驾驶数据处理、企业智能运营等场景提供下一代数据基础设施。
论坛开场,Datafun 创始人王大川与阿里云智能集团研发副总裁、计算平台事业部负责人汪军华、AMD 全球副总裁、中国区企业与商用事业部总经理刘宏兵围绕"AI 算力与大数据计算的协同演进"展开巅峰对话。汪军华用"两个变化"概括了大数据计算正在经历的深刻转变:算的对象变了,从结构化表与日志扩展到图片、音视频、传感器等全模态数据;算的主体变了,越来越多的任务由 Agent 发起、编排和执行,平台服务的对象不只是人,还有 AI。刘宏兵从算力供给侧回应:客户不再把大数据平台和 AI 平台当成两座"算力孤岛",对算力平台提出了通用性、异构协同、开放可扩展三大新要求。两位嘉宾共同指出,大数据和 AI 不再是互相导数据的两套系统,平台和算力正在长成一套——这正是 ODPS 本次升级的核心命题。
从左至右分别为:DataFun创始人兼 CEO王大川、AMD全球副总裁,中国区企业与商用事业部总经理刘宏兵、阿里云智能集团研发副总裁,计算平台事业部负责人汪军华
ODPS-MaxCompute:一切数据,皆可计算
MaxCompute 负责人张治国在会上分享了此次 MaxCompute 的核心发布。当多模态成为 GenAI 的主流方向,数据的加工单位从一行记录变成一段视频、一组视听,传统 ETL 无法承载非结构化数据的复杂度。围绕"一切数据,皆可计算"的理念,MaxCompute 从存储、算力、引擎到交互实现了全栈重构。
阿里云智能集团计算平台事业部 MaxCompute负责人张治国
最直观的变化,是一条 SQL 语句能做的事情变多了。在多模态数据处理的实践中,最常见的痛点是数据要在多个系统间搬运,先做 Embedding 向量化,再到外部系统建索引、做检索,链路长、成本高、运维复杂。
MaxCompute SQL AI 本次新增 EMBEDDING 与 VECTOR_SEARCH 能力,在数仓内闭环完成从向量化到检索的全链路,数据不出仓、零常驻服务。这一能力的发布标志着 MaxCompute SQL AI 演进的又一个关键节点,从 2023 年 MaxCompute 4.0 提出 Data+AI,到 2024 年 Object Table 让非结构化数据进入 SQL,到 2025 年 AI Function 多模态算子实现模型直调,再到今年的异构算力支撑与向量检索闭环及全模态数据处理,SQL AI 用四年走完了从"对接 AI"到"原生 AI"的完整路径。知衣科技把千万级商品图的向量匹配从独立检索集群迁移到 MaxCompute SQL AI,CPU 消耗下降 73%、内存下降 93%、检索加速 5.86 倍。Qwen APP 在 RAG 语料收录评估中的效果同样显著,2400 万条数据与 120 万条 Query 的全链路评估耗时从 6 小时 15 分钟缩短至 32 分钟,成本减少 80%。
支撑这些场景的底层能力,是 MaxCompute 全新推出的多模态存储与异构算力体系。存储层面,Blob 大对象数据类型采用引用-实体分离的存储模式,文本类数据自动压缩平均节省约 5 倍空间,Object Table 以表形式管理 OSS 上的非结构化数据并提供缓存加速与查询优化,两者结合实现了文本、图像、音视频、3D、传感器等全模态数据的一行多列混存与统一管理。 算力层面,CU Quota 通用 CPU 算力支持 AutoScaling 智能扩缩,GU Quota 提供 Serverless GPU 弹性按需使用、单作业千卡并发调度、坏卡自动退水替换,Inference Quota 对接阿里云百炼大模型按 Token 计量付费,三类异构资源按需切换,Data+AI 融合计算真正做到按需匹配。MaxCompute 同时深度集成阿里云百炼商业化大模型,SQL + MaxFrame 双引擎统一对接,通过 TPM/RPM 限流自动并发切分与退避策略,在同等限流下把大规模推理能力推向极致。
穹彻智能 AI 科学家吕峻
MaxFrame 全面升级为分布式 AI 计算引擎,DPE 异构资源统一调度支持 10 万 CU 集群级容量,CPU/GPU/Token 三类资源混合调度、按算子自动匹配。穹彻智能基于 UMI 手持夹爪采集鱼眼视频与 6DoF 位姿数据,经过位姿重建、语义标注、LeRobot 数据集生成等步骤,基于 MaxFrame AI Function 与 Serverless 异构算力,数据处理吞吐提升 10 倍以上,弹性算力峰值扩展到 10 万+ CU,模型训练效率提升约 50%,全程零人工干预。义乌商品城基于 MaxFrame AI Function 对亿级商品图片和视频做理解,百万 CU 弹性伸缩较自建方案性能翻倍,同时集成 Qwen 与 DeepSeek 模型实现商品描述多语言一键出海。更值得关注的是 MaxFrame 同步发布的行业 Skill,把资深工程师的开发经验封装为可复用的 AI Skill,大幅降低行业数据产线的搭建门槛。
在交互层面,MaxCompute 推出了覆盖全场景的 Agentic 套件:AI Query 自然语言问数、AI Coding 辅助编码、MaxAgent 全链路智能运维。 MaxAgent 以用户身份执行、不修改数据,覆盖作业诊断、成本优化、权限审计等六大运维场景,30 秒替代 30 分钟手动排查。同步发布的 MCP Server 将平台 API 封装为 Agent 可调用工具,支持第三方 Agent 即插即用。在 Data Agent 方向上,MaxCompute 同步构建了平台托管语义层,将元数据、血缘、业务术语与指标口径沉淀为 SemanticSpec 业务规范,Agent 可按需获取上下文,减少重复试错;底层配套运维语义包,让 Agent 从问题直达动作。
ODPS-Hologres 5.0:从实时数据,到可靠行动
Hologres 负责人姜伟华分享 Hologres 5.0 时指出:OLAP 的用户正在从人变成 Agent。过去业务人员通过 SQL 和 BI 按需提问、人工解释、再人工推动下一步;现在 Agent 持续运行、自主组合上下文、将结果回流至下一轮判断。Agent 带来了更低的门槛、持续的运转与闭环的行动,但也给 OLAP 带来了四类新挑战:实时完整的数据、可理解的语义、可信可控的行动,以及面对不可预测查询时的自适应执行能力。Hologres 5.0 围绕"从实时数据,到可靠行动",升级为 Agent Native 的全模态实时数仓,对这四类挑战逐一回应。
阿里云智能集团计算平台事业部 Hologres负责人姜伟华
姜伟华认为,Agent 走进企业数据生产线,最大的障碍不是智能不够,而是信任。过去 Agent 只能读数据、不能动数据,因为一旦写错便影响生产。Hologres 5.0 全新发布的数据沙箱(Data Sandbox),基于生产实例创建隔离的可写工作空间,Agent 可以在沙箱中自由执行增删查改和 DDL 变更实验,验证通过并审批后再合并回源实例,全程不影响生产。论坛现场的演示直观展示了这一能力,面对"全渠道大促 GMV 下滑"的业务问题,Agent 在沙箱中完成了四步闭环——定位低转化渠道、实验修改指标口径的影响、回放历史数据对比新旧口径、生成待审批作业合并回源实例,从过去需要人工分多轮排查,变为系统一次性闭环完成。
信任的另一个维度是让 Agent 真正理解业务数据的含义。Hologres 5.0 新增的图查询能力让数仓从"找相似"走向"沿关系路径查询",基于 AGE 扩展,通过 SQL 调用 Cypher 子集并与普通 SQL 组合,“客户→下单→订单→包含→商品”的关系链路可以直接在 SQL 中表达,支撑知识图谱构建与 Agent 决策。同步发布的 Semantic View 则在数仓内建起业务语义层,声明表关系、指标口径后,引擎自动完成多表 JOIN 改写并保证聚合语义正确,让人、BI 和 AI 使用同一套业务语言,大模型取数更准确。
在 Agent 的定义与运行方面,Hologres 5.0 全新推出 User Defined Agent,让用户能用 Python 自定义 AI 处理逻辑,并将其嵌入数据流水线持续自动运行。用户定义好 Agent 后,通过 DataFrame 逐行触发 AI 推理,再经 Dynamic Table 增量物化实现自动刷新——源表每新增数据,引擎只处理新行,无需全量重跑。同一套 Agent 逻辑同时支撑批处理和流式处理。以产品评价 AI 打分为例,源表每新增一条评价,1 分钟内即可在评分表中产出 AI 打分结果及理由。**Hologres 同时发布了 Hologres Agent——控制台内置的智能助手,基于大模型能力,支持通过自然语言完成产品咨询、实例运维、数仓开发与数据分析等操作。**在此基础上,Hologres 5.0 正式发布运维 Agent、调优 Agent 与 Data Agent 三大智能体,分别面向系统运维、性能调优和数据开发场景,三者共享实时数据、Skills 与安全边界。
围绕"记得住、试得起、看得清"三大价值,Hologres 5.0 为 Agent 构建了完整的信任底座:数据沙箱让 Agent"试得起"——前文所述的隔离实验与审批合并机制,让 Agent 敢动数据、不动生产;Hologres 长记忆服务让 Agent"记得住"——在 LOCOMO Benchmark 上以 96.82 分达到 SOTA,Token 节省超 90%;HoloScope 让 Agent"看得清"——支持 100+ 指标接入与全量 Session 回放评估。三者均基于 Hologres 底座构建,可服务所有通用 Agent。在性能方面,Hologres 持续刷新行业纪录:VectorDBBench 向量检索性能行业领先,TPC-H 3TB 世界第一,为 Agent 时代不可预测的查询模式提供了坚实的性能保障。
ODPS-DataWorks:让 Agent 走进企业的数据生产线
DataWorks 产品负责人田奇铣指出,企业数据处理正在从"人用工具"转向"Agent 自主运转",但 Agent 走进生产线比想象中难,字段同名不同义、同义不同名,Agent 生成的 SQL 看着正确实则选错了表——"Agent 很聪明,但没有业务常识。"围绕这个问题,DataWorks 发布了企业语义知识图谱 Context Graph,不需要人工先建本体与模型,而是从湖仓/数仓数据资产自动扫描推理生成,涵盖元数据增强、指标与术语、关系与血缘、调度与质量、智能学习、组织知识六层语义,随资产变化增量更新,所有 Agent 共用。接入语义图谱前,做一个跨系统的数据分析需要在多个系统间串行确认、反复切换;接入后一次提问即可自动带入上下文,业务问答准确率达到 93.24%,SQL 生成一致性 99%,模型成本更低,Qwen3.8-flash 模型效果可接近旗舰模型水平。
阿里云智能集团计算平台事业部 DataWorks产品负责人田奇铣
DataWorks 沉淀了十余年的数据开发实践,日调度任务规模 4000 万+,管理数据规模 EB 级,提供 15+ 官方专家套件、80+ 技能覆盖数据集成、开发、运维、治理、分析全流程,云端托管 7×24 在线,支持钉钉、飞书、企业微信多渠道接入。全新发布的 ADA(AI 原生大数据服务)进一步实现多智能体协同编排与跨引擎任务自主交付,覆盖离线、实时、流式、AI 计算全场景。
“可信任”是企业采用 Agent 的最后一道门槛。DataWorks 构建了三道防线:数据安全防线守住身份标识、细粒度权限、安全沙箱与敏感数据保护;行为审计防线管住 Agent 手脚,实现全链路可观测、Agent 数据血缘与水印溯源;成本管控防线防止 Credits 失控。同时提供多种 Agent 引擎可选,开放 MCP、OpenAPI、200+ Skill 等六大扩展能力,并推出主动式智能运维巡检服务,从人的被动轮巡转向 Agent 自主发现、归因、修复与日报输出。DataWorks Data Agent 在 2026 IDC 中国 Data Agent 厂商评估中获评领导者。
从云上基建到 AI原生全模态大数据基础设施
走过十六年,ODPS 从支撑阿里内部业务,到成为普惠的云上基础设施,再到今天面向 Agentic AI 时代全面重构,每一次进化都紧扣技术发展的脉络。
阿里云通过 Agent 原生、全模态计算的智能数据平台,正持续降低 AI 技术使用门槛,赋能千行百业在 Agentic AI 时代挖掘数据价值,从实时数据走向可靠行动。