官宣|Apache Fluss 毕业成为顶级项目,湖流一体开启 Agentic Lake 全面实时化时代

0 阅读12分钟

image (12).png

今年 7 月,Apache Fluss 的毕业提案在 Apache 孵化器项目管理委员会(IPMC)投票中获得全票通过,随后获 Apache 软件基金会董事会批准。今天,Apache 软件基金会正式宣布 Apache Fluss 孵化毕业,成为 Apache 顶级项目(TLP)!这一里程碑不仅标志着 Fluss 迈入新的发展阶段,也将进一步推动流式存储、实时湖仓与 AI 数据基础加速融合,为实时数据基础设施的发展开启新的篇章。

Apache 官方博客 发布了 Apache Fluss 毕业的消息:

图 1|Apache 软件基金会发布 Apache Fluss 成为顶级项目公告

01 Apache Fluss 成长历程

Fluss 最早由阿里云 Flink 团队开发,旨在解决流存储在分析场景中长期存在的挑战,包括流批一体存储、Flink 计算成本,以及链路复杂等问题,为实时分析构建面向湖仓时代的统一流式存储。“Fluss” 取自 Flink Unified Streaming Storage,也恰好在德语中意为“河流”,寓意数据像河流一样持续流动,并最终汇入开放的 Lakehouse。

图 2|Fluss 发展历程与社区指标

经过一年多的阿里巴巴内部打磨和大规模生产实践,Fluss 于 2024 年 11 月在 Flink Forward Asia 2024 上海站正式宣布开源。2025 年 6 月,Fluss 进入 Apache 软件基金会孵化器,从一项源自阿里巴巴的技术探索,逐步成长为由全球开发者共同建设的开源项目。

孵化期间,Fluss 社区的贡献者规模和项目关注度持续增长。目前,社区已汇聚 157 位贡献者,GitHub 收获 2,000+ Stars,合并的 Pull Request 数达 1700 多个,逐步形成了由不同国家、不同组织的开发者共同参与的活跃开源社区。

与此同时,Fluss 已在阿里巴巴、小红书、京东、蚂蚁集团、Fresha、爱奇艺等公司的生产环境中部署落地,广泛应用于日志采集与分析、实时数仓、搜索推荐、索引链路和实时特征服务等场景,帮助企业减少跨系统的数据复制,降低实时数据处理与存储成本,并进一步提升湖仓数据新鲜度和分析效率。

02 从 Lakehouse 到 Lakestream,以湖流一体支撑 Agentic 时代

在 Agentic 时代,AI 正从回答问题的 Chatbot 走向能够自主决策、调用工具并执行任务的 Agent。数据也不再只是分析的输入,而是 Agent 判断与行动所依赖的实时上下文:既要覆盖完整的历史,也必须准确反映最新的业务状态。传统 Lakehouse 擅长沉淀和治理海量历史数据,却难以持续满足秒级乃至毫秒级的数据新鲜度要求。

作为 Lakestream 湖流一体架构的开源先驱,Apache Fluss 在数据湖之上构建湖仓原生的实时流存储层,将持续更新的最新数据与长周期历史统一起来,为 AI Agent 提供从过去到当下、新鲜而完整的上下文,支撑生产级的实时决策与行动。

图 3|Apache Fluss 湖流一体架构

Apache Fluss 通过以下核心能力,为传统 Lakehouse 增加实时流存储层,构建从历史到最新数据统一可用的 Lakestream 湖流一体底座:

  • **Lakestream 湖流一体:**长期历史数据保存在 Paimon、Iceberg、Hudi、Lance 等开放数据湖中,最新数据由 Fluss 实时承载;通过 Union Read,Agent 可以从统一表视图中访问从历史到最新的数据,避免上下文割裂
  • **高效列式流存储:**流存储底层基于 Apache Arrow 列存实现,支持服务端列裁剪、条件下推、分区下推能力,以更少的数据读取和传输支撑高效流式分析与实时分析。
  • **实时更新与低延迟查询:**主键表原生支持流式更新、部分更新、Changelog、KV 查询和 Delta Join,让同一份实时数据同时服务流式计算与点查。
  • **面向 Agent 的实时上下文:**统一承载持续更新的实时状态与长周期历史数据,为 AI Agent 提供新鲜、完整、低延迟且可信的上下文,支撑实时决策与行动。
  • **开放生态与多语言访问:**可与 Apache Flink、Apache Spark、StarRocks 等计算引擎协同,并提供 Java、Rust、Python 和 C++ 客户端,方便实时分析与 AI 应用接入。

03 毕业寄语

在进入 Apache 软件基金会一年的时间里,Fluss 已建立起活跃的全球贡献者社区,并获得了众多领先企业和开源生态伙伴的广泛关注与支持。

" 祝贺 Apache Fluss 正式毕业,成为 Apache 顶级项目!Fluss 源自阿里巴巴内部技术实践,其湖流一体架构打通数据流与数据湖,为 Lakehouse 注入实时数据能力,有效减少数据冗余、简化数据链路,并已在阿里巴巴核心电商场景实现大规模生产落地。正是这些实践推动我们将 Fluss 开源并捐赠给 ASF 孵化。很高兴看到 Fluss 在开放协作的社区治理下不断走向成熟与独立。期待 Fluss 携手全球社区,成为实时 Lakehouse 的开放数据底座,为更多企业的实时分析与 AI 应用提供坚实支撑。"

—— 王峰,阿里云开源大数据负责人,阿里云开源委员会副主席

" 衷心祝贺 Apache Fluss 社区从孵化器毕业,正式成为 Apache 顶级项目!作为项目的孵化 Champion 和导师,很高兴见证 Fluss 社区践行 Apache Way,在开放协作中不断发展壮大。孵化期间,Fluss 不仅发布了多个高质量、富有创新性的版本,持续完善面向实时分析与 AI 的流式存储能力,还营造了开放、包容的社区氛围,吸引了越来越多来自不同背景的贡献者加入。祝愿 Apache Fluss 百尺竿头更进一步,成长为世界级的开源项目,持续推动流式存储、实时分析与 Lakestream 技术的发展。"

—— 李钰,ASF Member、Apache Fluss 孵化 Champion 及导师,阿里云 EMR & Milvus 负责人

" Fluss 项目启动之初,我们就认定这是一件值得做的事。但它的发展速度和影响力,还是远远超出了我们的预期。尤其令人振奋的是,社区展现出的活力,来自海内外的贡献者,以及越来越多企业开始在生产环境中使用 Fluss。毕业是一个新的开始,我们相信,Fluss 会成为 Lakehouse 架构的实时数据底座,并为依赖实时数据的 AI 应用提供开放的数据底座。"

—— 伍翀,Apache Fluss PMC Chair、项目发起人

" I'm truly excited to see Fluss graduate and become a top-level ASF project. It marks the beginning of next evolution of streaming landscape, but its real power is in unlocking orders of magnitude more business value in streaming analytics. The design choices are just a perfect mix for one stop native streaming storage combined in just one project. My expectations is for it be de-facto foundation streaming storage go-to standard in real-time AI era. I see quicker than expected enterprise adoption due to it's power to collapse costs of complex lakehouse landscapes, thus enterprise maturity is important"

—— Igor Kersic,CTO at Ververica

" 祝贺 Fluss 顺利毕业!Fluss 作为集 "流、湖仓、KV" 为一体的存储层,在数据基础设施生态中展现出了独特且重要的价值。在进入 Apache 基金会孵化一年以来,Fluss 社区高速健康成长,项目显示出了强大的生命力,成为 Apache 顶级项目是水到渠成。祝愿 Fluss 再接再厉,成为数据基础设施中的又一个标杆项目。"

—— Jiangjie Qin,LinkedIn Principal Staff Software Engineer

" 从 Apache Paimon 最初的设想里,有一层流动起来的服务加速层,很长时间没有推进。现在随着 Apache Fluss 的推出和完善,这层加速层给湖上带来秒级流动的能力,做到了真正的又实时又统一,恭喜 Fluss 毕业!"

—— 李劲松,Apache Paimon PMC Chair

" 小红书作为 Fluss 的早期使用者和贡献者,很高兴见证并参与了社区从孵化到毕业的重要阶段。Fluss 的列式读写、冷热分层、湖流一体等能力,已在小红书索引数据链路等核心场景中发挥重要价值,显著降低实时链路成本,并提升构建与在线消费效率。期待 Apache Fluss 社区持续繁荣,在更多企业级实时数据场景中发挥更大价值,成为新一代实时数据底座的重要开源项目。"

—— 刘焓,小红书 Fluss & Kafka 负责人

" At Fresha, Apache Fluss is deployed in production as part of our real-time data platform. Its combination of low-latency streaming access and open Lakehouse integration helps us simplify data movement and build fresher analytical and operational data products, while capabilities such as Delta Join make our Apache Flink pipelines simpler to operate. We are proud to contribute directly to the project and look forward to helping shape its next chapter as an Apache Top-Level Project."

—— Emiliano Mancuso, VP of Architecture and Data Engineering at Fresha

" Fluss 重新定义了实时数据基础设施的范式,其 Delta Join、湖流一体等创新设计,让流存储不再只是消息队列的替代,而是真正成为 Lakehouse 架构中不可或缺的实时数据层。淘宝闪购作为 Fluss 的早期深度实践者,很荣幸能在千亿级流量场景下通过 Fluss 系统性解决了 State 膨胀与链路复杂等痛点,并在 618 大促等关键活动中稳定支撑了核心实时决策链路。期待 Fluss 在 AI ✖️ Data 时代释放更大的价值!"

—— 王沛斌,淘宝闪购资深大数据专家

" Fluss 以流存储为切入点,为实时分析和 AI 时代的数据基础设施打开更多想象空间。京东正在结合自身丰富的业务场景,积极参与 Fluss 的技术实践与社区共建,推动相关能力在企业级场景中持续落地。成为顶级项目是一个新的起点,期待 Fluss 坚持开放创新,繁荣全球开发者生态,帮助更多企业释放数据价值!"

—— 韩飞,京东零售实时数据平台负责人

" Fluss 一路围绕 Streaming Storage 逐步成长为连接流处理与湖仓体系的重要开源力量,越来越被业界广泛接受,蚂蚁也在积极推进 Fluss 的探索与落地。期待 Apache Fluss 在 Apache Way 的指引下,继续保持开放、透明、共建的社区活力,成为实时数据与 AI 时代更坚实、更可信的基础设施。"

—— 王鑫(多佛),Apache Member、蚂蚁集团实时智能负责人

04 毕业,是下一段旅程的开始

成为 Apache 顶级项目之后,Fluss 将继续深耕湖仓原生流式存储:让流处理拥有更高效、可复用的存储基础,让 Lakehouse 真正具备实时能力,也为依赖实时特征、动态状态和持续上下文的 AI 应用提供开放的数据底座。

感谢每一位提交代码、完善文档、参与讨论、报告问题、分享实践和帮助新人的贡献者。感谢所有在生产环境中选择 Fluss、用真实问题推动项目前进的用户与伙伴。也特别感谢 Apache Fluss 孵化器导师:李钰(Champion)、陈梓立、李劲松、秦江杰和 Jean-Baptiste Onofré,他们在孵化期间给予了社区持续的指导与支持,帮助 Fluss 更好地践行 Apache Way,并顺利走过从孵化到毕业的关键历程。

无论您是希望将 Fluss 应用于实时分析与 AI 场景,还是想了解更多信息、参与项目贡献,现在都是加入社区的好时机:

新的航程已经开始,让这条开放的数据之河继续奔涌。

05 阿里云湖流一体解决方案

基于 OpenLake 理念,阿里云提供全托管的流存储 Fluss + DLF(Paimon)+ EMR StarRocks 的全模态、多引擎的湖流一体解决方案,打通实时数据流动、湖仓存储与高性能分析。 DLF(Paimon)提供开放的全模态湖仓数据底座,流存储 Fluss 负责数据的实时流动,将湖仓数据新鲜度提升至秒级,EMR StarRocks 则提供低延迟的实时分析能力。三者协同,让全模态数据从产生、入湖到分析无缝衔接,帮助企业构建开放、低延迟、高性能的 Agentic Lake。

Fluss + Paimon + StarRocks 车联网湖流一体解决方案:help.aliyun.com/zh/flink/re…

06 参考链接

[1] 全票通过:lists.apache.org/thread/kltv…

[2] Apache 官方博客:news.apache.org/foundation/…

www.aliyun.com/product/fli… (二维码自动识别)

如想进一步学习与交流,欢迎加入 Fluss 社区群,与更多开发者共同探索交流。

qr.dingtalk.com/action/join… (二维码自动识别)

▼ 「Flink AI 训练营」 ▼

面对海量电商评论,难以直接指导电商商品运营。本期 Flink 实训教你实时对评论进行话题分类,自动打标评论中的关注点, 实现高性能实时数据分析与处理!

使用 Flink AI 参照教程完成实操,根据任务完成进度即有机会获得 Flink 定制洗漱包、阿里云保温杯等奖品!

点击查看详情【Flink AI训练营】基于Flink对电商评论AI实时分类与情感分析

▼ 「实时计算 Flink 版」 ▼

复制下方链接或者扫描左边二维码

即可免费试用阿里云 Serverless Flink,体验新一代实时计算平台的强大能力!

了解试用详情:free.aliyun.com/?productCod…