您的当前位置:首页 > 标签 > Apache Fluss架构白皮书
阿里云:2026年Apache Fluss™ (Incubating) 白皮书(35页).pdf
Apache Fluss架构白皮书2026:流式湖仓统一底座,收敛消息队列/KV/OLAP/特征存储|Apache Fluss
Apache Fluss架构白皮书:流式湖仓统一底座,收敛消息队列/KV/OLAP/特征存储,主键表实现流表统一,三级存储贯通热冷数据。
 2026-07-28
 信息技术
 35页
15张图表
数据来源:
阿里云:2026年Apache Fluss™ (Incubating) 白皮书(35页) 查看报告
Kafka用于流式传输、Redis用于在线服务、Iceberg用于离线归档、向量数据库用于语义检索——能力不断叠加,却从未真正收敛。“多系统税”正在成为实时基础设施最大的隐性成本。Apache Fluss提供了一种根本不同的设计:一个流式优先、湖仓原生的列式存储底座,将事件传输、KV服务、列式分析与AI上下文收敛到统一存储之上,让“同步问题”不再需要解决。

实时基础设施的演进困境

五段演进路径与多系统税的形成

企业实时基础设施的演进往往遵循相似路径:流式写入与CDC引入Kafka;流式分析引入Flink;实时数据处理与复杂事件处理暴露有状态Flink的脆弱性;实时机器学习与特征工程形成训练-服务偏差;实时AI系统与上下文工程引入会话记忆、实体记忆与向量知识库。每增加一类需求就增加一道一致性边界,最终形成多系统堆叠。多系统税的核心代价是工程投入不是在打磨模型上,而是在维护各系统之间的数据一致性上。

实时智能的六项基础设施需求

事件写入、快速KV服务、流式特征、历史存储、语义层、审计追踪——如果单一存储层能原生提供这六项能力,同步问题就不需要解决。这正是Apache Fluss的设计出发点。

Apache Fluss的核心架构

集群即一个逻辑系统

Fluss集群由CoordinatorServer(协调层)、TabletServer(数据面,可水平扩展)、元数据存储三层组成。客户端获取路由元数据后直接与TabletServer交互,协调节点不参与数据路径。TabletServer管理一组Bucket,每个Bucket的Leader副本同时维护日志存储(仅追加的日志段)和KV存储(RocksDB LSM树,仅主键表具备)。

两种表,同一存储底座

日志表存储不可变的、按Offset有序的事件流,默认Arrow列式格式使服务端可执行列投影与谓词下推。主键表是流/表对偶的体现:同一份数据同时以Changelog(事实源)和每主键最新行的KV视图(物化形式)两种形式暴露。写入到达时,两种视图在Leader上同步前进,以强一致性维护。主键表支持first_row、versioned、aggregation三种合并引擎。

三级存储与状态外置

三级存储,同一底座

Tier 1热层(本地实时写入)、Tier 2 Fluss原生远程(故障转移与训练读取)、Tier 3开放湖仓(Iceberg/Paimon/Lance,任何引擎可读)。分层服务将日志归档至Tier 3,Union Read使查询自动跨越热冷边界,列裁剪、谓词下推与分区裁剪在每层分别生效。

状态外置——Flink无状态化

Fluss将状态外置到主键表,Flink作业简化为纯计算进程:恢复从分钟级降至秒级,弹性伸缩无需重新分配状态。Delta Join借助主键表实现无状态双流Join,基准测试显示CPU从106核降至14-16核,Checkpoint从90秒降至1秒。聚合合并引擎在Leader写入时执行读-改-写聚合,部分更新实现无需Join的数据打宽。

AI基础设施的新底座

消除训练-服务偏差与上下文存储

训练与服务从同一主键表读取(服务读当前KV状态,训练读时间点快照),训练-服务偏差从结构上消除。Fluss为LLM/Agent系统提供会话记忆(日志表)、实体记忆(主键表)、行为信号(聚合特征),向量记忆可配对Lance等引擎。虚拟表将同一物理表投影为多个逻辑视图,不复制状态。
客服
商务合作
小程序
服务号
折叠