浏览此标签下的所有文章
Hudi 是 Uber 开源的增量数据湖框架:给"不可变"的数据湖加上更新与增量读取能力。它与 Iceberg、Paimon 并称湖格式三兄弟,特点是 Copy-on-Write / Merge-on-Read…
Iceberg 是"表格式"(Table Format)不是数据库:它把"一张表"定义为一组元数据与数据文件的规范,让 Spark/Flink/Trino/Doris 都能读写同一张表并保证 ACID。它是湖仓一体的地基。本文覆盖原理(快照与元数据层级)、集成部署(无独立服务)、参数优化与常见问题。
Paimon(原 Flink Table Store,Apache 孵化项目)是"流式数据湖仓":在湖格式上叠加 LSM 结构与 Changelog,让 Flink 能对湖表做流读流写,主键表支持 CDC…