标签: #lakehouse
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 2 篇
如何解读 2026 年的数据工具地形图 —— 不是工具清单,而是分层决策
2026 年 7 月 28 日,一篇《面向开发者的数据工具地形指南》登上 GeekNews,获得 51 点赞。这是一份不错的地图,但地图不会替你选目的地。本文把同一片地形拆成五个层次,梳理每一层实际要做的决策是什么:表格式之争如何在 Iceberg v3 上事实终结、战场如何转移到目录(catalog)层,DuckDB 级别的单节点引擎如何把原本属于集群的工作拉回本地,Fivetran 与 dbt Labs 的合并对层与层之间的边界意味
2026-07-31 · 24 分钟阅读 #data-engineering#lakehouse#iceberg#duckdb#data-platformIceberg v3 行血统 — 行 ID 不存放在文件里
Apache Iceberg 格式 v3 把「为每一行赋予稳定标识符」的行血统(row lineage)写进了规范,而且这不是可选项 — 只要是 v3 表就无条件开启。但这个值并不存放在数据文件里 — 而是通过一条从表的 next-row-id,经快照、清单(manifest),一路继承到数据文件的链条,在读取时才计算出来。这样设计是为了让乐观提交重试时不必重写数据文件,代价是维护血统的责任转移到了每一个 writer 身上。本文沿着规
2026-07-16 · 27 分钟阅读 #iceberg#lakehouse#table-format#data-engineering#spark