LabHub
开始
学习 学习路径 课程

湖仓表格式 — 从元数据理解 Apache Iceberg

Apache Iceberg 표를 Spark 4.1·pyiceberg·DuckDB 로 함께 쓰고 읽으며, metadata.json 에서 데이터 파일까지 이어지는 목록 나무와 스냅샷, JDBC 카탈로그의 원자적 교체, 필드 ID 로 안전해지는 스키마 진화, 숨은 파티셔닝과 파티션 진화, 타임트래블·롤백·태그·브랜치, 낙관적 동시성과 잃어버린 갱신, copy-on-write 와 merge-on-read, 압축·스냅샷 만료·고아 파일 정리까지 다룹니다. 모든 판정은 실제 metadata(스냅샷 사슬·스펙 ID·삭제 파일 종류·파일 수)로 합니다. SQL 과 파이썬을 쓸 줄 알고 Spark 로 파일을 써 본 분을 위한 과정입니다.

중급 · 레슨 27 · 实验 9

开始实验

커리큘럼

表格式与元数据树

目录(Catalog)

模式演进与列 ID

隐藏分区与分区演进

时间旅行、回滚、标签与分支

并发写入与乐观并发

MERGE 与删除 — copy-on-write 与 merge-on-read

压缩、快照过期与孤儿文件清理

多个引擎共用一张表

参考文档