LabHub
Get started
배우기 러닝패스 코스

Lakehouse Table Format — Understanding Apache Iceberg Through Its Metadata

Apache Iceberg 표를 Spark 4.1·pyiceberg·DuckDB 로 함께 쓰고 읽으며, metadata.json 에서 데이터 파일까지 이어지는 목록 나무와 스냅샷, JDBC 카탈로그의 원자적 교체, 필드 ID 로 안전해지는 스키마 진화, 숨은 파티셔닝과 파티션 진화, 타임트래블·롤백·태그·브랜치, 낙관적 동시성과 잃어버린 갱신, copy-on-write 와 merge-on-read, 압축·스냅샷 만료·고아 파일 정리까지 다룹니다. 모든 판정은 실제 metadata(스냅샷 사슬·스펙 ID·삭제 파일 종류·파일 수)로 합니다. SQL 과 파이썬을 쓸 줄 알고 Spark 로 파일을 써 본 분을 위한 과정입니다.

중급 · 레슨 27 · 실습 9

실습 시작하기

커리큘럼

Table formats and the metadata tree

Catalogs

Schema evolution and column IDs

Hidden partitioning and partition evolution

Time travel, rollback, tags and branches

Concurrent writes and optimistic concurrency

MERGE and deletes — copy-on-write vs merge-on-read

Compaction, snapshot expiration and orphan cleanup

Many engines, one table

참고 문서