LabHub
배우기 러닝패스 코스

Data Pipelines

배치와 스트리밍의 선택 기준, 원본 정제와 스키마 계약, 그리고 멱등한 재처리를 다룹니다. 일부러 더럽게 만들어 둔 원본 데이터를 프로파일링하고 정제 표와 거부 표로 나눠 적재하며, 같은 작업을 두 번 돌려도 결과가 변하지 않는 파이프라인을 손으로 만듭니다.

중급 · 레슨 32 · 실습 10

실습 시작하기

커리큘럼

Batch and Streaming

Schemas and Formats

Idempotency and Reprocessing

Data Quality and Contracts

Run Ledgers and Atomic Commits

Event-Time Watermarks and Late Data

Partitions and File Size

Schema Evolution and Contract Versions

Backfills and Double Counting

Lineage and Reproducibility

Quality Checks and Quarantine

참고 문서