태그: #apache-arrow
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 4 편
Parquet 2.13.0의 nan_count와 IEEE 754 total order — float 통계가 3년 3개월 만에 고쳐진 이야기
Parquet의 min/max 통계는 쿼리 엔진이 데이터를 건너뛰게 해 주는 장치입니다. 그런데 부동소수점 컬럼에서는 이 장치가 10년 넘게 미묘하게 고장 나 있었습니다 — NaN은 어떤 비교에서도 false를 내므로 통계에서 배제되는데, 그러면 NaN이 든 페이지가 max보다 큰 값을 찾는 쿼리에서 통째로 스킵될 수 있습니다. 성능 문제가 아니라 결과가 틀리는 문제입니다. 2026년 6월
2026-07-16 · 30 분 읽기 #data-engineering#parquet#columnar-storage#apache-arrow데이터 레이크하우스 & 모던 데이터 엔지니어링 2026 — Iceberg / Delta / Hudi / Paimon / Tabular (Databricks 인수) / Trino / Spark 4 / Flink 2 / DataFusion 심층 가이드
2026년의 데이터 엔지니어링은 더 이상 "데이터 웨어하우스 vs 데이터 레이크"의 시대가 아니다. Apache Iceberg가 2024-25년 테이블 포맷 전쟁의 승자로 떠오르면서 Netflix·Apple·LinkedIn·Stripe·Airbnb가 모두 그 위에 모였고, Databricks는 2024년 6월 Iceberg 공동 창시자 Ryan Blue의 Tabular를 $1B 이상으로 인수
2026-05-16 · 48 분 읽기 #data-engineering#data-lakehouse#apache-iceberg#delta-lake#apache-hudiPolars 1.x vs Pandas — Pandas 시대의 끝인가? Rust·Arrow·lazy 시대의 dataframe 심층 분석 2026
Polars가 1.x로 stable API 약속을 내걸고, Pandas 2.2가 PyArrow backend를 정식 지원하면서 dataframe 세계의 무게중심이 흔들렸다. Polars 1.x는 정말로 Pandas를 대체하는가? Rust + Arrow 아키텍처, lazy evaluation, query optimizer(predicate/projection pushdown, common su
2026-05-14 · 30 분 읽기 #polars#pandas#dataframe#apache-arrow#duckdb컬럼 지향 스토리지 완전 가이드 2025: Parquet, ORC, Apache Arrow, Dremel — 분석 DB가 10,000배 빠른 이유
Snowflake, BigQuery, Spark가 수 TB 데이터를 수 초에 쿼리하는 비결. Parquet의 Dremel 기반 구조, ORC, Apache Arrow의 메모리 포맷, RLE/Dictionary 압축, 벡터화 실행까지 720줄로 완전 분석한다.
2026-04-15 · 40 분 읽기 #columnar-storage#parquet#orc#apache-arrow#dremel