태그: #columnar-storage
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 2 편
Parquet 2.13.0의 nan_count와 IEEE 754 total order — float 통계가 3년 3개월 만에 고쳐진 이야기
Parquet의 min/max 통계는 쿼리 엔진이 데이터를 건너뛰게 해 주는 장치입니다. 그런데 부동소수점 컬럼에서는 이 장치가 10년 넘게 미묘하게 고장 나 있었습니다 — NaN은 어떤 비교에서도 false를 내므로 통계에서 배제되는데, 그러면 NaN이 든 페이지가 max보다 큰 값을 찾는 쿼리에서 통째로 스킵될 수 있습니다. 성능 문제가 아니라 결과가 틀리는 문제입니다. 2026년 6월
2026-07-16 · 30 분 읽기 #data-engineering#parquet#columnar-storage#apache-arrow컬럼 지향 스토리지 완전 가이드 2025: Parquet, ORC, Apache Arrow, Dremel — 분석 DB가 10,000배 빠른 이유
Snowflake, BigQuery, Spark가 수 TB 데이터를 수 초에 쿼리하는 비결. Parquet의 Dremel 기반 구조, ORC, Apache Arrow의 메모리 포맷, RLE/Dictionary 압축, 벡터화 실행까지 720줄로 완전 분석한다.
2026-04-15 · 40 분 읽기 #columnar-storage#parquet#orc#apache-arrow#dremel