태그: #parquet
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 5 편
Parquet 2.13.0의 nan_count와 IEEE 754 total order — float 통계가 3년 3개월 만에 고쳐진 이야기
Parquet의 min/max 통계는 쿼리 엔진이 데이터를 건너뛰게 해 주는 장치입니다. 그런데 부동소수점 컬럼에서는 이 장치가 10년 넘게 미묘하게 고장 나 있었습니다 — NaN은 어떤 비교에서도 false를 내므로 통계에서 배제되는데, 그러면 NaN이 든 페이지가 max보다 큰 값을 찾는 쿼리에서 통째로 스킵될 수 있습니다. 성능 문제가 아니라 결과가 틀리는 문제입니다. 2026년 6월
2026-07-16 · 30 분 읽기 #data-engineering#parquet#columnar-storage#apache-arrowInfluxDB 3 Core의 72시간 제한은 사실 432개 파일 제한이다 — Parquet 재작성이 남긴 청구서
InfluxDB 3는 엔진 전체를 Rust로 다시 쓰고 저장 계층을 Apache Arrow와 Parquet 위에 올렸습니다. 흔히 "Core는 72시간까지만 조회된다"고 알려져 있지만 소스를 읽어 보면 그런 코드는 없습니다. 실제로 존재하는 것은 쿼리 하나가 스캔할 수 있는 Parquet 파일 개수 제한 432개이고, 72시간은 기본 gen1 블록 10분을 곱해서 나온 파생값이자 최선의 경우
2026-07-16 · 34 분 읽기 #database#influxdb#time-series#parquet#storage-engineDuckDB 실전 — 노트북에서 끝내는 임베디드 분석의 시대
OLAP의 SQLite라 불리는 DuckDB가 왜 이렇게 사랑받는지 아키텍처부터 풀어봅니다. Parquet 직접 쿼리, 윈도우 함수와 PIVOT과 ASOF JOIN 실전 예제, pandas와의 zero-copy 연동, dbt-duckdb 기반 경량 ETL, MotherDuck 하이브리드 실행, 그리고 Postgres와 ClickHouse 대비 선택 가이드까지 정리합니다.
2026-06-12 · 24 분 읽기 #duckdb#database#olap#analytics#parquet컬럼 지향 스토리지 완전 가이드 2025: Parquet, ORC, Apache Arrow, Dremel — 분석 DB가 10,000배 빠른 이유
Snowflake, BigQuery, Spark가 수 TB 데이터를 수 초에 쿼리하는 비결. Parquet의 Dremel 기반 구조, ORC, Apache Arrow의 메모리 포맷, RLE/Dictionary 압축, 벡터화 실행까지 720줄로 완전 분석한다.
2026-04-15 · 40 분 읽기 #columnar-storage#parquet#orc#apache-arrow#dremelDuckDB 분석 엔진 실전 가이드: 로컬 OLAP부터 데이터 레이크 통합까지
DuckDB의 아키텍처와 벡터화 실행 엔진을 분석하고, Parquet·CSV·JSON 데이터 소스 통합, Python/SQL 활용법, ClickHouse·BigQuery 대비 벤치마크, 프로덕션 운영 패턴을 실전 코드와 함께 다룹니다.
2026-03-08 · 32 분 읽기 #database#duckdb#olap#analytics#data-lake