タグ: #apache-arrow
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 4 件
Parquet 2.13.0 の nan_count と IEEE 754 total order — float 統計が3年3か月かけて直った話
Parquetのmin/max統計は、クエリエンジンにデータをスキップさせるための仕組みです。ところが浮動小数点カラムでは、この仕組みが10年以上前から微妙に壊れていました — NaNはどんな比較でもfalseを返すため統計から除外され、その結果NaNを含むページが、maxより大きい値を探すクエリで丸ごとスキップされてしまうことがあります。性能の問題ではなく、結果が間違う問題です。2026年6月13日にリリースされたparquet-fo
2026-07-16 · 31 分で読めます #data-engineering#parquet#columnar-storage#apache-arrowデータレイクハウス & モダンデータエンジニアリング 2026 — Iceberg / Delta / Hudi / Paimon / Tabular (Databricks買収) / Trino / Spark 4 / Flink 2 / DataFusion 徹底ガイド
2026年のデータエンジニアリングは、もはや「データウェアハウス対データレイク」の時代ではない。2024-25年のテーブルフォーマット戦争はApache Icebergの勝利に終わり、Netflix・Apple・LinkedIn・Stripe・Airbnbが揃ってその上に集まった。Databricksは2024年6月、Iceberg共同創設者Ryan BlueのTabularを10億ドル超で買収し、Delta LakeとIcebergを
2026-05-16 · 40 分で読めます #data-engineering#data-lakehouse#apache-iceberg#delta-lake#apache-hudiPolars 1.x vs Pandas — Pandas 時代の終わりか? Rust・Arrow・lazy 時代の dataframe 深掘り 2026
Polars が 1.x で stable API を約束し、Pandas 2.2 が PyArrow backend を正式採用したことで、dataframe 世界の重心が揺れた。Polars 1.x は本当に Pandas を置き換えるのか? Rust + Arrow アーキテクチャ、lazy evaluation、query optimizer(predicate / projection pushdown、common sube
2026-05-14 · 28 分で読めます #polars#pandas#dataframe#apache-arrow#duckdbColumnar ストレージ完全ガイド 2025: Parquet, ORC, Apache Arrow, Dremel — 分析 DB が 10,000 倍速い理由
Snowflake, BigQuery, Spark が TB 規模のデータを数秒でクエリする秘密。Parquet の Dremel 構造、ORC、Apache Arrow のメモリフォーマット、RLE/Dictionary Encoding、ベクトル化実行までを完全解説。
2026-04-15 · 18 分で読めます #columnar-storage#parquet#orc#apache-arrow#dremel