タグ: #parquet
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 5 件
InfluxDB 3 Core の「72時間制限」は実は432ファイル制限だった — Parquet書き直しが残した請求書
InfluxDB 3はエンジン全体をRustで書き直し、ストレージ層をApache ArrowとParquetの上に載せました。よく「Coreは直近72時間しかクエリできない」と言われますが、ソースを読んでもそんなコードはありません。実在するのはクエリ1回がスキャンできるParquetファイル数の上限432だけであり、72時間はデフォルトのgen1ブロック10分を掛けて出てくる派生値、しかも最良のケースにすぎません。本稿では432という
2026-07-16 · 33 分で読めます #database#influxdb#time-series#parquet#storage-engineParquet 2.13.0 の nan_count と IEEE 754 total order — float 統計が3年3か月かけて直った話
Parquetのmin/max統計は、クエリエンジンにデータをスキップさせるための仕組みです。ところが浮動小数点カラムでは、この仕組みが10年以上前から微妙に壊れていました — NaNはどんな比較でもfalseを返すため統計から除外され、その結果NaNを含むページが、maxより大きい値を探すクエリで丸ごとスキップされてしまうことがあります。性能の問題ではなく、結果が間違う問題です。2026年6月13日にリリースされたparquet-fo
2026-07-16 · 31 分で読めます #data-engineering#parquet#columnar-storage#apache-arrowDuckDB実践 — ノートPCで完結する組み込み分析の時代
OLAPのSQLiteと呼ばれるDuckDBがなぜこれほど愛されるのか、アーキテクチャから解き明かします。Parquetの直接クエリ、ウィンドウ関数・PIVOT・ASOF JOINの実践例、pandasとのzero-copy連携、dbt-duckdbによる軽量ETL、MotherDuckのハイブリッド実行、そしてPostgresやClickHouseと比較した選択ガイドまで整理します。
2026-06-12 · 22 分で読めます #duckdb#database#olap#analytics#parquetColumnar ストレージ完全ガイド 2025: Parquet, ORC, Apache Arrow, Dremel — 分析 DB が 10,000 倍速い理由
Snowflake, BigQuery, Spark が TB 規模のデータを数秒でクエリする秘密。Parquet の Dremel 構造、ORC、Apache Arrow のメモリフォーマット、RLE/Dictionary Encoding、ベクトル化実行までを完全解説。
2026-04-15 · 18 分で読めます #columnar-storage#parquet#orc#apache-arrow#dremelDuckDB OLAP分析とデータレイクガイド
DuckDBを使用したOLAP分析とデータレイククエリのガイド。インプロセス分析、Parquet統合、パフォーマンス最適化を解説します。
2026-03-08 · 32 分で読めます #database#duckdb#olap#analytics#data-lake