标签: #parquet
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 2 篇
Parquet 2.13.0 的 nan_count 与 IEEE 754 total order — float 统计用 3 年 3 个月才修好的故事
Parquet 的 min/max 统计,是让查询引擎跳过数据的机制。但在浮点数列上,这套机制已经悄悄坏了 10 多年 — NaN 在任何比较中都返回 false,因此会被排除在统计之外,结果就是包含 NaN 的页面,可能在查找大于 max 的值的查询中被整页跳过。这不是性能问题,而是结果错误的问题。2026 年 6 月 13 日发布的 parquet-format 2.13.0,通过引入 nancount 字段和一个叫 IEEE754
2026-07-16 · 25 分钟阅读 #data-engineering#parquet#columnar-storage#apache-arrowInfluxDB 3 Core 的「72 小时限制」其实是 432 个文件的限制 — Parquet 重写留下的账单
InfluxDB 3 把整个引擎用 Rust 重写,并把存储层架在了 Apache Arrow 和 Parquet 之上。坊间常说「Core 只能查询最近 72 小时」,但翻遍源码也找不到这样的代码。真正存在的只有一件事 — 单次查询能扫描的 Parquet 文件数上限为 432,而 72 小时不过是用默认 gen1 时间块 10 分钟乘出来的派生值,还是最理想情况下的数字。本文逐行追踪 432 这个数字在源码里的来处,确认了 2025
2026-07-16 · 28 分钟阅读 #database#influxdb#time-series#parquet#storage-engine