标签: #spark
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 2 篇
PySpark 4.2,Python UDF 默认搭上 Arrow — 类型强制转换225格里132格发生变化的故事
2026年7月14日发布的 Apache Spark 4.2.0 通过 SPARK-54555 把 spark.sql.execution.pythonUDF.arrow.enabled 的默认值从 false 反转成了 true。厂商博客把这称为"无需重写代码就能获得更快的列式路径",但整个发布里都没有公开 Arrow 与 pickle 之间的速度对比数字。而真正的故事不是速度,而是类型强制转换。实际 diff 两份检入 Spark
2026-07-16 · 23 分钟阅读 #spark#python#arrow#data-engineeringIceberg v3 行血统 — 行 ID 不存放在文件里
Apache Iceberg 格式 v3 把「为每一行赋予稳定标识符」的行血统(row lineage)写进了规范,而且这不是可选项 — 只要是 v3 表就无条件开启。但这个值并不存放在数据文件里 — 而是通过一条从表的 next-row-id,经快照、清单(manifest),一路继承到数据文件的链条,在读取时才计算出来。这样设计是为了让乐观提交重试时不必重写数据文件,代价是维护血统的责任转移到了每一个 writer 身上。本文沿着规
2026-07-16 · 27 分钟阅读 #iceberg#lakehouse#table-format#data-engineering#spark