标签: #eval-driven-development
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 1 篇
评估驱动开发里,最先要校准的是评判者
Airbnb 工程团队在 2026 年 7 月发布的评估驱动开发复盘,与其说是在讲「先把评测集写出来」,不如说是在讲「负责打分的那个模型必须先被承认为一台量具」。本文整理了用 50 到 100 条黄金集校准评判者模型的流程、一致度为什么要用 kappa 而不是简单准确率来度量,以及未经校准的评判者如何把整个团队优化到错误的方向上去 —— 并附可运行的代码。
2026-08-09 · 13 分钟阅读 #ai#llm#eval-driven-development#llm-as-judge#evaluation