标签: #llm-as-judge
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 4 篇
评估者瓶颈 — 弱评分者会成为整个系统的上限
不管怎么修框架,分数就是不动——瓶颈可能不在框架,而在评估者。测不出来的质量就选不出来,所以弱评分者会成为整个系统的上限。框架工程系列第 5 篇,梳理了从冒烟测试到单元测试、评分细则(rubric)、封存评分数据、牵制指标面板的评估者阶梯,以及为什么必须先校准评估。
2026-08-12 · 7 分钟阅读 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트评估驱动开发里,最先要校准的是评判者
Airbnb 工程团队在 2026 年 7 月发布的评估驱动开发复盘,与其说是在讲「先把评测集写出来」,不如说是在讲「负责打分的那个模型必须先被承认为一台量具」。本文整理了用 50 到 100 条黄金集校准评判者模型的流程、一致度为什么要用 kappa 而不是简单准确率来度量,以及未经校准的评判者如何把整个团队优化到错误的方向上去 —— 并附可运行的代码。
2026-08-09 · 13 分钟阅读 #ai#llm#eval-driven-development#llm-as-judge#evaluation文本、图像、智能体分别怎么测 —— 三个领域的测量为何根本不同
文本、图像、智能体都在用"性能"这同一个词,但测量结构完全不同。文本分裂成假装有正确答案的选择题和没有正确答案的生成式任务;图像的分布距离和人类判断对不上;智能体则因为部分成功、环境状态、非确定性,从一开始就无法压缩成一个数字。本文在定义层面拆解各领域代表性指标实际计算的是什么,并为每个领域各配上一个"指标很高但实际很差"的案例。最后用一张表总结领域、任务、指标,以及每个指标遗漏了什么。
2026-08-02 · 32 分钟阅读 #llm-evaluation#multimodal#llm-as-judge#agent-benchmark#metrics不靠感觉做 LLM 评测 — 样本量、评判者偏差与 CI 回归测试
改完提示就凭“好像变好了”上线的团队,没有办法看见悄悄堆积的回归。本文把评测分成断言、黄金数据集、LLM-as-judge、人工评估四个层次,梳理各自的成本与可信度,并讲清如何抵消评判模型的位置偏差和长度偏好。文中算出用 20 个样例得出的结论其置信区间到底有多宽,并用代码展示配对比较能把所需样本压到几分之一。还包括在温度 0 也无法完全复现的环境里如何搭建 CI 回归测试。
2026-07-26 · 16 分钟阅读 #llm#evaluation#llm-as-judge#statistics#regression-testing