标签: #llm-evaluation
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 4 篇
为自家服务搭建评测集 —— 从流量采集到统计显著性判定
公开基准测试没法替你测量自己的问题,因为输入分布、正确答案的定义、失败的成本结构统统不一样。本文用真实代码走一遍完整流程:从实际流量里捞出案例、按失败类型分层、给没有唯一正确答案的任务套上评分细则(rubric)、接上打分脚本。文章还讲了如何用置信区间估算需要多少样本才够、以及如何用 McNemar 检验和自助法(bootstrap)判断小评测集上两个模型 5 个百分点的差距是否具有统计意义。最后整理了如何把评测集接入 CI、如何防止污
2026-08-02 · 32 分钟阅读 #llm-evaluation#eval-set#rubric#statistics#regression-testing拆解 LLM 基准测试工具 —— 为什么同一个 MMLU 在不同评测框架下分数不一样
基准分数不是模型的属性,而是在特定条件下完成的一次测量结果。同一个 LLaMA 65B 在同一个 MMLU 上同时拿到 63.6 分和 48.8 分这件事说明,评测框架如何拼装提示词、如何解析答案,很大程度上决定了分数本身。本文拆解评测框架内部实际执行的六个步骤,并对比 lm-evaluation-harness 0.4.12、HELM 0.5.16、Inspect AI。文中给出了从头到尾跑一个小模型的具体命令,也给出了手动修改任务定
2026-08-02 · 31 分钟阅读 #llm-evaluation#benchmark#lm-evaluation-harness#helm#reproducibility文本、图像、智能体分别怎么测 —— 三个领域的测量为何根本不同
文本、图像、智能体都在用"性能"这同一个词,但测量结构完全不同。文本分裂成假装有正确答案的选择题和没有正确答案的生成式任务;图像的分布距离和人类判断对不上;智能体则因为部分成功、环境状态、非确定性,从一开始就无法压缩成一个数字。本文在定义层面拆解各领域代表性指标实际计算的是什么,并为每个领域各配上一个"指标很高但实际很差"的案例。最后用一张表总结领域、任务、指标,以及每个指标遗漏了什么。
2026-08-02 · 32 分钟阅读 #llm-evaluation#multimodal#llm-as-judge#agent-benchmark#metrics在 AI 编程模型评测中分辨信号与噪声 — SWE-bench 为何开始动摇
OpenAI 评测团队指出,最广泛使用的编程基准 SWE-bench Verified 因为污染和设计缺陷,已经无法再给出有意义的信号。用信号(区分模型的能力)和噪声(每次运行都会摇摆的变动)这两个维度重新审视,就会发现排行榜上相当一部分名次其实站在噪声之上。本文梳理污染、测试框架差异、无法评分的任务与过拟合是如何把分数抬高的,并结合 eval-first 原则,说明团队在挑选编程助手时为何应当用自己的任务、而非排行榜来评测。
2026-07-11 · 10 分钟阅读 #llm-evaluation#coding-benchmarks#swe-bench#benchmarks#ai-coding