标签: #lm-evaluation-harness
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 1 篇
拆解 LLM 基准测试工具 —— 为什么同一个 MMLU 在不同评测框架下分数不一样
基准分数不是模型的属性,而是在特定条件下完成的一次测量结果。同一个 LLaMA 65B 在同一个 MMLU 上同时拿到 63.6 分和 48.8 分这件事说明,评测框架如何拼装提示词、如何解析答案,很大程度上决定了分数本身。本文拆解评测框架内部实际执行的六个步骤,并对比 lm-evaluation-harness 0.4.12、HELM 0.5.16、Inspect AI。文中给出了从头到尾跑一个小模型的具体命令,也给出了手动修改任务定
2026-08-02 · 31 分钟阅读 #llm-evaluation#benchmark#lm-evaluation-harness#helm#reproducibility