标签: #signal-vs-noise
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 1 篇
在 AI 编程模型评测中分辨信号与噪声 — SWE-bench 为何开始动摇
OpenAI 评测团队指出,最广泛使用的编程基准 SWE-bench Verified 因为污染和设计缺陷,已经无法再给出有意义的信号。用信号(区分模型的能力)和噪声(每次运行都会摇摆的变动)这两个维度重新审视,就会发现排行榜上相当一部分名次其实站在噪声之上。本文梳理污染、测试框架差异、无法评分的任务与过拟合是如何把分数抬高的,并结合 eval-first 原则,说明团队在挑选编程助手时为何应当用自己的任务、而非排行榜来评测。
2026-07-11 · 10 分钟阅读 #llm-evaluation#coding-benchmarks#swe-bench#benchmarks#ai-coding