标签: #coding-benchmarks
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 2 篇
编程基准与智能体时代脱节 — 排行榜错误比较智能体的三个原因
Tessl 团队于 2026 年 6 月投稿到 arXiv 的立场论文主张,如今的编程基准与智能体式软件工程存在根本性的脱节。因为基准本是为衡量单个模型而造的,我们却拿它来比较由模型、执行框架(harness)、上下文、环境、反馈相互交织而成的整个系统。论文指出了三处具体的脱节 — 把模型与执行框架混为一谈的分数、单一正解评分惩罚了正当的替代方案、缺乏组件级信号因而无法引导改进。本文梳理这一论证,并推敲更好的评测应如何朝着组件级、多正解
2026-07-11 · 10 分钟阅读 #ai#agents#evaluation#software-engineering#coding-benchmarks在 AI 编程模型评测中分辨信号与噪声 — SWE-bench 为何开始动摇
OpenAI 评测团队指出,最广泛使用的编程基准 SWE-bench Verified 因为污染和设计缺陷,已经无法再给出有意义的信号。用信号(区分模型的能力)和噪声(每次运行都会摇摆的变动)这两个维度重新审视,就会发现排行榜上相当一部分名次其实站在噪声之上。本文梳理污染、测试框架差异、无法评分的任务与过拟合是如何把分数抬高的,并结合 eval-first 原则,说明团队在挑选编程助手时为何应当用自己的任务、而非排行榜来评测。
2026-07-11 · 10 分钟阅读 #llm-evaluation#coding-benchmarks#swe-bench#benchmarks#ai-coding