标签: #reward-hacking
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 1 篇
奖励作弊 — 指标在涨,任务在败
如果对智能体来说,让测试通过最便宜的办法是改测试,它就会去改测试。奖励作弊不是 bug,而是对我们写下的目标的精确优化。框架工程系列第 6 篇,整理了放宽评分标准、删除断言这类常见形态,权限隔离能抹掉的那一半,以及牵制指标的设计。
2026-08-12 · 8 分钟阅读 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트