标签: #harness-engineering
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 9 篇
奖励作弊 — 指标在涨,任务在败
如果对智能体来说,让测试通过最便宜的办法是改测试,它就会去改测试。奖励作弊不是 bug,而是对我们写下的目标的精确优化。框架工程系列第 6 篇,整理了放宽评分标准、删除断言这类常见形态,权限隔离能抹掉的那一半,以及牵制指标的设计。
2026-08-12 · 8 分钟阅读 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트什么是框架工程(Harness Engineering)— 模型是固定输入,你交付的是它周围的一切
用的是同一个模型,为什么各团队的智能体表现差这么多?对大多数团队来说,模型是固定输入,真正交付的是围绕模型的整个框架(harness):工具表面、失败返回格式、循环与停止条件、上下文策略、权限,以及评估者。这是框架工程系列第 1 篇,整理了框架的定义、六个旋钮,以及为什么提示词工程这个名字严重低估了这项工作。
2026-08-12 · 9 分钟阅读 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트成长为框架工程师 — 这个岗位为何出现,该练什么
框架工程师(harness engineer)这个头衔在招聘启事里还很少见,但这份工作已经存在于每一个部署智能体的团队里。框架工程系列收官的第 8 篇,整理了这个岗位为何出现、既有软件技能如何重新排布,以及借助框架 RPG 的六个层级,从观测与指纹到自我改进循环的分级练习路径。
2026-08-12 · 7 分钟阅读 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트评估者瓶颈 — 弱评分者会成为整个系统的上限
不管怎么修框架,分数就是不动——瓶颈可能不在框架,而在评估者。测不出来的质量就选不出来,所以弱评分者会成为整个系统的上限。框架工程系列第 5 篇,梳理了从冒烟测试到单元测试、评分细则(rubric)、封存评分数据、牵制指标面板的评估者阶梯,以及为什么必须先校准评估。
2026-08-12 · 7 分钟阅读 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트框架指纹与版本管理 — 让没有记录的变更可以追踪
没有提示词提交、没有换模型,成功率却动了——该回滚什么?框架工程系列第 7 篇讲框架指纹:把构成框架的所有决定归一化后压成一个哈希。指纹里放什么、不放什么,为什么指纹相同比较才成立,以及如何沿着指纹历史二分定位回归并回滚。
2026-08-12 · 7 分钟阅读 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트工具表面设计 — 一行 schema 就能移动成功率
加了更多工具,智能体成功率反而下降,这并不少见。工具表面就是智能体的接口:名字、描述、参数、失败返回、响应大小,全都是设计对象。框架工程系列第 3 篇,整理了工具数量的诅咒、命名空间与描述文案、防错(poka-yoke)参数设计,以及失败以什么格式返回。
2026-08-12 · 8 分钟阅读 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트上下文预算 — 设计在于去掉什么,而不是放进什么
上下文窗口明明还有富余,智能体的准确率却在往下掉。上下文是有限的注意力预算,工具的 schema 也在花这笔预算。框架工程系列第 2 篇,整理了把提示词堆积改成 playbook 的做法、丢弃策略与压缩(compaction)的标准,以及委派子智能体的真实成本。
2026-08-12 · 9 分钟阅读 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트循环设计 — 在无限循环与过早放弃之间
智能体循环的失败有两个方向:把同一个调用重复几十次的无限循环,和一碰到障碍就收工的过早停止。框架工程系列第 4 篇,整理了重试上限,固定步数、目标检查、置信度这三类停止条件,置信度停止的陷阱,以及向人和子智能体升级的路径。
2026-08-12 · 8 分钟阅读 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트框架不是配置,而是交付物 —— 自我改进循环真正的瓶颈
Lilian Weng 在 2026 年 7 月整理的那篇框架工程(harness engineering)文章,给包裹着模型的整个系统起了名字,把它当成一个工程对象。本文不复述那个定义,而是讨论:当你把框架当作带版本的交付物而不是配置文件来对待时,会有什么不同。文中梳理了给框架打指纹以捕捉回归的做法、把上下文当成 playbook 而不是越写越长的提示词的做法,以及为什么自我改进循环真正的瓶颈不是模型而是评估者。
2026-08-09 · 11 分钟阅读 #llm#agent#harness-engineering#context-engineering#evaluation