标签: #regression-testing
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 3 篇
框架指纹与版本管理 — 让没有记录的变更可以追踪
没有提示词提交、没有换模型,成功率却动了——该回滚什么?框架工程系列第 7 篇讲框架指纹:把构成框架的所有决定归一化后压成一个哈希。指纹里放什么、不放什么,为什么指纹相同比较才成立,以及如何沿着指纹历史二分定位回归并回滚。
2026-08-12 · 7 分钟阅读 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트为自家服务搭建评测集 —— 从流量采集到统计显著性判定
公开基准测试没法替你测量自己的问题,因为输入分布、正确答案的定义、失败的成本结构统统不一样。本文用真实代码走一遍完整流程:从实际流量里捞出案例、按失败类型分层、给没有唯一正确答案的任务套上评分细则(rubric)、接上打分脚本。文章还讲了如何用置信区间估算需要多少样本才够、以及如何用 McNemar 检验和自助法(bootstrap)判断小评测集上两个模型 5 个百分点的差距是否具有统计意义。最后整理了如何把评测集接入 CI、如何防止污
2026-08-02 · 32 分钟阅读 #llm-evaluation#eval-set#rubric#statistics#regression-testing不靠感觉做 LLM 评测 — 样本量、评判者偏差与 CI 回归测试
改完提示就凭“好像变好了”上线的团队,没有办法看见悄悄堆积的回归。本文把评测分成断言、黄金数据集、LLM-as-judge、人工评估四个层次,梳理各自的成本与可信度,并讲清如何抵消评判模型的位置偏差和长度偏好。文中算出用 20 个样例得出的结论其置信区间到底有多宽,并用代码展示配对比较能把所需样本压到几分之一。还包括在温度 0 也无法完全复现的环境里如何搭建 CI 回归测试。
2026-07-26 · 16 分钟阅读 #llm#evaluation#llm-as-judge#statistics#regression-testing