标签: #reproducibility
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 2 篇
LLM Ops 到底在做什么 —— 可复现性、数据污染、检查点、模型晋升与回滚
本文把 LLM Ops 整理成一份责任清单,而不是工具清单。内容包括:让训练运行可以被重建的运行清单里应该包含什么、如何防止并审计评测集的数据污染、从故障率反推检查点间隔的公式与保存成本的真实数字、把评测接入 CI 时应该以什么作为门槛。后半部分讨论训练与服务之间的交接实际会在哪些地方出问题、部署后的回归检测,以及回滚设计。工具只按类别介绍,不涉及厂商定价。
2026-08-02 · 20 分钟阅读 #mlops#llmops#reproducibility#evaluation#model-registry拆解 LLM 基准测试工具 —— 为什么同一个 MMLU 在不同评测框架下分数不一样
基准分数不是模型的属性,而是在特定条件下完成的一次测量结果。同一个 LLaMA 65B 在同一个 MMLU 上同时拿到 63.6 分和 48.8 分这件事说明,评测框架如何拼装提示词、如何解析答案,很大程度上决定了分数本身。本文拆解评测框架内部实际执行的六个步骤,并对比 lm-evaluation-harness 0.4.12、HELM 0.5.16、Inspect AI。文中给出了从头到尾跑一个小模型的具体命令,也给出了手动修改任务定
2026-08-02 · 31 分钟阅读 #llm-evaluation#benchmark#lm-evaluation-harness#helm#reproducibility