标签: #helm
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 2 篇
拆解 LLM 基准测试工具 —— 为什么同一个 MMLU 在不同评测框架下分数不一样
基准分数不是模型的属性,而是在特定条件下完成的一次测量结果。同一个 LLaMA 65B 在同一个 MMLU 上同时拿到 63.6 分和 48.8 分这件事说明,评测框架如何拼装提示词、如何解析答案,很大程度上决定了分数本身。本文拆解评测框架内部实际执行的六个步骤,并对比 lm-evaluation-harness 0.4.12、HELM 0.5.16、Inspect AI。文中给出了从头到尾跑一个小模型的具体命令,也给出了手动修改任务定
2026-08-02 · 31 分钟阅读 #llm-evaluation#benchmark#lm-evaluation-harness#helm#reproducibility在 K8s 上运维 DB — CNPG、Percona、Vitess、Helm chart 完全指南
总整理在 Kubernetes 环境中运维数据库的方法。对比 CloudNativePG、Percona Operator、Vitess 以及主流 Helm chart,并分享实战运维经验。
2026-04-11 · 20 分钟阅读 #database#kubernetes#cnpg#postgresql#mysql