タグ: #lm-evaluation-harness
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 3 件
LLMベンチマークツールを分解する — 同じMMLUがハーネスごとに違うスコアを出す理由
ベンチマークのスコアはモデルの属性ではなく、特定の条件下で行われた測定の結果です。同じLLaMA 65Bが同じMMLUで63.6点と48.8点を同時に取った事件は、ハーネスがプロンプトをどう組み立て、正解をどうパースするかがスコアのかなりの部分を決めることを示しています。この記事は評価ハーネスが内部で実際に行っている六つの段階を分解し、lm-evaluation-harness 0.4.12、HELM 0.5.16、Inspect AI
2026-08-02 · 35 分で読めます #llm-evaluation#benchmark#lm-evaluation-harness#helm#reproducibilityAI 安全 / 評価 / レッドチーミング 2026 — Inspect AI / Garak / PyRIT / Promptfoo / OpenAI Evals / lm-eval-harness 深掘りガイド
2026年のAI安全・評価・レッドチーミング エコシステムを1枚にまとめる。Inspect AI(Anthropic、UK AISI採用)、Garak(NVIDIA→独立)、PyRIT(Microsoft)、Promptfoo(YC)、OpenAI Evals、lm-evaluation-harness(EleutherAI)、そして MLflow Evals・Arize Phoenix・DeepEval(Confident AI)・G
2026-05-16 · 31 分で読めます #ai-safety#red-teaming#evaluation#inspect-ai#garakLLM評価・ベンチマーク完全ガイド:本当に重要なことを測定する
LLMの評価とベンチマークに関する包括的なガイドです。標準的な学術ベンチマーク(MMLU、HELM、MT-Bench)、本番環境での評価パイプライン、LLM-as-judge、人間による評価、RAG評価、安全性テスト、実用的なカスタム評価フレームワークの構築方法までを網羅しています。
2026-03-17 · 27 分で読めます #llm#evaluation#benchmark#mmlu#helm