タグ: #openai-evals
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 2 件
AI 安全 / 評価 / レッドチーミング 2026 — Inspect AI / Garak / PyRIT / Promptfoo / OpenAI Evals / lm-eval-harness 深掘りガイド
2026年のAI安全・評価・レッドチーミング エコシステムを1枚にまとめる。Inspect AI(Anthropic、UK AISI採用)、Garak(NVIDIA→独立)、PyRIT(Microsoft)、Promptfoo(YC)、OpenAI Evals、lm-evaluation-harness(EleutherAI)、そして MLflow Evals・Arize Phoenix・DeepEval(Confident AI)・G
2026-05-16 · 31 分で読めます #ai-safety#red-teaming#evaluation#inspect-ai#garakagent 評価システム 2026 — Inspect AI・Promptfoo・Phoenix・LangSmith・OpenAI Evals 徹底比較(モデルではなく agent を測る)
LLM 評価はモデルを測る。agent 評価はモデル + harness + tool が作業を最後まで完遂するかを測る。これは別の問題だ。2026 年現在の agent 評価フレームワークの地図を描く — UK AISI の Inspect AI(事実上の gold standard 化)、Promptfoo(OSS CLI)、Arize Phoenix(OSS observability + eval)、LangSmith(Lang
2026-05-14 · 29 分で読めます #agent-evaluation#inspect-ai#promptfoo#phoenix#langsmith