태그: #lm-evaluation-harness
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 2 편
LLM 벤치마크 도구를 뜯어보기 — 같은 MMLU가 하네스마다 다른 점수를 내는 이유
벤치마크 점수는 모델의 속성이 아니라 특정 조건에서 수행된 측정의 결과입니다. 같은 LLaMA 65B가 같은 MMLU에서 63.6점과 48.8점을 동시에 받은 사건은, 하네스가 프롬프트를 어떻게 조립하고 정답을 어떻게 파싱하느냐가 점수의 상당 부분을 결정한다는 것을 보여 줍니다. 이 글은 평가 하네스가 내부에서 실제로 수행하는 여섯 단계를 분해하고 lm-evaluation-harness 0.
2026-08-02 · 35 분 읽기 #llm-evaluation#benchmark#lm-evaluation-harness#helm#reproducibilityAI 안전 / 평가 / 레드티밍 2026 — Inspect AI / Garak / PyRIT / Promptfoo / OpenAI Evals / lm-eval-harness 심층 가이드
2026년의 AI 안전·평가·레드티밍 생태계를 한 장에 모은다. Inspect AI(Anthropic, UK AISI 채택)·Garak(NVIDIA→독립)·PyRIT(Microsoft)·Promptfoo(YC)·OpenAI Evals·lm-evaluation-harness(EleutherAI), 그리고 MLflow Evals·Arize Phoenix·DeepEval(Confident AI)·
2026-05-16 · 35 분 읽기 #ai-safety#red-teaming#evaluation#inspect-ai#garak