태그: #agent-evaluation
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 1 편
에이전트 평가 시스템 2026 — Inspect AI·Promptfoo·Phoenix·LangSmith·OpenAI Evals 심층 비교 (모델이 아니라 에이전트를 측정한다)
LLM 평가는 모델을 측정한다. 에이전트 평가는 모델 + 하네스 + 도구가 실제 작업을 끝까지 끌고 가는지를 측정한다. 두 개는 완전히 다른 문제다. 2026년 현재 에이전트 평가 프레임워크의 지도를 그린다 — UK AISI의 Inspect AI(점점 골든 스탠더드), Promptfoo(OSS CLI), Arize Phoenix(OSS 옵저버빌리티+eval), LangSmith(LangCha
2026-05-14 · 34 분 읽기 #agent-evaluation#inspect-ai#promptfoo#phoenix#langsmith