태그: #llm-eval
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 2 편
에이전트 평가 시스템 2026 — Inspect AI·Promptfoo·Phoenix·LangSmith·OpenAI Evals 심층 비교 (모델이 아니라 에이전트를 측정한다)
LLM 평가는 모델을 측정한다. 에이전트 평가는 모델 + 하네스 + 도구가 실제 작업을 끝까지 끌고 가는지를 측정한다. 두 개는 완전히 다른 문제다. 2026년 현재 에이전트 평가 프레임워크의 지도를 그린다 — UK AISI의 Inspect AI(점점 골든 스탠더드), Promptfoo(OSS CLI), Arize Phoenix(OSS 옵저버빌리티+eval), LangSmith(LangCha
2026-05-14 · 34 분 읽기 #agent-evaluation#inspect-ai#promptfoo#phoenix#langsmithLLM 평가 & 관측성 완전 가이드: Eval Harness, LLM-as-Judge, Tracing, 회귀 방지 (2025)
모델을 바꿨더니 더 좋아진 것 "같다"는 주장은 과학이 아니다. 2025년 LLM 제품의 실패 원인 1위는 "측정 안 함". Eval harness 설계, LLM-as-judge 함정과 보정, Trace·Span·Metric 3층 관측성, 프로덕션 피드백 루프, Phoenix·LangSmith·LangFuse·Helicone 비교까지. 평가를 제품 개발의 근간으로 세우는 법.
2026-04-15 · 19 분 읽기 #llm-eval#observability#llm-judge#distributed-tracing#langsmith