태그: #llm-evaluation
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 6 편
수집한 다음 — Langfuse 대시보드, 메트릭 API, 그리고 트레이스에 붙는 평가
트레이스를 모으는 것과 그 트레이스로 답을 얻는 것은 다른 일입니다. 이 글은 Langfuse가 제공하는 지표 축이 무엇이고 그것을 어떤 차원으로 쪼개 봐야 하는지 정리한 뒤, 메트릭 API v2의 질의 구조를 실제 요청 형태로 확인합니다. v4에서 traces 뷰가 사라지고 observations 중심으로 재편된 변화, score가 trace·observation·session·데이터셋 실
2026-08-14 · 17 분 읽기 #observability#langfuse#llm-evaluation#metrics-api#dashboardLLM 벤치마크 도구를 뜯어보기 — 같은 MMLU가 하네스마다 다른 점수를 내는 이유
벤치마크 점수는 모델의 속성이 아니라 특정 조건에서 수행된 측정의 결과입니다. 같은 LLaMA 65B가 같은 MMLU에서 63.6점과 48.8점을 동시에 받은 사건은, 하네스가 프롬프트를 어떻게 조립하고 정답을 어떻게 파싱하느냐가 점수의 상당 부분을 결정한다는 것을 보여 줍니다. 이 글은 평가 하네스가 내부에서 실제로 수행하는 여섯 단계를 분해하고 lm-evaluation-harness 0.
2026-08-02 · 35 분 읽기 #llm-evaluation#benchmark#lm-evaluation-harness#helm#reproducibility우리 서비스용 평가셋 만들기 — 트래픽 수집부터 통계적 유의성 판정까지
공개 벤치마크는 우리 문제를 대신 재 주지 않습니다. 입력 분포도, 정답의 정의도, 실패의 비용 구조도 다르기 때문입니다. 이 글은 실제 트래픽에서 사례를 건져 올려 실패 유형별로 층화하고, 정답을 정의할 수 없는 과제에 루브릭을 씌우고, 채점 스크립트를 붙이는 과정을 실제 코드로 따라갑니다. 예시가 몇 개면 충분한지 신뢰구간으로 감을 잡고, 작은 평가셋에서 두 모델의 5퍼센트포인트 차이가
2026-08-02 · 37 분 읽기 #llm-evaluation#eval-set#rubric#statistics#regression-testing텍스트·이미지·에이전트를 각각 어떻게 재는가 — 세 영역의 측정이 근본적으로 다른 이유
텍스트·이미지·에이전트는 같은 "성능"이라는 단어를 쓰지만 측정 구조가 전혀 다릅니다. 텍스트는 정답이 있는 척하는 객관식과 정답이 없는 생성형으로 갈라지고, 이미지는 분포 거리와 사람 판단이 어긋나며, 에이전트는 부분 성공·환경 상태·비결정성 때문에 애초에 하나의 숫자로 압축되지 않습니다. 이 글은 각 영역의 대표 지표가 실제로 계산하는 값을 정의 수준에서 뜯어보고, 영역마다 "지표는 높은
2026-08-02 · 37 분 읽기 #llm-evaluation#multimodal#llm-as-judge#agent-benchmark#metricsAI 코딩 모델 평가에서 신호와 잡음 가려내기 — SWE-bench가 흔들리는 이유
OpenAI 평가팀은 가장 널리 쓰이는 코딩 벤치마크인 SWE-bench Verified가 오염과 설계 결함 탓에 더 이상 의미 있는 신호를 주지 못한다고 밝혔습니다. 신호(모델을 가려내는 힘)와 잡음(실행마다 흔들리는 변동)이라는 두 축으로 다시 보면, 리더보드 순위의 상당수가 잡음 위에 서 있습니다. 오염·하네스 차이·채점 불가능한 과제·과적합이 어떻게 점수를 부풀리는지 정리하고, 팀이
2026-07-11 · 12 분 읽기 #llm-evaluation#coding-benchmarks#swe-bench#benchmarks#ai-codingAI 에이전트 & LLM 벤치마크 2026 — SWE-bench Verified / ARC-AGI 2 / GAIA / MMLU-Pro / GPQA / LiveCodeBench / Chatbot Arena 심층 가이드
2026년 현재 가장 의미 있는 AI 벤치마크 30+ 종을 한 장에 정리한다. SWE-bench / SWE-bench Verified / SWE-bench Multimodal부터 AgentBench·WebArena·GAIA, ARC-AGI 2(샹폴레의 $1M 상금), RE-Bench(METR), Frontier Math(Epoch AI), HumanEval / MBPP / LiveCodeBe
2026-05-16 · 35 분 읽기 #ai-benchmark#llm-evaluation#swe-bench#swe-bench-verified#agentbench