태그: #eval-set
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 1 편
우리 서비스용 평가셋 만들기 — 트래픽 수집부터 통계적 유의성 판정까지
공개 벤치마크는 우리 문제를 대신 재 주지 않습니다. 입력 분포도, 정답의 정의도, 실패의 비용 구조도 다르기 때문입니다. 이 글은 실제 트래픽에서 사례를 건져 올려 실패 유형별로 층화하고, 정답을 정의할 수 없는 과제에 루브릭을 씌우고, 채점 스크립트를 붙이는 과정을 실제 코드로 따라갑니다. 예시가 몇 개면 충분한지 신뢰구간으로 감을 잡고, 작은 평가셋에서 두 모델의 5퍼센트포인트 차이가
2026-08-02 · 37 분 읽기 #llm-evaluation#eval-set#rubric#statistics#regression-testing