태그: #regression-testing
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 3 편
하네스 지문과 버전 관리 — 기록 없는 변경을 추적 가능하게
프롬프트 커밋도 모델 변경도 없는데 성공률이 움직였다면, 무엇을 되돌려야 할까요. 하네스 엔지니어링 시리즈 7편은 하네스를 구성하는 모든 결정을 정규화된 해시 하나로 요약하는 하네스 지문을 다룹니다. 지문에 무엇을 넣고 무엇을 빼는지, 왜 지문이 같아야 비교가 성립하는지, 그리고 지문 이력으로 회귀를 이등분해 롤백하는 방법까지 정리했습니다.
2026-08-12 · 9 분 읽기 #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트우리 서비스용 평가셋 만들기 — 트래픽 수집부터 통계적 유의성 판정까지
공개 벤치마크는 우리 문제를 대신 재 주지 않습니다. 입력 분포도, 정답의 정의도, 실패의 비용 구조도 다르기 때문입니다. 이 글은 실제 트래픽에서 사례를 건져 올려 실패 유형별로 층화하고, 정답을 정의할 수 없는 과제에 루브릭을 씌우고, 채점 스크립트를 붙이는 과정을 실제 코드로 따라갑니다. 예시가 몇 개면 충분한지 신뢰구간으로 감을 잡고, 작은 평가셋에서 두 모델의 5퍼센트포인트 차이가
2026-08-02 · 37 분 읽기 #llm-evaluation#eval-set#rubric#statistics#regression-testingLLM 평가를 감으로 하지 않는 법 — 표본 크기, 심사자 편향, CI 회귀 테스트
프롬프트를 고치고 "좋아진 것 같다"로 배포하는 팀은 조용히 쌓이는 회귀를 볼 방법이 없습니다. 평가를 어서션, 골든 데이터셋, LLM 심사자, 사람 평가의 네 층위로 나눠 각각의 비용과 신뢰도를 정리하고, 심사자 모델의 위치 편향과 길이 선호를 어떻게 상쇄하는지 다룹니다. 예시 20개로 낸 결론의 신뢰구간이 실제로 얼마나 넓은지 계산하고, 짝지은 비교가 필요 표본을 몇 분의 일로 줄이는지
2026-07-26 · 19 분 읽기 #llm#evaluation#llm-as-judge#statistics#regression-testing