LLM 서빙 · 평가와 회귀 방지 · 퀴즈
퀴즈: 평가와 회귀 방지
문항 6개. 정답과 해설은 풀어 본 뒤에 보여 드립니다.
평가셋을 만들 때 가장 중요한 원칙은?
- 건수를 최대한 많이 모아 둘 것
- 모델이 틀리는 어려운 문제만 넣을 것
- 실제 트래픽 분포를 반영할 것 — 잘 되는 케이스만 모으면 회귀를 못 잡는다
- 정답이 하나뿐인 문제만 넣을 것
품질 점수만 보고 모델을 교체하면 안 되는 이유는?
- 평가 점수 자체가 부정확하기 때문에
- 평가셋이 작아 신뢰할 수 없기 때문에
- 모델이 바뀌면 프롬프트도 바뀌어서
- 품질이 조금 올라도 지연과 비용이 함께 나빠지면 개선이 아니라서
LLM 을 심판으로 쓰는 채점 방식의 주의점은?
- 채점에 사람보다 시간이 오래 걸린다
- 심판 자체가 흔들리므로 기준 프롬프트와 심판 모델 버전을 고정해야 한다
- 채점 한 건마다 호출 비용이 든다
- 사람 채점보다 언제나 정확하다
회귀 판정 임계를 정할 때의 기준은?
- 임계를 0 으로 두고 모두 잡는다
- 10퍼센트포인트로 항상 고정한다
- 임계 없이 점수만 기록해 둔다
- 측정 노이즈보다 커야 한다 — 3퍼센트포인트가 출발점
평가 하네스를 CI 에 넣는 것이 결정적인 이유는?
- 손으로 돌리는 것보다 빨라서
- 평가 호출 비용을 줄일 수 있어서
- 사람이 기억해서 돌리는 평가는 결국 안 돌아가기 때문
- 업계에서 표준 절차로 굳었기 때문에
사용자 문의로 발견된 실패 케이스를 어떻게 다루는 것이 좋은가?
- 평가셋에 추가해 같은 실패가 두 번 나지 않게 한다
- 문서에 기록만 한다
- 무시한다
- 별도 대시보드를 만든다