LabHub

LLM 서빙 · 평가와 회귀 방지 · 퀴즈

퀴즈: 평가와 회귀 방지

LabHub 에서 이어서 보기

문항 6개. 정답과 해설은 풀어 본 뒤에 보여 드립니다.

  1. 평가셋을 만들 때 가장 중요한 원칙은?

    1. 건수를 최대한 많이 모아 둘 것
    2. 모델이 틀리는 어려운 문제만 넣을 것
    3. 실제 트래픽 분포를 반영할 것 — 잘 되는 케이스만 모으면 회귀를 못 잡는다
    4. 정답이 하나뿐인 문제만 넣을 것
  2. 품질 점수만 보고 모델을 교체하면 안 되는 이유는?

    1. 평가 점수 자체가 부정확하기 때문에
    2. 평가셋이 작아 신뢰할 수 없기 때문에
    3. 모델이 바뀌면 프롬프트도 바뀌어서
    4. 품질이 조금 올라도 지연과 비용이 함께 나빠지면 개선이 아니라서
  3. LLM 을 심판으로 쓰는 채점 방식의 주의점은?

    1. 채점에 사람보다 시간이 오래 걸린다
    2. 심판 자체가 흔들리므로 기준 프롬프트와 심판 모델 버전을 고정해야 한다
    3. 채점 한 건마다 호출 비용이 든다
    4. 사람 채점보다 언제나 정확하다
  4. 회귀 판정 임계를 정할 때의 기준은?

    1. 임계를 0 으로 두고 모두 잡는다
    2. 10퍼센트포인트로 항상 고정한다
    3. 임계 없이 점수만 기록해 둔다
    4. 측정 노이즈보다 커야 한다 — 3퍼센트포인트가 출발점
  5. 평가 하네스를 CI 에 넣는 것이 결정적인 이유는?

    1. 손으로 돌리는 것보다 빨라서
    2. 평가 호출 비용을 줄일 수 있어서
    3. 사람이 기억해서 돌리는 평가는 결국 안 돌아가기 때문
    4. 업계에서 표준 절차로 굳었기 때문에
  6. 사용자 문의로 발견된 실패 케이스를 어떻게 다루는 것이 좋은가?

    1. 평가셋에 추가해 같은 실패가 두 번 나지 않게 한다
    2. 문서에 기록만 한다
    3. 무시한다
    4. 별도 대시보드를 만든다