LLM 엔지니어링 · 평가와 환각 · 퀴즈
퀴즈: 평가와 환각
문항 7개. 정답과 해설은 풀어 본 뒤에 보여 드립니다.
LLM 애플리케이션에서 가장 값싸고 확실하게 자동화할 수 있는 평가는?
- 모델을 판정자로 쓰는 충실도 평가
- 사람 평가
- A/B 테스트
- 출력 형식 검사 (유효한 JSON 인가, 필수 필드가 있는가)
모델을 판정자로 쓸 때 알려진 편향으로 옳은 것은?
- 긴 답변을 선호하는 경향이 있고, 자기 자신이 만든 답에 후한 경향도 보고된다
- 짧은 답변을 선호한다
- 숫자가 포함된 답변을 무조건 거부한다
- 편향이 없어 사람 평가를 완전히 대체할 수 있다
외재적 환각과 내재적 환각의 차이는?
- 외재적은 사실 오류, 내재적은 문법 오류다
- 외재적은 짧은 답변에서 생기고, 내재적은 긴 답변에서 생긴다
- 둘은 이름만 다른 같은 현상이다
- 외재적은 컨텍스트에 없는 내용을 지어낸 것이고, 내재적은 컨텍스트에 있는 내용을 잘못 요약하거나 뒤집은 것이다
RAG 시스템에서 개선 여지를 가장 값싸게 찾을 수 있는 지점은?
- 생성된 답변의 품질에 대한 사람의 직접 평가
- 끝에서 끝까지의 응답 속도 측정
- 정답 문서 목록만 있으면 계산되는 검색 지표 (Recall@K, MRR)
- 호출별 토큰 사용량 분석
평가 집합을 만들 때의 현실적인 조언으로 가장 적절한 것은?
- 수천 개를 모을 때까지 평가를 시작하지 않는다
- 무작위로 생성한 질문을 쓴다
- 50개짜리라도 먼저 만들고, 사고가 날 때마다 그 케이스를 추가해 키운다
- 평가는 배포 후에만 한다
평가를 실행할 때 온도를 낮추는 이유는?
- 생성 토큰이 줄어 비용이 줄기 때문
- 온도가 낮으면 품질이 항상 좋아지기 때문
- 출력 변동을 줄여 프롬프트 변경의 효과를 비교하기 쉽게 하려고
- 토큰 수가 줄기 때문
'답변에 출처를 붙이는 것'의 의미로 가장 정확한 것은?
- 사용자 경험을 좋게 하기 위한 부가 기능일 뿐이다
- 환각을 완전히 없애 준다
- 검색 정확도를 높여 준다
- 잘못된 답의 피해를 줄이고 어떤 청크가 잘못 검색되는지 운영 중에 관찰하게 해 주는 안전장치다