LabHub

LLM 엔지니어링 · 평가와 환각 · 퀴즈

퀴즈: 평가와 환각

LabHub 에서 이어서 보기

문항 7개. 정답과 해설은 풀어 본 뒤에 보여 드립니다.

  1. LLM 애플리케이션에서 가장 값싸고 확실하게 자동화할 수 있는 평가는?

    1. 모델을 판정자로 쓰는 충실도 평가
    2. 사람 평가
    3. A/B 테스트
    4. 출력 형식 검사 (유효한 JSON 인가, 필수 필드가 있는가)
  2. 모델을 판정자로 쓸 때 알려진 편향으로 옳은 것은?

    1. 긴 답변을 선호하는 경향이 있고, 자기 자신이 만든 답에 후한 경향도 보고된다
    2. 짧은 답변을 선호한다
    3. 숫자가 포함된 답변을 무조건 거부한다
    4. 편향이 없어 사람 평가를 완전히 대체할 수 있다
  3. 외재적 환각과 내재적 환각의 차이는?

    1. 외재적은 사실 오류, 내재적은 문법 오류다
    2. 외재적은 짧은 답변에서 생기고, 내재적은 긴 답변에서 생긴다
    3. 둘은 이름만 다른 같은 현상이다
    4. 외재적은 컨텍스트에 없는 내용을 지어낸 것이고, 내재적은 컨텍스트에 있는 내용을 잘못 요약하거나 뒤집은 것이다
  4. RAG 시스템에서 개선 여지를 가장 값싸게 찾을 수 있는 지점은?

    1. 생성된 답변의 품질에 대한 사람의 직접 평가
    2. 끝에서 끝까지의 응답 속도 측정
    3. 정답 문서 목록만 있으면 계산되는 검색 지표 (Recall@K, MRR)
    4. 호출별 토큰 사용량 분석
  5. 평가 집합을 만들 때의 현실적인 조언으로 가장 적절한 것은?

    1. 수천 개를 모을 때까지 평가를 시작하지 않는다
    2. 무작위로 생성한 질문을 쓴다
    3. 50개짜리라도 먼저 만들고, 사고가 날 때마다 그 케이스를 추가해 키운다
    4. 평가는 배포 후에만 한다
  6. 평가를 실행할 때 온도를 낮추는 이유는?

    1. 생성 토큰이 줄어 비용이 줄기 때문
    2. 온도가 낮으면 품질이 항상 좋아지기 때문
    3. 출력 변동을 줄여 프롬프트 변경의 효과를 비교하기 쉽게 하려고
    4. 토큰 수가 줄기 때문
  7. '답변에 출처를 붙이는 것'의 의미로 가장 정확한 것은?

    1. 사용자 경험을 좋게 하기 위한 부가 기능일 뿐이다
    2. 환각을 완전히 없애 준다
    3. 검색 정확도를 높여 준다
    4. 잘못된 답의 피해를 줄이고 어떤 청크가 잘못 검색되는지 운영 중에 관찰하게 해 주는 안전장치다