LabHub

LLM 엔지니어링 · 토크나이저와 임베딩 · 퀴즈

퀴즈: 토크나이저와 임베딩

LabHub 에서 이어서 보기

문항 7개. 정답과 해설은 풀어 본 뒤에 보여 드립니다.

  1. BPE 가 단어 단위 토큰화와 문자 단위 토큰화의 문제를 동시에 푸는 방식은?

    1. 언어별 형태소 분석기를 내장해 어절을 의미 단위로 잘라서
    2. 문자에서 시작해 자주 인접하는 쌍을 합쳐, 흔한 단어는 통째로 드문 단어는 조각으로
    3. 단어를 해시 값으로 바꿔 고정 크기 어휘집에 밀어 넣어서
    4. 어휘집에 없는 단어를 미지 토큰의 무작위 벡터로 대체해서
  2. 같은 내용의 문장이 한국어일 때 영어보다 토큰 수가 많은 주된 이유는?

    1. 한글 한 글자가 UTF-8 로 3바이트라 토큰도 그만큼 늘어나서
    2. 토크나이저가 영어 위주 코퍼스로 학습돼 한국어 어절이 병합 규칙에 안 잡혀서
    3. 한국어는 조사와 어미가 붙어 공백으로 나뉘는 조각이 더 많아서
    4. 자모 분리 같은 유니코드 정규화를 거치며 글자 수가 늘어나서
  3. 모델이 '이 단어의 세 번째 글자'를 묻는 질문에 유독 약한 이유는?

    1. 모델이 보는 단위가 토큰이라 문자 경계 정보를 직접 갖고 있지 않아서
    2. 학습 데이터에 글자 세기를 시키는 예제가 거의 없어 배우지 못해서
    3. 토큰을 벡터로 바꾸는 과정에서 문자 인코딩 정보가 사라지기 때문에
    4. 어텐션이 가까운 토큰만 보므로 단어 안쪽까지 보지 못하기 때문에
  4. TF-IDF 에서 IDF 를 곱하는 목적은?

    1. 문서가 길수록 빈도가 커지는 것을 상쇄해 길이 편향을 없애려고
    2. 모든 문서에 흔히 나와 문서를 구분하지 못하는 항의 가중치를 낮추려고
    3. 벡터의 길이를 1 로 맞춰 문서 간 비교를 가능하게 하려고
    4. 오타나 표기 흔들림이 있는 단어의 영향을 줄이려고
  5. TF-IDF 벡터를 L2 정규화하는 이유는?

    1. 값의 범위가 좁아져 부동소수 연산이 빨라지기 때문
    2. 음수 성분이 사라져 유사도가 늘 0 이상으로 나오기 때문
    3. 성분 대부분이 0 으로 눌려 실질 차원이 줄어들기 때문
    4. 내적이 곧 코사인 유사도가 되고 문서 길이의 영향이 사라지기 때문
  6. 해싱 트릭의 대가는?

    1. 어휘 사전을 저장해야 한다
    2. 벡터가 정규화되지 않는다
    3. 역방향 조회가 빨라진다
    4. 서로 다른 항이 같은 버킷에 충돌해 구분할 수 없게 된다
  7. TF-IDF 검색이 신경망 임베딩보다 오히려 강한 경우는?

    1. 같은 뜻을 다른 말로 표현한 동의어·의역이 많은 질의
    2. 제품 코드나 오류 코드처럼 정확히 그 문자열을 찾아야 하는 질의
    3. 여러 언어가 한 문장에 섞여 들어오는 다국어 질의
    4. 문단 하나 분량으로 아주 긴 서술형 질의