LLM 엔지니어링 · 토크나이저와 임베딩 · 퀴즈
퀴즈: 토크나이저와 임베딩
문항 7개. 정답과 해설은 풀어 본 뒤에 보여 드립니다.
BPE 가 단어 단위 토큰화와 문자 단위 토큰화의 문제를 동시에 푸는 방식은?
- 언어별 형태소 분석기를 내장해 어절을 의미 단위로 잘라서
- 문자에서 시작해 자주 인접하는 쌍을 합쳐, 흔한 단어는 통째로 드문 단어는 조각으로
- 단어를 해시 값으로 바꿔 고정 크기 어휘집에 밀어 넣어서
- 어휘집에 없는 단어를 미지 토큰의 무작위 벡터로 대체해서
같은 내용의 문장이 한국어일 때 영어보다 토큰 수가 많은 주된 이유는?
- 한글 한 글자가 UTF-8 로 3바이트라 토큰도 그만큼 늘어나서
- 토크나이저가 영어 위주 코퍼스로 학습돼 한국어 어절이 병합 규칙에 안 잡혀서
- 한국어는 조사와 어미가 붙어 공백으로 나뉘는 조각이 더 많아서
- 자모 분리 같은 유니코드 정규화를 거치며 글자 수가 늘어나서
모델이 '이 단어의 세 번째 글자'를 묻는 질문에 유독 약한 이유는?
- 모델이 보는 단위가 토큰이라 문자 경계 정보를 직접 갖고 있지 않아서
- 학습 데이터에 글자 세기를 시키는 예제가 거의 없어 배우지 못해서
- 토큰을 벡터로 바꾸는 과정에서 문자 인코딩 정보가 사라지기 때문에
- 어텐션이 가까운 토큰만 보므로 단어 안쪽까지 보지 못하기 때문에
TF-IDF 에서 IDF 를 곱하는 목적은?
- 문서가 길수록 빈도가 커지는 것을 상쇄해 길이 편향을 없애려고
- 모든 문서에 흔히 나와 문서를 구분하지 못하는 항의 가중치를 낮추려고
- 벡터의 길이를 1 로 맞춰 문서 간 비교를 가능하게 하려고
- 오타나 표기 흔들림이 있는 단어의 영향을 줄이려고
TF-IDF 벡터를 L2 정규화하는 이유는?
- 값의 범위가 좁아져 부동소수 연산이 빨라지기 때문
- 음수 성분이 사라져 유사도가 늘 0 이상으로 나오기 때문
- 성분 대부분이 0 으로 눌려 실질 차원이 줄어들기 때문
- 내적이 곧 코사인 유사도가 되고 문서 길이의 영향이 사라지기 때문
해싱 트릭의 대가는?
- 어휘 사전을 저장해야 한다
- 벡터가 정규화되지 않는다
- 역방향 조회가 빨라진다
- 서로 다른 항이 같은 버킷에 충돌해 구분할 수 없게 된다
TF-IDF 검색이 신경망 임베딩보다 오히려 강한 경우는?
- 같은 뜻을 다른 말로 표현한 동의어·의역이 많은 질의
- 제품 코드나 오류 코드처럼 정확히 그 문자열을 찾아야 하는 질의
- 여러 언어가 한 문장에 섞여 들어오는 다국어 질의
- 문단 하나 분량으로 아주 긴 서술형 질의