퀴즈: 임베딩과 로짓
임베딩 조회(table[token_id])와 원-핫 벡터에 행렬을 곱하는 것의 관계는?
- 값이 같은 한 연산이고 조회는 곱셈을 건너뛴 지름길이다
- 값이 다른 두 연산이고 조회 쪽이 근사값을 준다
- 원-핫 곱은 학습 때만 쓰고 조회는 추론 때만 쓴다
- 조회는 정수를 주고 원-핫 곱은 실수를 주는 차이가 있다
어휘 크기를 두 배로 늘리고 폭은 그대로 두면 임베딩 표의 파라미터 수는?
- 폭을 안 건드렸으므로 그대로다
- 두 배가 된다. 표의 줄 수가 두 배이기 때문이다
- 네 배가 된다. 줄과 칸이 함께 늘기 때문이다
- 절반이 된다. 조각이 더 잘게 나뉘기 때문이다
가중치 묶기(weight tying)를 했을 때와 안 했을 때의 파라미터 수 차이는?
- 묶으면 폭이 절반이 되어 표가 얇아진다
- 차이가 없고 계산 순서만 달라진다
- 묶으면 어휘가 절반으로 줄어 표가 작아진다
- 묶으면 표 한 벌, 안 묶으면 두 벌이라 어휘수 곱하기 폭만큼 차이 난다
표의 한 줄만 길이를 4배로 늘였다. 그 줄에 대해 바뀌는 것과 안 바뀌는 것은?
- 코사인과 내적이 둘 다 4배가 된다
- 코사인이 4배가 되고 내적은 그대로다
- 코사인은 그대로이고 내적이 4배가 된다
- 둘 다 그대로다. 방향을 안 바꿨기 때문이다
가중치를 묶은 모델에서 은닉 벡터에 어떤 토큰의 임베딩을 그대로 넣으면?
- 모든 토큰의 점수가 같아진다
- 그 토큰의 점수가 가장 커지기 쉽다
- 그 토큰의 점수만 0 이 된다
- 점수가 어휘 크기에 반비례해 작아진다
임베딩에 √d 를 곱하면 무엇이 달라지는가?
- 방향이 √d 만큼 돌아가고 크기는 그대로다
- 표의 줄 수가 √d 배로 늘어난다
- 벡터의 크기가 √d 배가 되고 방향은 그대로다
- 값의 부호가 뒤집히면서 크기가 커진다