测验:MHA、MQA 与 GQA
한국어 원문으로 표시합니다.
질의 헤드 8개를 그대로 두고 키·값 헤드만 2개로 줄였다. 무엇이 줄어드는가?
- 어텐션 본체의 곱셈 횟수가 네 배로 줄어든다
- 질의 투영과 출력 투영의 크기가 네 배로 줄어든다
- KV 캐시에 들어가는 원소 수가 네 배로 줄어든다
- 층마다 도는 어텐션 횟수가 여덟에서 둘로 줄어든다
질의 헤드가 h개, 무리가 g개일 때 세 방식의 관계로 맞는 것은?
- g=h 면 MHA, g=1 이면 MQA, 그 사이가 GQA 다
- g=1 이면 MHA, g=h 면 MQA, 그 사이가 GQA 다
- MHA 와 MQA 는 GQA 와 다른 계산식을 쓴다
- h 와 g 가 서로소일 때만 GQA 라고 부른다
fold_kv([A, B, C, D], 2) 뒤 expand_kv(..., 4) 의 결과 순서로 맞는 것은?
- 평균된 두 헤드가 [P, Q, P, Q] 로 번갈아 놓인다
- 네 헤드가 원래 값 [A, B, C, D] 로 되돌아온다
- 평균된 두 헤드가 [P, P, Q, Q] 로 제자리 되풀이된다
- 평균된 한 헤드가 [P, P, P, P] 로 네 번 놓인다
MQA 원논문이 증분 디코딩의 병목으로 든 것은 무엇인가?
- 소프트맥스에서 지수 함수를 부르는 횟수
- 키·값 텐서를 메모리에서 되읽는 대역폭
- 질의 투영 행렬의 곱셈 횟수
- 위치 인코딩을 자리마다 다시 만드는 비용
GQA 원논문이 이미 학습된 멀티헤드 체크포인트를 옮길 때 쓰는 방법은?
- 무리에서 첫 키·값 헤드만 남기고 나머지는 버린다
- 무리 안의 키·값 헤드를 이어 붙여 차원을 늘린다
- 질의 헤드도 같은 수로 줄여 대칭을 맞춘다
- 무리 안의 키·값 헤드를 평균 내고 조금 더 학습한다
"GQA 로 바꿨는데 왜 프리필이 그대로냐" 는 물음에 대한 답으로 맞는 것은?
- 긴 입력을 한 번에 처리할 때는 곱셈이 병목이고 거기에는 무리 수가 없다
- 프리필에서는 캐시를 쓰지 않으므로 어텐션을 건너뛰기 때문이다
- 무리 수를 바꾸면 질의 투영이 커져 이득이 상쇄되기 때문이다
- 프리필은 캐시를 두 배로 쓰므로 줄인 만큼 되돌아오기 때문이다