测验:如何测量准确率损失
한국어 원문으로 표시합니다.
시험 표본 400개에서 FP32 정확도 0.7825, 정수 후보 0.7875 가 나왔다. 이 숫자만으로 할 수 있는 말은?
- 후보가 원본보다 나으므로 그대로 배포해도 된다
- 표본 하나의 구간 폭이 이 차이보다 훨씬 넓어 아직 아무 말도 할 수 없다
- 차이가 0.5퍼센트포인트뿐이므로 두 모델은 같은 모델이다
- 정확도가 올랐으므로 양자화 오차가 없었다는 뜻이다
같은 표본에서 두 모델을 견줄 때 둘 다 맞힌 표본과 둘 다 틀린 표본을 따로 떼어 두는 이유는?
- 그 표본들이 시험 자료에서 잘못 뽑힌 것이기 때문이다
- 그 표본들은 두 모델을 가르지 못해 판정에 정보를 주지 않기 때문이다
- 그 표본들의 출력 차이가 항상 0 이기 때문이다
- 그 표본들을 빼야 정확도 계산이 맞아떨어지기 때문이다
Wilson 점수 구간을 쓰는 이유로 가장 정확한 것은?
- 계산이 단순해서 표본 수가 많을 때만 쓸 수 있기 때문이다
- 정확도를 항상 0.5 로 끌어당겨 보수적인 값을 주기 때문이다
- 정확도가 0 이나 1 에 붙어도 폭이 0 으로 무너지지 않기 때문이다
- 두 모델의 차이를 직접 검정해 주기 때문이다
두 모델의 예측이 갈린 14건이 6대 8로 나뉘었다. 이 실습이 쓰는 잣대로 옳은 판단은?
- 갈린 건수가 적어 이 차이를 재현되는 차이라고 볼 수 없다
- 8건이 6건보다 많으므로 후보가 더 낫다고 보고한다
- 갈린 건수가 전체의 3.5%이므로 정확도가 3.5% 개선된 것이다
- 둘 다 틀린 79건을 더해 분모를 93으로 잡아야 한다
최대 절대 오차가 1.74 로 크게 나왔는데 정확도는 오히려 올랐다. 가장 그럴듯한 설명은?
- 출력 차이를 잘못 계산했으므로 다시 재야 한다
- 정확도 계산에서 정답표가 뒤바뀌었을 것이다
- 양자화 오차가 커지면 정확도도 반드시 오르기 때문이다
- 출력이 크게 움직인 표본이 결정 경계에서 멀어 답이 바뀌지 않았기 때문이다
배포 판정에 기준선을 FP32 원본과 이전 배포본 둘로 두는 이유는?
- 두 기준선의 평균을 내야 판정이 안정되기 때문이다
- 두 기준선이 서로 다른 질문에 답하고 답의 방향이 다를 수 있기 때문이다
- 이전 배포본이 없으면 원본과 견줄 수 없기 때문이다
- 기준선이 둘이면 표본 수가 두 배가 되어 구간이 좁아지기 때문이다