고객 데이터 다루기 · 더러운 데이터 진단 · 퀴즈
퀴즈: 더러운 데이터 진단
문항 6개. 정답과 해설은 풀어 본 뒤에 보여 드립니다.
정제 스크립트가 반드시 출력해야 하는 것은?
- 처리 소요 시간
- 메모리 사용량
- 입력 파일의 해시
- 버린 행의 개수
'이메일이 같으면 중복' 규칙으로 그룹화해 정리했습니다. 이메일이 비어 있는 행들이 있으면?
- 빈 값들이 한 그룹으로 묶여 서로 다른 고객이 한 명만 남고 삭제된다
- 빈 값은 자동으로 제외된다
- 오류가 발생해 중단된다
- 빈 값끼리는 서로 다른 것으로 취급된다
고객명을 앞뒤 공백 제거 후 소문자로 정규화했습니다. 이 값의 올바른 용도는?
- 같은 값이면 무조건 같은 고객으로 병합
- 원본을 이 값으로 덮어쓰기
- 정렬에만 사용
- 비교와 매칭에 쓰되 병합의 최종 근거로는 쓰지 않음
226행 중 180행이 규칙을 어깁니다. 올바른 판단은?
- 정제 규칙을 완화한다
- 180행을 수동으로 고친다
- 규칙에 맞는 46행으로 진행한다
- 정제가 아니라 데이터 추출 자체를 다시 해야 하는 상황일 수 있다
'금액이 음수인 행 4건' 을 어떻게 처리할지 결정하는 사람은?
- 업무 담당자에게 물어 합의
- FDE 가 기술적 판단으로 결정
- 가장 많은 사례를 따라 자동 결정
- 일단 제외하고 나중에 통보
데이터 정제의 올바른 순서는?
- 세기 → 분류 → 합의 → 정제
- 정제 → 세기 → 보고
- 분류 → 정제 → 세기
- 합의 → 정제 → 분류