LabHub

SI DB 운영 · 데이터 이관과 검증 · 실습

레거시 데이터 이관과 정합성 검증

LabHub 에서 이어서 보기

목표

지저분한 레거시 CSV 를 스테이징에 적재하고, 프로파일링 → 정제 → 중복 제거 →
코드 매핑 → 정합성 검증 → 제외 건 관리 → 확인서 작성까지
데이터 이관 한 사이클을 완주합니다.

왜 중요한가

"이행은 잘 됐습니다"라는 구두 확인은 아무것도 증명하지 않습니다.
건수 비교와 샘플 검증을 문서화해야 하고, 그중에서도 건수와 합계만 보면
한 건이 빠지고 다른 한 건이 두 배가 된 상황을 놓칩니다.
그리고 제외된 건을 목록으로 남기지 않으면, 오픈 후 "데이터가 없는데요"라는
문의가 왔을 때 처음부터 조사해야 합니다.
남겨 두면 "그 13건은 코드 미매핑으로 제외됐고 D+3 재이관 예정입니다"라고
30초 만에 답할 수 있습니다. 그 차이가 안정화 기간의 삶의 질을 바꿉니다.

단계

0. 원천: /opt/lab/fixtures/dbo/legacy/CUST_LEGACY.csv (1,200행)
코드 매핑표: /opt/lab/fixtures/dbo/legacy/grade_map.csv
1. /root/db/etl.db 를 만들고 원천 CSV 를 가공 없이 STG_CUST 테이블에 적재합니다.
모든 컬럼은 TEXT 이고 행 수는 1200 이어야 합니다.
2. /root/db/profile.csv 를 만듭니다. 첫 줄은 column,nulls,spaces,distinct.
STG_CUST 의 모든 컬럼에 대해

   source_rows=<원천 행 수>   target_rows=<대상 행 수>   excluded=<제외 건수>   unmapped=<코드 미매핑 건수>

참고

단계 8개

  1. 원천 데이터 적재
  2. 데이터 프로파일링
  3. 정제 규칙 적용
  4. 중복 제거
  5. 코드 매핑
  6. 정합성 검증
  7. 제외 건 목록
  8. 이관 결과 확인서