LabHub

데이터 파이프라인 · 배치와 스트리밍 · 퀴즈

퀴즈: 배치와 스트리밍

LabHub 에서 이어서 보기

문항 6개. 정답과 해설은 풀어 본 뒤에 보여 드립니다.

  1. 시간 기준 워터마크를 쓸 때 같은 타임스탬프를 가진 행이 여러 개면 어떤 문제가 생기는가?

    1. 실무상 아무 문제도 없다
    2. 경계에서 쿼리가 오류를 낸다
    3. 경계에 걸친 일부 행이 영원히 누락되거나 매번 중복될 수 있다
    4. 타임스탬프 정렬이 불가능해진다
  2. '최소 한 번(at-least-once)' 전달 보장을 쓰는 시스템에서 결과적으로 정확히 한 번처럼 만들려면?

    1. 메시지 브로커의 설정을 바꾼다
    2. 소비 쪽 처리를 멱등하게 만들어 중복을 흡수한다
    3. 재시도를 끈다
    4. 배치 주기를 줄인다
  3. 스트리밍 파이프라인이 배치보다 어려운 근본적인 이유는?

    1. 다뤄야 하는 처리량 자체가 훨씬 크기 때문
    2. 익숙한 SQL 을 쓸 수 없기 때문
    3. 상태 저장 비용이 훨씬 비싸기 때문
    4. 상태를 들고 계속 도는 시스템이라 재처리와 창 마감 판단이 훨씬 복잡하기 때문
  4. 배치 방식을 고르는 것이 합리적인 신호로 가장 적절한 것은?

    1. 원천 데이터가 하루 한 번 갱신되고 소비자도 하루 한 번 본다
    2. 이벤트가 초당 수천 건 발생한다
    3. 지연이 1초를 넘으면 안 된다
    4. 데이터가 여러 시스템에서 동시에 온다
  5. 큰 배치를 청크로 쪼개 처리하는 주된 이유는?

    1. 전체 처리 시간이 줄어들기 때문
    2. SQL 이 대량 처리를 지원하지 않기 때문
    3. 청크마다 다른 스키마를 쓸 수 있기 때문
    4. 실패한 청크만 다시 돌릴 수 있고 잠금 시간과 자원 사용의 뾰족함이 줄기 때문
  6. 추출 직후 건수를 원본과 대조하는 검증 단계를 파이프라인에 넣는 이유는?

    1. 경계 조건 실수로 인한 중복이나 누락을 조기에 발견하기 위해
    2. 추출 단계의 성능을 재기 위해
    3. 원천의 스키마 변경을 감지하기 위해
    4. 원천 조회 권한을 확인하기 위해