LabHub
배우기 러닝패스 코스

로그 파이프라인 설계 · 인덱스 설계 · 실습

무엇을 색인하고 무엇을 본문에 둘 것인가

LabHub 에서 이어서 보기

목표

로그 저장소가 느려지거나 비싸지는 이유는 거의 언제나 **무엇을 색인할지 잘못
골랐기 때문**입니다. 그 결정은 데이터가 쌓인 뒤에 되돌리기가 아주 어렵습니다.

여기서는 실제 로그를 세어 보고 숫자로 정합니다.

재료

/opt/lab/logidx/events.jsonl   로그 2만 줄 (약 4MB)
mkdir -p /root/logidx && cp /opt/lab/logidx/* /root/logidx/ && cd /root/logidxhead -1 events.jsonl | python3 -m json.tool

남길 것

01-cardinality.txt  필드마다 값이 몇 가지인가02-labels.txt       라벨과 본문을 가른 결과03-explode.txt      라벨 하나를 더하면 스트림이 몇 개가 되나04-shards.txt       샤드 수05-tiers.txt        보관 단계와 기간06-cost.txt         색인과 검색의 비용07-notes.md         왜 그런지

단계 7개

  1. 먼저 세어 본다
  2. 라벨과 본문을 가른다
  3. 하나만 더해 본다
  4. 샤드를 몇 개로 나눌 것인가
  5. 언제 무엇을 버릴 것인가
  6. 비용은 어디서 나는가
  7. 다음에 읽을 사람에게