로그 파이프라인 설계 · 인덱스 설계 · 실습
무엇을 색인하고 무엇을 본문에 둘 것인가
목표
로그 저장소가 느려지거나 비싸지는 이유는 거의 언제나 **무엇을 색인할지 잘못
골랐기 때문**입니다. 그 결정은 데이터가 쌓인 뒤에 되돌리기가 아주 어렵습니다.
여기서는 실제 로그를 세어 보고 숫자로 정합니다.
재료
/opt/lab/logidx/events.jsonl 로그 2만 줄 (약 4MB)mkdir -p /root/logidx && cp /opt/lab/logidx/* /root/logidx/ && cd /root/logidxhead -1 events.jsonl | python3 -m json.tool남길 것
01-cardinality.txt 필드마다 값이 몇 가지인가02-labels.txt 라벨과 본문을 가른 결과03-explode.txt 라벨 하나를 더하면 스트림이 몇 개가 되나04-shards.txt 샤드 수05-tiers.txt 보관 단계와 기간06-cost.txt 색인과 검색의 비용07-notes.md 왜 그런지단계 7개
- 먼저 세어 본다
- 라벨과 본문을 가른다
- 하나만 더해 본다
- 샤드를 몇 개로 나눌 것인가
- 언제 무엇을 버릴 것인가
- 비용은 어디서 나는가
- 다음에 읽을 사람에게