LLM 모델과 서빙
모델을 부르는 쪽에서 한 걸음 들어가 모델의 속을 엽니다. 트랜스포머를 직접 짜 보고, 작은 언어 모델을 처음부터 학습하고, 서빙 엔진의 배칭과 KV 캐시, 양자화로 비용을 줄이고, 실험 추적으로 모델을 다시 세울 수 있게 만듭니다.
코스
- 트랜스포머 — 어텐션을 손으로 계산한다 — 왜 √d 로 나누는지 숫자로 확인한다
- MiniMind — 작은 언어 모델을 처음부터 끝까지 직접 학습한다 — CPU 두 개로 토크나이저부터 DPO 까지 작은 모델을 굽는다
- LLM 서빙 — 모델 없이 서빙의 기계 장치를 배운다.
- AI 다이어트 실패 사건 — 진짜 INT8 모델을 만들고 정확도·성능을 재본다
- 지난주 모델이 더 좋았는데 아무도 못 찾는다 — 실험 원장·레지스트리·승격 관문을 손으로 만든다