MiniMind — 小さな言語モデルを最初から最後まで自分で学習する
MiniMind(github.com/jingyaogong/minimind)의 모델 코드와 학습 방식을 그대로 쓰되, 설정을 줄인 약 100만 파라미터 모델을 CPU 두 개짜리 실습 파드에서 처음부터 학습합니다. 토크나이저 학습, 패킹, 모델 구성(RMSNorm·RoPE·GQA·SwiGLU), 사전학습과 손실 곡선, 체크포인트와 재개, SFT 와 손실 마스킹, LoRA, DPO, KV 캐시와 샘플링, 평가와 한계까지 모든 단계를 숫자로 확인합니다. 학습 한 번은 수십 초이고, 채점기는 여러분의 체크포인트를 직접 불러 다시 계산합니다. 파이썬과 PyTorch 기초, 트랜스포머의 구조를 아는 분을 위한 과정입니다.
고급 · 레슨 30 · 실습 10
커리큘럼
トークナイザー
データ準備 — パディングとパッキング
モデル構成
事前学習と損失曲線
チェックポイントと再開
SFT と損失マスキング
LoRA
- LoRA は重みに触れずに脇道を付ける reading
- MiniMind の LoRA で口調だけを変え、基盤の重みがそのままか確かめる lab
- クイズ:LoRA quiz
DPO — 選好学習
- DPO は報酬モデルなしに「こちらが良い」を教える reading
- DPO で口調を変え、内容が守られたかも測る lab
- クイズ:DPO quiz
推論 — KV キャッシュとサンプリング
評価と限界
- 小さなモデルでは暗記と学習の境界がはっきりしている reading
- 小さなモデルにできることとできないことを数字で分ける lab
- クイズ:評価と限界 quiz