LLM モデルとサービング
モデルを呼ぶ側から一歩入って、モデルの中を開きます。Transformer を自分で書き、小さな言語モデルを最初から学習し、サービングエンジンのバッチングと KV キャッシュ、量子化でコストを下げ、実験管理でモデルを作り直せるようにします。
코스
- Transformer — アテンションを手で計算する — なぜ√dで割るのかを数字で確かめる
- MiniMind — 小さな言語モデルを最初から最後まで自分で学習する — 2つのCPUでトークナイザーからDPOまで小さなモデルを焼き上げる
- LLMサービング — モデルなしでサービングの機械仕掛けを学ぶ。
- AIダイエット失敗事件 — 実際にINT8モデルを作り、精度と性能を測る
- 先週のモデルの方が良かった。誰も見つけられない — 実験台帳・レジストリ・昇格ゲートを手で作る