LLM 模型与推理服务
从调用模型再往里走一步,打开模型内部。亲手编写 Transformer,从零训练一个小型语言模型,用推理引擎的批处理、KV 缓存和量化降低成本,并用实验追踪让模型可以重建。
코스
- Transformer — 手算一遍注意力 — 用数字确认为什么要除以 √d
- MiniMind — 亲手从头到尾训练一个小型语言模型 — 用两颗 CPU 从分词器到 DPO 烤出一个小模型
- LLM 服务 — 不用模型,也能学会服务这套机械装置。
- AI瘦身失败事件 — 亲手构建INT8模型并测量准确率与性能
- 上周那个模型更好,可没人找得到 — 亲手搭建实验台账、注册表与晋升闸门