LLM 服务
이 코스에는 GPU 도 모델 가중치도 없습니다. 대신 서빙을 서빙으로 만드는 기계 장치 — 토큰 스트리밍, 연속 배칭, KV 캐시 메모리 산정, 레이트리밋과 토큰 회계, 평가 회귀 방지 — 를 직접 구현합니다. vLLM 을 켜기 전에 무엇이 왜 그렇게 설계됐는지 아는 것이 목표이고, 그 앎이 GPU 를 붙였을 때 설정값의 의미를 아는 사람과 모르는 사람을 가릅니다.
고급 · 레슨 19 · 实验 5
커리큘럼
推理服务为什么和训练不同
- prefill 和 decode 是两件事 reading
- 测验:推理服务的指标 quiz
token 流式与 SSE
- 流式为什么改变了体验 reading
- 亲手实现一个 token 流式服务器 lab
- 测验:流式 quiz
批处理(连续批处理)与排队
- 静态批处理丢掉的东西 reading
- 连续批处理调度器的模拟 lab
- 测验:批处理 quiz
模型服务器选型与可复现的比较
- 先把测量契约定死,再谈工具叫什么 reading
- 测验:模型服务器选型 quiz
GPU 显存估算与量化
- 用手立一份显存预算 reading
- 做一个 KV 缓存显存估算器 lab
- 测验:显存估算 quiz
网关、限流与成本管理
- 靠请求数控制不住 LLM 的成本 reading
- 做一个带限流与 token 记账的网关 lab
- 测验:网关与成本 quiz
评估与防回归
- 凭感觉换模型会发生什么 reading
- 做一套响应质量的回归测试框架 lab
- 测验:评估与防回归 quiz