タグ: #max-tokens
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 1 件
vLLM 内部構造 (6) — コンテキストウィンドウ、max_model_len、max_tokens 完全整理
コンテキストウィンドウとmaxtokensの違いが紛らわしいなら、この記事一つで整理できる。モデルのコンテキストウィンドウ(構造的な上限)、vLLMのmaxmodellen(エンジン設定)、リクエストごとの生成上限であるmaxtokensとmaxcompletiontokens、そしてバッチの上限であるmaxnumbatchedtokensとmaxnumseqsがそれぞれ何を制限するのかを、比較表と実際のエラーメッセージで整理した。入力
2026-08-12 · 20 分で読めます #vllm#context-window#max-model-len#max-tokens#llm