태그: #max-model-len
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 1 편
vLLM 내부 구조 (6) — 컨텍스트 윈도우, max_model_len, max_tokens 완전 정리
컨텍스트 윈도우와 maxtokens 차이가 헷갈린다면 이 글 하나로 정리됩니다. 모델의 컨텍스트 윈도우(구조적 한계), vLLM의 maxmodellen(엔진 설정), 요청당 생성 상한인 maxtokens와 maxcompletiontokens, 그리고 배치 한도인 maxnumbatchedtokens와 maxnumseqs가 각각 무엇을 제한하는지 비교표와 실제 에러 메시지로 정리했습니다. 입력과
2026-08-12 · 20 분 읽기 #vllm#context-window#max-model-len#max-tokens#llm