태그: #context-window
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 5 편
vLLM 내부 구조 (6) — 컨텍스트 윈도우, max_model_len, max_tokens 완전 정리
컨텍스트 윈도우와 maxtokens 차이가 헷갈린다면 이 글 하나로 정리됩니다. 모델의 컨텍스트 윈도우(구조적 한계), vLLM의 maxmodellen(엔진 설정), 요청당 생성 상한인 maxtokens와 maxcompletiontokens, 그리고 배치 한도인 maxnumbatchedtokens와 maxnumseqs가 각각 무엇을 제한하는지 비교표와 실제 에러 메시지로 정리했습니다. 입력과
2026-08-12 · 20 분 읽기 #vllm#context-window#max-model-len#max-tokens#llmContext Window 100만 토큰 시대: RAG는 사라지는가?
Gemini 1.5 Pro의 100만 토큰, Claude의 20만 토큰 컨텍스트 윈도우가 등장하면서 "RAG가 필요 없어지는 것 아니냐"는 질문이 많아졌습니다. 실제 비용, 속도, 품질을 비교해서 솔직하게 답합니다.
2026-03-18 · 12 분 읽기 #context-window#rag#llm#long-context#ai-development1M 컨텍스트 윈도우 시대의 LLM 활용 전략: 대규모 문맥 처리의 실전 가이드
2026년 3월 Anthropic이 Claude Opus 4.6/Sonnet 4.6의 1M 토큰 컨텍스트 윈도우를 GA로 발표했다. 기존 128K~200K 제한에서 1M으로의 확장이 가져오는 활용 패러다임의 전환, 실전 활용 패턴 5가지, RAG 대비 트레이드오프, 비용 최적화 전략까지 종합 가이드를 제공한다.
2026-03-15 · 41 분 읽기 #ai-platform#llm#context-window#long-context#claude멀티턴 대화 관리와 컨텍스트 최적화: LLM 챗봇의 Memory 패턴·대화 요약·Sliding Window 전략
LLM 챗봇에서 멀티턴 대화를 효과적으로 관리하는 메모리 패턴을 다룹니다. Buffer·Summary·Vector Store 메모리, Sliding Window 전략, 대화 요약 기법, 토큰 비용 최적화, LangChain/LlamaIndex 구현, 벡터 DB 기반 영속 메모리, 컨텍스트 드리프트 대응, 프로덕션 아키텍처 패턴을 설명합니다.
2026-03-12 · 28 분 읽기 #chatbot#multi-turn#conversation-management#memory-pattern#context-windowLLM 컨텍스트 윈도우 확장 기술 완벽 가이드: RoPE, ALiBi, YaRN부터 Ring Attention까지
LLM의 컨텍스트 윈도우를 512에서 2M 토큰까지 확장하는 기술을 분석합니다. RoPE의 수학적 원리부터 NTK-aware, YaRN, Ring Attention까지 실전 코드와 함께 다룹니다.
2026-03-03 · 11 분 읽기 #llm#context-window#rope#yarn#positional-encoding