タグ: #context-window
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 4 件
vLLM 内部構造 (6) — コンテキストウィンドウ、max_model_len、max_tokens 完全整理
コンテキストウィンドウとmaxtokensの違いが紛らわしいなら、この記事一つで整理できる。モデルのコンテキストウィンドウ(構造的な上限)、vLLMのmaxmodellen(エンジン設定)、リクエストごとの生成上限であるmaxtokensとmaxcompletiontokens、そしてバッチの上限であるmaxnumbatchedtokensとmaxnumseqsがそれぞれ何を制限するのかを、比較表と実際のエラーメッセージで整理した。入力
2026-08-12 · 20 分で読めます #vllm#context-window#max-model-len#max-tokens#llm1Mコンテキストウィンドウ時代のLLM活用戦略:大規模コンテキスト処理の実践ガイド
2026年3月、AnthropicがClaude Opus 4.6/Sonnet 4.6の1MトークンコンテキストウィンドウをGAとして発表した。128K〜200Kから1Mへの拡張がもたらす活用パラダイムの転換、実践的活用パターン5つ、RAGとのトレードオフ、コスト最適化戦略まで総合ガイドを提供する。
2026-03-15 · 41 分で読めます #ai-platform#llm#context-window#long-context#claudeマルチターン会話管理とコンテキスト最適化: LLMチャットボットのMemoryパターン·会話要約·Sliding Window戦略
LLMチャットボットにおけるマルチターン会話の効果的なメモリパターンを解説します。Buffer・Summary・Vector Storeメモリ、Sliding Window戦略、会話要約技法、トークンコスト最適化、LangChain/LlamaIndex実装、ベクトルDB基盤の永続メモリ、コンテキストドリフト対応、プロダクションアーキテクチャパターンを説明します。
2026-03-12 · 26 分で読めます #chatbot#multi-turn#conversation-management#memory-pattern#context-windowLLMコンテキストウィンドウ拡張技術完全ガイド:RoPE、ALiBi、YaRNからRing Attentionまで
LLMのコンテキストウィンドウを512から2Mトークンまで拡張する技術を分析します。RoPEの数学的原理からNTK-aware、YaRN、Ring Attentionまで、実践コードとともに解説します。
2026-03-03 · 11 分で読めます #llm#context-window#rope#yarn#positional-encoding