タグ: #long-context
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 11 件
学習レシピ — 事前学習から後学習まで、レポートは何を書くか
Llama 3 の三段階と六回の文脈拡張、Qwen3 の三段階事前学習、DeepSeek-V3 の学習率スケジュールと二段階 YaRN 拡張、Kimi K2 のデータ再記述実験を、レポートに書かれたとおりに比較し、学習段階の記述を読む方法を整理します。
2026-08-12 · 12 分で読めます #ai-papers#model-internals#pretraining#training-recipe#data-mixture位置エンコーディング — RoPE と文脈拡張の代償
ropetheta 一つが文脈長にどう作用するかを波長の計算で示し、Llama 3 の 500000、Qwen3 の ABF、DeepSeek-V3 と Kimi K2 の YaRN 設定、GLM-4.5 の部分回転を実際の config で比較します。長い文脈がなぜ無料でないのかを、プリフィルの演算量とキャッシュのコストから整理します。
2026-08-12 · 11 分で読めます #ai-papers#model-internals#rope#positional-encoding#long-contextRAG・ファインチューニング・ロングコンテキスト — 自分の問題には何を使うべきか:論文が実際に測ったもの、そして誰も測っていないもの
LLMアーキテクチャで最も頻繁に出る質問ですが、大半の答えは出典のない意思決定ツリーです。本稿は測定されたものだけで答えます。ファインチューニングが新しい知識の注入に失敗することは複数の論文で繰り返し測定されており(Ovadiaら、Gekhmanら)、正反対に見える農業のケーススタディは実は別の介入(教師なし継続事前学習 vs 教師ありQ&Aチューニング)を測ったものなので、矛盾ではありません。ロングコンテキストは位置・長さ・語彙という
2026-07-17 · 43 分で読めます #rag#llm#fine-tuning#long-context#aiコンテキストエンジニアリングはプロンプトエンジニアリングを置き換えた言葉なのか — 測定されたものと、そうでないもの
「プロンプトエンジニアリングは死んだ」という文は、この用語を生んだどの一次出典にもありません。Karpathyはfew-shotの例とタスク説明をコンテキストエンジニアリングの構成要素として列挙し、Anthropicは「プロンプトエンジニアリングの自然な進展(natural progression)」と書きました。つまり代替ではなく包含です。それでも、これが本当に別の仕事だという根拠はあります — ChromaのLongMemEval実
2026-07-17 · 37 分で読めます #llm#context-engineering#prompt-engineering#long-context#ai-agent事前学習済みチェックポイントを長文脈ハイブリッドへ — HyLoのアップサイクリング
ハイブリッド型のシーケンスモデル(アテンション+線形・SSMブロック)は長文脈に有利ですが、これまでは多くがゼロから事前学習し直す必要がありました。2026年4月のプリプリントHyLoは、すでに学習済みのTransformerチェックポイントを安価な後処理学習だけでハイブリッドへ「アップサイクリング」するレシピを提案します — MLA(潜在アテンション)とMamba2・Gated DeltaNetのような線形ブロックを混ぜ、段階的な長文
2026-07-11 · 10 分で読めます #ai#llm#long-context#architecture#efficiency位置エンコーディングの完全理解 — 正弦波からRoPEまで
なぜTransformerに位置情報が必要かから始め、sinusoidal、learned、相対位置エンコーディング、そしてRoPEとALiBiを段階的に説明します。長さの外挿とコンテキスト拡張(NTK, YaRN)、マルチモーダルのM-RoPEまでつなげ、よくある落とし穴を整理します。
2026-06-26 · 29 分で読めます #llm#positional-encoding#rope#alibi#long-contextアテンションの進化 — MQA、GQA、FlashAttention、そして長いコンテキスト
標準アテンションのメモリと演算コストを分析し、MQAとGQAがKV cacheをどう削減するか、FlashAttentionがIOをどう最適化するかを説明します。スライディングウィンドウや長コンテキスト手法を比較し、これらの選択がサービングメモリに与える影響までたどります。
2026-06-26 · 28 分で読めます #llm#attention#flashattention#gqa#mqaGemini 2.5 開発者向け実践ガイド: Pro, Flash, Flash-Lite の選び方
2026年4月12日時点の Gemini 2.5 を前提に、Pro, Flash, Flash-Lite をどう選ぶか、reasoning モデルでワークフローがどう変わるか、そして本番で何を出すべきかを実務目線でまとめます。
2026-04-12 · 9 分で読めます #google#gemini#gemini-2-5#coding#agentic-coding1Mコンテキストウィンドウ時代のLLM活用戦略:大規模コンテキスト処理の実践ガイド
2026年3月、AnthropicがClaude Opus 4.6/Sonnet 4.6の1MトークンコンテキストウィンドウをGAとして発表した。128K〜200Kから1Mへの拡張がもたらす活用パラダイムの転換、実践的活用パターン5つ、RAGとのトレードオフ、コスト最適化戦略まで総合ガイドを提供する。
2026-03-15 · 41 分で読めます #ai-platform#llm#context-window#long-context#claudeRing Attention 論文分析:分散環境での無限コンテキストウィンドウトレーニング実装
Ring Attention論文を分析し、分散環境でコンテキスト長の制限を克服する方法を探求します。Blockwise Parallel Transformerとの関連、実装の詳細、パフォーマンスベンチマーク、プロダクション適用時の考慮事項まで扱います。
2026-03-08 · 51 分で読めます #ai-papers#ring-attention#distributed-training#long-context#transformerLLMロングコンテキスト性能とKV Cache最適化完全ガイド:MQAからRing Attentionまで
LLMのロングコンテキスト処理を支えるKV Cacheの原理からメモリ消費量分析、MQA・GQA・PagedAttention・スライディングウィンドウ・Ring Attentionなどの最適化手法、モデル別コンテキストウィンドウ比較、Needle-in-a-Haystackベンチマークまで、実務観点から包括的に解説します。
2026-03-07 · 25 分で読めます #llm#kv-cache#long-context#multi-query-attention#grouped-query-attention