タグ: #rope
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 3 件
位置エンコーディング — RoPE と文脈拡張の代償
ropetheta 一つが文脈長にどう作用するかを波長の計算で示し、Llama 3 の 500000、Qwen3 の ABF、DeepSeek-V3 と Kimi K2 の YaRN 設定、GLM-4.5 の部分回転を実際の config で比較します。長い文脈がなぜ無料でないのかを、プリフィルの演算量とキャッシュのコストから整理します。
2026-08-12 · 11 分で読めます #ai-papers#model-internals#rope#positional-encoding#long-context位置エンコーディングの完全理解 — 正弦波からRoPEまで
なぜTransformerに位置情報が必要かから始め、sinusoidal、learned、相対位置エンコーディング、そしてRoPEとALiBiを段階的に説明します。長さの外挿とコンテキスト拡張(NTK, YaRN)、マルチモーダルのM-RoPEまでつなげ、よくある落とし穴を整理します。
2026-06-26 · 29 分で読めます #llm#positional-encoding#rope#alibi#long-contextLLMコンテキストウィンドウ拡張技術完全ガイド:RoPE、ALiBi、YaRNからRing Attentionまで
LLMのコンテキストウィンドウを512から2Mトークンまで拡張する技術を分析します。RoPEの数学的原理からNTK-aware、YaRN、Ring Attentionまで、実践コードとともに解説します。
2026-03-03 · 11 分で読めます #llm#context-window#rope#yarn#positional-encoding