タグ: #attention
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 9 件
Qwen3.8-27Bのハイブリッドアテンション — 64層のうちKVキャッシュを積むのは16層だけ
27Bのモデルが26万トークンのコンテキストをノートパソコンで扱える理由は、パラメータ数ではなく層の構成にあります。Qwen3.8-27Bは64層のうち48層を線形アテンション(Gated DeltaNet)に、16層だけを通常のアテンションに配置し、KVキャッシュが伸びる層そのものを4分の1に減らしました。この構造が何を節約して何を失うのか、FP8ブロック量子化はどこに効くのか、そしてローカル推論を検討するとき実際に計算すべき値は何か
2026-08-14 · 13 分で読めます #llm#inference#quantization#local-llm#attentionアテンションの変種 — MHA から MLA まで、KV キャッシュはどう縮むか
MHA、MQA、GQA、MLA を実際の config 値で比較します。Qwen3、Mixtral、GLM-4.5 のグループクエリアテンションと、DeepSeek-V3、Kimi K2 の潜在アテンションがトークンあたりの KV キャッシュを何倍縮めるのかを式と数字で計算し、その代償に何を差し出すのかを整理します。
2026-08-12 · 10 分で読めます #ai-papers#model-internals#attention#gqa#mlaHybrid SWA による長コンテキスト推論の最適化 — Xiaomi MiMo v2.5 が実際に行ったこと
スライディングウィンドウアテンション(SWA)とフルアテンションを層ごとに交互配置するハイブリッド SWA は、長コンテキスト推論の KV キャッシュメモリと計算量を同時に削減する最近の主流設計です。Xiaomi が公開した MiMo v2.5 推論最適化の記事を根拠に、ハイブリッド SWA とは何でなぜ重要か、MiMo v2.5 が実際にどんなアーキテクチャとシステムエンジニアリングを行ったか(70 層中 10 層のみフルアテンション
2026-07-11 · 14 分で読めます #ai#llm#inference#attention#optimization深く読み、じっくり考える — 思索の技術
果てしなく流し読みする時代に、私たちは深く読む習慣を少しずつ失いつつある。この文章は、浅い読みと深い読みの違い、インターネットが私たちの注意力に残したもの、能動的読書と統合的読書の技術、遅い思考と再読の価値、そして孤独と退屈が洞察の土壌となる仕組みを、静かに見つめる。目的は罪悪感ではなく、深く読む習慣を取り戻す具体的な道である。
2026-07-05 · 33 分で読めます #learning#reading#reflection#attentionドーパミンデトックスの真実 — 集中力の迷信と科学
ドーパミンは快楽物質ではなく、動機と予測の信号です。流行するドーパミンデトックスの科学的根拠を検討し、刺激過剰の時代に本当に集中力を助けるものは何かを、根拠にもとづいて愉快に見ていきます。
2026-07-01 · 57 分で読めます #culture#dopamine#attention#focus#neuroscienceTransformer構造の完全解剖 — AttentionからKV Cacheまで
Transformerのself-attention、マルチヘッド、位置エンコーディング、FFN、残差接続と正規化をゼロから分解して説明します。テンソルのshapeとパラメータ数の計算、causal mask、エンコーダ/デコーダ構造、そして推論時のKV cacheまでを一つの流れでつなげます。
2026-06-26 · 25 分で読めます #llm#transformer#attention#positional-encoding#kv-cacheアテンションの進化 — MQA、GQA、FlashAttention、そして長いコンテキスト
標準アテンションのメモリと演算コストを分析し、MQAとGQAがKV cacheをどう削減するか、FlashAttentionがIOをどう最適化するかを説明します。スライディングウィンドウや長コンテキスト手法を比較し、これらの選択がサービングメモリに与える影響までたどります。
2026-06-26 · 28 分で読めます #llm#attention#flashattention#gqa#mqaTransformerアーキテクチャ完全解析: AttentionからモダンLLMまで
Transformerアーキテクチャをゼロから理解するための完全ガイド。Self-Attention、Multi-Head Attention、Positional Encoding、Encoder-Decoder構造からFlash Attention、RoPE、GQAまで、数式とコードで解説。
2026-03-17 · 30 分で読めます #transformer#attention#deep-learning#nlp#aiAttention Is All You Need - Transformer論文の完全分析
Transformerアーキテクチャの基盤である「Attention Is All You Need」論文を、Self-Attention、Multi-Head Attention、Positional Encodingなどのコアメカニズムを一つずつ分析する。
2026-03-01 · 27 分で読めます #ai-papers#transformer#deep-learning#attention