タグ: #transformer
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 31 件
みんなのためのAI 第4回 — 137万パラメータで画像に文をつける、そして第3回のバグがここになかった理由
CNN エンコーダとトランスフォーマーデコーダをつないで、Fashion-MNIST の画像にキャプションをつけるモデルを作りました。137万パラメータ、10分の学習でラベル的中率91%です。エンコーダ・デコーダ構造で cross-attention が何をするのか、そして第3回で正解率を7.5%に落とした EOS バグがなぜこのコードになかったのかを、2つの関数を並べて確認します。
2026-08-22 · 12 分で読めます #ai#captioning#multimodal#transformer#pytorchみんなのためのAI 第1回 — 1600万パラメータの言語モデルを15分でゼロから学習させる
GPU 1枚で言語モデルをゼロから学習させます。TinyStories データセットと1600万パラメータのデコーダ専用トランスフォーマーで、15分で読める英語の童話を生成しました。因果マスクがなぜ必要か、重み共有が何を節約するのか、perplexity 8 が実際にどんな文章を意味するのかを、実際の学習ログと生成結果で確認します。RTX 3090 実測。
2026-08-19 · 15 分で読めます #ai#llm#transformer#pytorch#hands-on韓国の開発ブログ名文キュレーション 3 — AIとML実務、直接開いて確認した14本
AIとMLを実務で扱う韓国語記事から、具体的で再現可能な14本を選びました。LangChainによるRAGパイプラインの全工程、埋め込みとベクトル類似度から見た意味検索の原理、ベクトルデータベース7種の比較、pgvectorからQdrantへの移行記録、OllamaからvLLMへ移してスループットを上げた過程、LLMサービングの指標のトレードオフ、使用量トラッカーの自作記、Transformer論文のレビューとコード実装、BERTの整理
2026-08-12 · 24 分で読めます #curation#큐레이션#ai#llm#ragconfig.json 完全解剖 — 設定ファイル一枚でモデル構造を読む
hiddensize、numhiddenlayers、numattentionheads と numkeyvalueheads、headdim、intermediatesize、ropetheta、vocabsize、tiewordembeddings まで、config.json の各フィールドがメモリと速度にどう現れるかを説明し、Qwen3-8B と Mixtral-8x7B のパラメータ数を手で数えて公開されたテンソル数と正確に一
2026-08-12 · 10 分で読めます #ai-papers#model-internals#config-json#transformer#llm-architecture位置エンコーディングの完全理解 — 正弦波からRoPEまで
なぜTransformerに位置情報が必要かから始め、sinusoidal、learned、相対位置エンコーディング、そしてRoPEとALiBiを段階的に説明します。長さの外挿とコンテキスト拡張(NTK, YaRN)、マルチモーダルのM-RoPEまでつなげ、よくある落とし穴を整理します。
2026-06-26 · 29 分で読めます #llm#positional-encoding#rope#alibi#long-contextKVキャッシュとPagedAttention — 推論メモリのすべて
LLM推論でメモリを最も消費する張本人であるKVキャッシュを深く掘り下げます。KVキャッシュとは何か、なぜメモリを消費するのか、メモリの計算と断片化の問題、PagedAttentionのブロック管理、prefix共有とKV量子化まで、開発者の視点で整理します。
2026-06-26 · 21 分で読めます #kv-cache#paged-attention#inference#gpu-memory#quantizationTransformer構造の完全解剖 — AttentionからKV Cacheまで
Transformerのself-attention、マルチヘッド、位置エンコーディング、FFN、残差接続と正規化をゼロから分解して説明します。テンソルのshapeとパラメータ数の計算、causal mask、エンコーダ/デコーダ構造、そして推論時のKV cacheまでを一つの流れでつなげます。
2026-06-26 · 25 分で読めます #llm#transformer#attention#positional-encoding#kv-cacheLLMをゼロから作ってみる — スタンフォードCS336流の学習ロードマップ
スタンフォードのCS336(Language Modeling from Scratch)がHacker Newsの上位に登場し続け、ゼロからのLLM構築が再び話題になっています。トークナイザーからアテンション、分散学習、スケーリング則、アライメント、推論最適化までカリキュラム全体を解剖し、20週間の学習プランとミニプロジェクトのアイデアをまとめました。
2026-06-12 · 24 分で読めます #llm#transformer#cs336#deep-learning#tokenizerLLM ランドマーク論文ロードマップ 2026 - Transformer / Scaling Laws / Flash Attention / Mamba / DeepSeek-R1 / Titans 徹底解説
2017年の Attention Is All You Need から 2026年の Titans と DeepSeek-R1 まで、LLM 時代を作った 50 篇超のランドマーク論文をテーマ別に整理する。Transformer、BERT、GPT 1-3、Scaling Laws、Chinchilla、InstructGPT、PaLM、FlashAttention 1-3、LLaMA 1-4、GPT-4、Mistral と Mixtra
2026-05-16 · 31 分で読めます #llm-papers#transformer#scaling-laws#flash-attention#mamba基盤モデルのアーキテクチャ 2026 — Transformer の次へ / Mamba 2 / Hyena / RWKV / RetNet / Griffin / Jamba / xLSTM / TTT / DiT / MoE / Flash Attention 3 徹底ガイド
2026 年の基盤モデル界隈はもはや Transformer 一色ではない。Vaswani 2017 「Attention is All You Need」は今も標準だが、その隣に Mamba/Mamba 2 のような状態空間モデル、RWKV/RetNet/Griffin の線形 RNN 復活組、AI21 Jamba と Falcon Mamba のハイブリッド、Sepp Hochreiter の xLSTM、Test-Time Tra
2026-05-16 · 30 分で読めます #foundation-models#transformer#attention-is-all-you-need#vaswani#mambaLLM ランドマーク論文ガイド — Attention から GPT・LLaMA・DeepSeek・o1・Claude まで (参考文献付き、2026)
LLM 分野の本当の変化は、どの論文から始まったのか。2017 年の Attention is All You Need から 2026 年の推論モデルまで、必ず知っておくべきランドマーク論文 20 編余りを時期・テーマ別に整理する。各論文は『なぜ重要か・一言要約・後続の影響』で凝縮し、arXiv・ブログのリンクを末尾にまとめた。時間の足りないエンジニアのための LLM 論文地図。
2026-05-14 · 22 分で読めます #llm#research-papers#transformer#gpt#llamaスクラッチからLLMを構築する: コードでGPTを理解する完全ガイド
ゼロから大規模言語モデル(LLM)を構築・理解するための完全ガイド。トークナイザーからTransformer、事前学習、ファインチューニングまで、PyTorchで完全なGPTアーキテクチャを実装します。
2026-03-17 · 24 分で読めます #llm#gpt#transformer#from-scratch#deep-learningTransformerアーキテクチャ完全解析: AttentionからモダンLLMまで
Transformerアーキテクチャをゼロから理解するための完全ガイド。Self-Attention、Multi-Head Attention、Positional Encoding、Encoder-Decoder構造からFlash Attention、RoPE、GQAまで、数式とコードで解説。
2026-03-17 · 30 分で読めます #transformer#attention#deep-learning#nlp#ai時系列深層学習完全ガイド: LSTMからTransformerベースのPatchTSTまで
時系列深層学習の完全ガイド。ARIMA/Prophet古典手法から、LSTM、TCN、PatchTST、Chronos基盤モデルまで豊富なPyTorchコードとともに解説。
2026-03-17 · 21 分で読めます #time-series#lstm#transformer#forecasting#anomaly-detection自然言語処理完全ガイド: ゼロからヒーローへ - テキスト処理からLLMまで
NLPの基礎から最新のLLMまで完全網羅するガイド。テキスト前処理、Word2Vec、RNN/LSTM、Attention、Transformer、BERT、GPTをステップバイステップで実践的なコード例と共に解説。
2026-03-17 · 39 分で読めます #nlp#natural-language-processing#transformer#bert#gptMixture of Experts(MoE)アーキテクチャ論文深掘り分析:GShardからDeepSeek-MoEまで
Mixture of Expertsアーキテクチャの核心論文を分析し、GShard、Switch Transformer、Mixtral、DeepSeek-MoEのルーティング戦略と学習安定性手法を比較します。
2026-03-14 · 34 分で読めます #ai-papers#moe#transformer#deepseekKV Cache 最適化 深層分析: GQA・MLA・MHA アテンションメカニズムとメモリ効率化戦略
Transformer Self-AttentionのKV Cache基本原理からMHA、MQA、GQA(Llama 2/3)、MLA(DeepSeek-V2/V3)メカニズムのメモリ分析と比較、KV Cache圧縮技法(量子化、エビクションポリシー、スライディングウィンドウ)、PagedAttention(vLLM)実装、PyTorchコード例、OOM障害事例と最適化チェックリストを解説します。
2026-03-11 · 22 分で読めます #ai-papers#kv-cache#attention-mechanism#gqa#mlaMixture of Experts(MoE)アーキテクチャ徹底分析:Switch TransformerからMixtral・DeepSeekまで
Mixture of Experts(MoE)アーキテクチャを徹底分析します。Sparse MoEの数学的基礎からSwitch Transformer、Mixtral 8x7B、DeepSeek-V3のルーティング戦略、学習安定性手法、推論最適化まで論文ベースで詳細に解説します。
2026-03-10 · 21 分で読めます #ai-papers#moe#transformer#mixtral#deepseekFlashAttention 論文分析: IO-Aware Exact AttentionによるTransformer学習・推論速度の革新
FlashAttentionシリーズ(v1〜v3)の中核論文を分析します。IO-Awareアルゴリズムのタイリング戦略、GPU SRAM/HBMメモリ階層の活用、逆伝播のrecomputation、FlashAttention-2の並列化改善、FlashAttention-3のFP8対応と非同期パイプラインまで、実践ベンチマークとともに解説します。
2026-03-09 · 32 分で読めます #ai-papers#flash-attention#transformer#gpu-optimization#attention-mechanismRing Attention 論文分析:分散環境での無限コンテキストウィンドウトレーニング実装
Ring Attention論文を分析し、分散環境でコンテキスト長の制限を克服する方法を探求します。Blockwise Parallel Transformerとの関連、実装の詳細、パフォーマンスベンチマーク、プロダクション適用時の考慮事項まで扱います。
2026-03-08 · 51 分で読めます #ai-papers#ring-attention#distributed-training#long-context#transformer