タグ: #ai-papers
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 79 件
音声認識・合成の技術レポート、何を読むか — WERという一つの数字では見えないもの
音声認識と合成の技術レポート10本を、arXivの原文アブストラクトで直接確認して整理しました。WhisperとOmnilingual ASR、Qwen3-ASR、Open ASR Leaderboard、Seed-TTSとF5-TTS、CosyVoice 2、Qwen3-TTS、Fish Audio S2、Moshi、Qwen2.5-OmniとMOSS-Audioが何を新しく行い、著者がどんな限界を述べたかを読みます。順位ではなく遅延
2026-08-12 · 13 分で読めます #ai-papers#paper-review#technical-report#speech-recognition#text-to-speech画像生成・理解の技術レポート、何を読むか — サンプル画像ではなく設計を読む
画像生成と理解の技術レポート11本を、arXivの原文アブストラクトで直接確認して整理しました。整流フロートランスフォーマーとVAR、Emu3、SANA、Janus-Pro、FLUX.1 Kontext、Qwen-Image系列、Seedream 4.0、Z-ImageとMage-Flow、InternVL3、そして評価側のQwen-Image-Benchまで、何を新しく行い著者がどんな限界を述べたかを読みます。順位は扱いません。領域別
2026-08-12 · 14 分で読めます #ai-papers#paper-review#technical-report#image-generation#diffusion-transformerトークナイザの内部 — 日本語がトークンを多く食う理由とその代価
バイトレベル BPE の仕組みを説明し、Qwen3、DeepSeek-V3、Mixtral の実際のトークナイザファイルをダウンロードして同じ意味の英語と韓国語の文章を直接トークン化して比較します。語彙サイズのトレードオフ、config の vocabsize と実際の語彙数が異なる理由、トークン数がコストと文脈窓に与える影響を整理します。
2026-08-12 · 11 分で読めます #ai-papers#model-internals#tokenizer#bpe#korean-nlp正規化と活性化 — 学習を壊さないために
RMSNorm とプレノルム、SwiGLU がなぜ現在の標準になったのかを config の値で確認し、Qwen3 の QK-Norm や Kimi K2 の QK-Clip のようにアテンションロジットの暴走を止める新しい仕組みを、各レポートが記す数値とともに整理します。安定性のために何を足し、何を引き受けるのかを扱います。
2026-08-12 · 11 分で読めます #ai-papers#model-internals#rmsnorm#swiglu#training-stabilityアテンションの変種 — MHA から MLA まで、KV キャッシュはどう縮むか
MHA、MQA、GQA、MLA を実際の config 値で比較します。Qwen3、Mixtral、GLM-4.5 のグループクエリアテンションと、DeepSeek-V3、Kimi K2 の潜在アテンションがトークンあたりの KV キャッシュを何倍縮めるのかを式と数字で計算し、その代償に何を差し出すのかを整理します。
2026-08-12 · 10 分で読めます #ai-papers#model-internals#attention#gqa#mla動画生成・理解の技術レポート、何を読むか — デモではなく制約を読む
動画生成と理解の技術レポート10本を、arXivの原文アブストラクトで直接確認して整理しました。CogVideoX、Movie Gen、HunyuanVideo、LTX-Video、Wan、Seedance 1.0と2.0、そして理解側のQwen2.5-VL、VideoLLaMA 3、HY-Himmelまで、何を新しく行い著者がどんな限界を述べたかを読みます。順位は扱わず、長さ・解像度・トークン予算といった実際の制約を見ます。領域別・最
2026-08-12 · 12 分で読めます #ai-papers#paper-review#technical-report#video-generation#diffusion-transformerテキストLLMの技術レポート、何を読むか — 順位ではなく設計判断を読む
テキストLLMの技術レポート9本を、arXivの原文アブストラクトで直接確認して整理しました。DeepSeek-V3とDeepSeek-R1、Qwen3、Gemma 3、Olmo 3、Kimi K2、MiniMax-01、Mellum2、s1がそれぞれ何を新しく行い、著者自身がどんな限界を述べているかを読みます。モデルの順位は扱いません。リーダーボードは動き続け、レポートの数値はほぼ自己申告だからです。領域別・最新技術レポートの読み方シ
2026-08-12 · 13 分で読めます #ai-papers#paper-review#technical-report#llm#moe学習レシピ — 事前学習から後学習まで、レポートは何を書くか
Llama 3 の三段階と六回の文脈拡張、Qwen3 の三段階事前学習、DeepSeek-V3 の学習率スケジュールと二段階 YaRN 拡張、Kimi K2 のデータ再記述実験を、レポートに書かれたとおりに比較し、学習段階の記述を読む方法を整理します。
2026-08-12 · 12 分で読めます #ai-papers#model-internals#pretraining#training-recipe#data-mixture位置エンコーディング — RoPE と文脈拡張の代償
ropetheta 一つが文脈長にどう作用するかを波長の計算で示し、Llama 3 の 500000、Qwen3 の ABF、DeepSeek-V3 と Kimi K2 の YaRN 設定、GLM-4.5 の部分回転を実際の config で比較します。長い文脈がなぜ無料でないのかを、プリフィルの演算量とキャッシュのコストから整理します。
2026-08-12 · 11 分で読めます #ai-papers#model-internals#rope#positional-encoding#long-contextconfig.json 完全解剖 — 設定ファイル一枚でモデル構造を読む
hiddensize、numhiddenlayers、numattentionheads と numkeyvalueheads、headdim、intermediatesize、ropetheta、vocabsize、tiewordembeddings まで、config.json の各フィールドがメモリと速度にどう現れるかを説明し、Qwen3-8B と Mixtral-8x7B のパラメータ数を手で数えて公開されたテンソル数と正確に一
2026-08-12 · 10 分で読めます #ai-papers#model-internals#config-json#transformer#llm-architectureOCR・文書理解の技術レポート、何を読むか — パースはなぜまだ終わっていないのか
OCRと文書理解の技術レポート10本を、arXivの原文アブストラクトで直接確認して整理しました。DonutとNougatからGOT-OCR2.0、olmOCR、DeepSeek-OCRとその後継、GLM-OCR、Qianfan-OCR、MinerU2.5-Pro、HunyuanOCR-1.5まで、それぞれ何を新しく行い著者がどんな限界を述べたかを読みます。順位は扱いません。文書パースのスコアはベンチマークのバージョンと採点方法にとりわ
2026-08-12 · 13 分で読めます #ai-papers#paper-review#technical-report#ocr#document-aiリーダーボードとベンチマークの読み方 — SOTAの賞味期限はなぜ短いのか
ベンチマーク方法論の論文12本を、arXivの原文アブストラクトで直接確認し、リーダーボードの数値をどう読むべきかを整理しました。データ汚染、プロンプト形式への敏感さ、評価ハーネスの差、自己申告、リーダーボードの標本の偏り、LLM審査者の偏り、そして誤差棒をつける統計的アプローチまで扱います。領域別・最新技術レポートの読み方シリーズの最終回であり、先行する5回を読むための案内でもあります。
2026-08-12 · 13 分で読めます #ai-papers#paper-review#technical-report#benchmark#evaluation技術レポートを批判的に読む — 何が書かれ、何が抜けるか
モデル技術レポートで検証可能な項目と検証不可能な項目を区別する方法を整理します。自己申告ベンチマークの限界、config とレポートが食い違う箇所、ゲートされたリポジトリで確認できなかった値、そしてシリーズ全体で用いた確認手順を実例とともに示します。
2026-08-12 · 13 分で読めます #ai-papers#model-internals#tech-report#benchmarks#evaluationMoE ルーティング — 専門家はどう選ばれるか
専門家混合層の config フィールドを実際のモデルで読みます。Mixtral の 8 個中 2 個、Qwen3 の 128 個中 8 個、DeepSeek-V3 の 256 個のルーティング専門家と共有専門家、Kimi K2 の希薄度 48 を比較し、活性パラメータと全パラメータがなぜ異なるコストを生むのか、ロードバランシング損失と補助損失なしのバイアス方式が何を引き換えにするのかを整理します。
2026-08-12 · 11 分で読めます #ai-papers#model-internals#mixture-of-experts#moe#routingSOTAテキスト埋め込みモデル分析 — 検索とRAGの心臓
テキスト埋め込みは検索とRAGシステムの心臓です。対照学習とInfoNCE、デュアルエンコーダ、ハードネガティブ、E5/BGE/GTE系列、Matryoshka表現学習、MTEBベンチマークまで、最新埋め込みモデルの原理と実務適用を整理します。
2026-06-30 · 33 分で読めます #ai-papers#embedding#retrieval#rag#contrastive-learningSOTA リアルタイム動画分析 — 追跡、理解、効率的推論
リアルタイム動画分析の SOTA の流れを整理します。行動認識・物体追跡・時間的セグメンテーションといった動画理解の課題、SAM 2 系の動画セグメンテーション・追跡の概念、トランスフォーマーベースの動画モデル、そして軽量化・ストリーミングによるリアルタイム推論最適化を、アーキテクチャの原理を中心に見ていきます。
2026-06-30 · 42 分で読めます #ai-papers#video-understanding#object-tracking#sam2#action-recognitionSOTA セグメンテーション・検出モデル分析 — SAM と DETR、YOLO の系譜
物体検出と画像セグメンテーションの SOTA 系譜を整理します。2 段階の R-CNN から 1 段階の YOLO/SSD、トランスフォーマーベースの DETR へと続く検出の流れと、セマンティック・インスタンス・パノプティックのセグメンテーション、そしてプロンプト可能セグメンテーションを開いた Segment Anything(SAM)まで、アーキテクチャの原理を中心に見ていきます。
2026-06-30 · 37 分で読めます #ai-papers#computer-vision#object-detection#segmentation#samSOTA画像生成モデル分析 — 拡散モデルからFLUXまで
テキスト画像生成の最前線を、拡散モデルの原理からラテント拡散、DiT、rectified flow、そしてFLUX系まで系譜を中心に整理します。アーキテクチャの原理と比較表、図解でSOTAモデルの共通構造と違いを分析します。
2026-06-30 · 17 分で読めます #ai-papers#diffusion-models#text-to-image#latent-diffusion#rectified-flowSOTA動画生成モデル分析 — 時空間拡散トランスフォーマー
動画生成の根本的な難題である時間的一貫性と計算コストを、時空間潜在パッチと拡散トランスフォーマーの観点から整理します。Soraが提示した概念と後続モデル系列、条件付け・評価・物理的一貫性の限界をアーキテクチャ中心に分析します。
2026-06-30 · 16 分で読めます #ai-papers#video-generation#diffusion-transformer#spatiotemporal#text-to-videoSOTA音楽・オーディオ生成の分析 — ニューラルコーデックと生成モデル
オーディオ表現(波形・スペクトログラム・ニューラルコーデック)から自己回帰オーディオ言語モデル、拡散ベースのオーディオ、テキスト音楽条件付けまで、系譜を中心に整理します。EnCodec、MusicGen、AudioLM系列の原理と商用モデル、評価・著作権の論点をアーキテクチャの観点から分析します。
2026-06-30 · 14 分で読めます #ai-papers#audio-generation#music-generation#neural-codec#audio-language-model