タグ: #multimodal
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 17 件
みんなのためのAI 第4回 — 137万パラメータで画像に文をつける、そして第3回のバグがここになかった理由
CNN エンコーダとトランスフォーマーデコーダをつないで、Fashion-MNIST の画像にキャプションをつけるモデルを作りました。137万パラメータ、10分の学習でラベル的中率91%です。エンコーダ・デコーダ構造で cross-attention が何をするのか、そして第3回で正解率を7.5%に落とした EOS バグがなぜこのコードになかったのかを、2つの関数を並べて確認します。
2026-08-22 · 12 分で読めます #ai#captioning#multimodal#transformer#pytorchみんなのためのAI 第3回 — 損失0.0017なのに正解率7.5%、犯人はパディング1マスだった
画像と質問を一緒に受け取って答える VQA モデルを148万パラメータで作りました。学習損失は0.0017まで落ちたのに正解率は7.5%。ランダムより悪い数値です。原因はモデルではなく正解を作るコード1行で、直したら99.5%になりました。なぜ低い損失が良いモデルを保証しないのか、その罠をどう見抜くのかを実際の出力で確認します。
2026-08-21 · 14 分で読めます #ai#vqa#multimodal#debugging#pytorchビジョンとマルチモーダル: 画像理解、OCR、VLMの選び方
ビジョンモデルはひとつのカテゴリではありません。対話型VLM、OCR専用、文書構造化、画像検索用の埋め込みは別物で、互いを代替しません。この記事は2026-08-12に確認した各カテゴリのオープンモデルのカード値を整理し、解像度や複数画像の扱いといった実際の制約、そしてカードが明記する禁止用途も扱います。オープンモデルガイドシリーズ第6回です。
2026-08-12 · 12 分で読めます #ai#huggingface#open-source-llm#vision-language-model#ocr画像生成・理解の技術レポート、何を読むか — サンプル画像ではなく設計を読む
画像生成と理解の技術レポート11本を、arXivの原文アブストラクトで直接確認して整理しました。整流フロートランスフォーマーとVAR、Emu3、SANA、Janus-Pro、FLUX.1 Kontext、Qwen-Image系列、Seedream 4.0、Z-ImageとMage-Flow、InternVL3、そして評価側のQwen-Image-Benchまで、何を新しく行い著者がどんな限界を述べたかを読みます。順位は扱いません。領域別
2026-08-12 · 14 分で読めます #ai-papers#paper-review#technical-report#image-generation#diffusion-transformerテキスト・画像・エージェントをそれぞれどう測るか — 三つの領域の測定が根本的に違う理由
テキスト・画像・エージェントは同じ「性能」という言葉を使いますが、測定の構造はまったく異なります。テキストは正解があるふりをした選択式と、正解のない生成式に分かれ、画像は分布距離と人間の判断がずれ、エージェントは部分成功・環境状態・非決定性のためにそもそも一つの数字に圧縮できません。この記事は各領域の代表的な指標が実際に何を計算しているのかを定義のレベルで分解し、領域ごとに「指標は高いのに実際には悪い」事例を一つずつ添えました。最後に領
2026-08-02 · 37 分で読めます #llm-evaluation#multimodal#llm-as-judge#agent-benchmark#metricsVision LLM の学習法 — 入力と出力をどう教えるか
ビジョン言語モデルは整列事前学習からインストラクションファインチューニングまで段階的に学習されます。ビジョンエンコーダの凍結戦略、データ構成、入力フォーマットと出力形式、損失計算まで、何をどう教えるかを学習パイプラインの観点で整理します。
2026-06-26 · 32 分で読めます #mlops#vision-language-model#multimodal#training#instruction-tuningマルチモーダルLLMのサービング — 画像入力が生む新たな課題
テキスト専用LLMサービングとの違いから、ビジョンエンコーダの追加段階、可変のビジュアルトークン数、プリフィルコストの急増、マルチモーダルKVキャッシュとバッチングの難しさ、遅延分解とスループット最適化、コストと運用の落とし穴まで、マルチモーダルLLMサービングの実務を整理します。
2026-06-26 · 24 分で読めます #mlops#multimodal#llm-serving#vllm#kv-cacheVision LLM アーキテクチャ — 画像が言語になるまで
ビジョン言語モデルは画像をビジョンエンコーダで処理し、プロジェクタを通して LLM が読めるトークンへ変換します。パッチ埋め込みから任意解像度処理まで、画像が言語トークンになる全過程を構造的に見ていきます。
2026-06-26 · 36 分で読めます #llm#vision-language-model#multimodal#vit#qwen2-vlマルチモーダルのトークナイゼーションと融合 — 画像・音声をトークンへ
画像・音声・動画をどうトークンへ変え、テキストと一つの列へ編むのかを整理します。パッチおよびVQベースの画像トークン化、離散コーデックによる音声トークン化、フレームサンプリング、インターリービングと区切りトークン、トークン爆発と圧縮、コンテキストコストまで、マルチモーダルLLMの入力構成を深く扱います。
2026-06-26 · 26 分で読めます #llm#multimodal#tokenization#vision-language#q-formerマルチモーダルAIの学習法 — 複数の感覚を一つのモデルへ
画像・テキスト・音声・動画を一つのモデルで扱うマルチモーダルAIの学習原理を整理します。モダリティの整列と対照学習、融合方式、共有埋め込み空間、事前学習と微調整、データと評価、そしてハルシネーションなどの限界まで、学習パイプラインをコードとともに見ていきます。
2026-06-26 · 30 分で読めます #ai-papers#multimodal#clip#vision-language#contrastive-learningOCR を超えて — OCR-free な文書理解と統合モデル
従来の OCR パイプラインは検出・認識・レイアウトを段階に分けますが誤差が累積します。Donut 系と VLM ベースの OCR-free 文書理解、高解像度と表処理、統合モデルへの流れまで、文書 AI の転換を整理します。
2026-06-26 · 38 分で読めます #ai-papers#ocr-free#document-understanding#multimodal#donutビジョン言語モデル(VLM)2026 完全ガイド — CLIP・LLaVA・InternVL3・Qwen2.5-VL・GPT-4o・Gemini 2.5・Claude 4.7・DINOv2・SAM 2・Florence-2 徹底解説
2026年5月時点のビジョン言語モデル(VLM)を一本にまとめる。CLIP系列(SigLIP, EVA-CLIP)、オープンVLM(LLaVA-NeXT, InternVL3, Qwen2.5-VL, Pixtral, Molmo, Idefics3, MiniCPM-V)、クローズドフロンティア(GPT-4o, Claude 4.7, Gemini 2.5)、ビジョン基盤(DINOv2/v3, SAM 2, Florence-2)、学
2026-05-16 · 27 分で読めます #vision-language-models#vlm#clip#llava#internvlマルチモーダルLLM完全ガイド: Vision、文書理解、OCR、動画、音声、韓国語の特殊性 (2025)
テキストだけを扱う時代は終わった。2025年のLLMは画像・文書・映像・音声を自然に処理する。GPT-4o/Claude 3.5/Gemini/Qwen2-VL/Pixtralの比較、Document AIとレイアウト理解、OCRの現代化、動画・音声、韓国語文書の特殊性、そしてマルチモーダルRAGまで。実戦ケースで整理した一本。
2026-04-15 · 18 分で読めます #multimodal#vision-llm#document-ai#ocr#whisperGemini 2.5 開発者向け実践ガイド: Pro, Flash, Flash-Lite の選び方
2026年4月12日時点の Gemini 2.5 を前提に、Pro, Flash, Flash-Lite をどう選ぶか、reasoning モデルでワークフローがどう変わるか、そして本番で何を出すべきかを実務目線でまとめます。
2026-04-12 · 9 分で読めます #google#gemini#gemini-2-5#coding#agentic-coding2025年AI研究トレンド総整理:HuggingFace人気論文からAI研究10大トレンドまで
HuggingFaceトレンディング論文TOP10と2025年AI研究10大トレンドを開発者視点でレビュー。DeepSeek-R1の純粋RL推論、Nemotron-Cascade 30B/3B MoE、GRPO、PagedAttention、100万トークンコンテキストの限界まで。
2026-03-21 · 28 分で読めます #ai-research#papers#huggingface#reasoning#moeマルチモーダルAI完全ガイド: CLIP・LLaVA・GPT-4V・Gemini Visionをマスターする
マルチモーダルAIの基礎から最新のビジョン言語モデルまでを完全解説。CLIP、BLIP-2、LLaVA、InstructBLIP、GPT-4V、Gemini Vision、Claude Visionを実践コードとともに解説し、マルチモーダルRAGも網羅。
2026-03-17 · 29 分で読めます #multimodal#vision-language#clip#llava#gpt-4vLLMマルチモーダル Vision-Language モデルサービングと最適化実践ガイド
マルチモーダルVision-Languageモデルのプロダクションサービングと最適化の実践ガイド。
2026-03-05 · 24 分で読めます #llm#multimodal#vlm#vllm#2026-03