タグ: #vision-language-model
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 5 件
ビジョンとマルチモーダル: 画像理解、OCR、VLMの選び方
ビジョンモデルはひとつのカテゴリではありません。対話型VLM、OCR専用、文書構造化、画像検索用の埋め込みは別物で、互いを代替しません。この記事は2026-08-12に確認した各カテゴリのオープンモデルのカード値を整理し、解像度や複数画像の扱いといった実際の制約、そしてカードが明記する禁止用途も扱います。オープンモデルガイドシリーズ第6回です。
2026-08-12 · 12 分で読めます #ai#huggingface#open-source-llm#vision-language-model#ocrOCR・文書理解の技術レポート、何を読むか — パースはなぜまだ終わっていないのか
OCRと文書理解の技術レポート10本を、arXivの原文アブストラクトで直接確認して整理しました。DonutとNougatからGOT-OCR2.0、olmOCR、DeepSeek-OCRとその後継、GLM-OCR、Qianfan-OCR、MinerU2.5-Pro、HunyuanOCR-1.5まで、それぞれ何を新しく行い著者がどんな限界を述べたかを読みます。順位は扱いません。文書パースのスコアはベンチマークのバージョンと採点方法にとりわ
2026-08-12 · 13 分で読めます #ai-papers#paper-review#technical-report#ocr#document-aiVision LLM の学習法 — 入力と出力をどう教えるか
ビジョン言語モデルは整列事前学習からインストラクションファインチューニングまで段階的に学習されます。ビジョンエンコーダの凍結戦略、データ構成、入力フォーマットと出力形式、損失計算まで、何をどう教えるかを学習パイプラインの観点で整理します。
2026-06-26 · 32 分で読めます #mlops#vision-language-model#multimodal#training#instruction-tuningVision LLM アーキテクチャ — 画像が言語になるまで
ビジョン言語モデルは画像をビジョンエンコーダで処理し、プロジェクタを通して LLM が読めるトークンへ変換します。パッチ埋め込みから任意解像度処理まで、画像が言語トークンになる全過程を構造的に見ていきます。
2026-06-26 · 36 分で読めます #llm#vision-language-model#multimodal#vit#qwen2-vlOCR を超えて — OCR-free な文書理解と統合モデル
従来の OCR パイプラインは検出・認識・レイアウトを段階に分けますが誤差が累積します。Donut 系と VLM ベースの OCR-free 文書理解、高解像度と表処理、統合モデルへの流れまで、文書 AI の転換を整理します。
2026-06-26 · 38 分で読めます #ai-papers#ocr-free#document-understanding#multimodal#donut