タグ: #ocr
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 7 件
Mistral OCR 4.1のブロック単位の信頼度スコア — 文書パイプラインで人をどこに置くかを決める値
MistralがOCR 4.1を公開し、段落単位のバウンディングボックスと構造ブロックのラベル、そしてブロックごとの信頼度スコアを出しました。文書パイプラインを作ったことがある人にとって実際に重要なのは3つ目です。信頼度スコアがあれば全数レビューと無レビューの間に閾値という選択肢が生まれるからです。その閾値をどう決めるか、信頼度を確率と取り違えると何が壊れるか、そしてページ単価を基準に自前構築がいつ有利になるかを計算します。
2026-08-14 · 12 分で読めます #ocr#document-ai#data-pipeline#human-in-the-loop#cost-optimizationビジョンとマルチモーダル: 画像理解、OCR、VLMの選び方
ビジョンモデルはひとつのカテゴリではありません。対話型VLM、OCR専用、文書構造化、画像検索用の埋め込みは別物で、互いを代替しません。この記事は2026-08-12に確認した各カテゴリのオープンモデルのカード値を整理し、解像度や複数画像の扱いといった実際の制約、そしてカードが明記する禁止用途も扱います。オープンモデルガイドシリーズ第6回です。
2026-08-12 · 12 分で読めます #ai#huggingface#open-source-llm#vision-language-model#ocrOCR・文書理解の技術レポート、何を読むか — パースはなぜまだ終わっていないのか
OCRと文書理解の技術レポート10本を、arXivの原文アブストラクトで直接確認して整理しました。DonutとNougatからGOT-OCR2.0、olmOCR、DeepSeek-OCRとその後継、GLM-OCR、Qianfan-OCR、MinerU2.5-Pro、HunyuanOCR-1.5まで、それぞれ何を新しく行い著者がどんな限界を述べたかを読みます。順位は扱いません。文書パースのスコアはベンチマークのバージョンと採点方法にとりわ
2026-08-12 · 13 分で読めます #ai-papers#paper-review#technical-report#ocr#document-aiRTX 5090 一枚で小さなモデルたちを直接動かしてみる — microGPT・OCR・音楽生成
RTX 5090(Blackwell、32GB)一枚に SSH で接続し、小さなモデル三つを直接動かしてみました。char-level GPT をゼロから 28 秒で学習させ(10.75M パラメータ、117 万 tokens/s)、専用 OCR(TrOCR)と小型 VLM(Qwen2-VL-2B)を同じ画像に当てて CER で対決させ、MusicGen で 8 秒の音楽を 1.9 秒(実時間の 4.2 倍)で生成しました。その過程で出
2026-07-11 · 12 分で読めます #pytorch#gpu#llm#ocr#hands-on文書 AI / OCR 2026 — Mistral OCR / Marker / Surya / LlamaParse / Docling / OlmoOCR 徹底ガイド
2026 年の文書 AI はもう「Tesseract でテキストを取り出す」ではない。Mistral OCR(2025 年 3 月)などの専用 API、Marker / Surya / Docling / OlmoOCR などのオープンソース PDF-to-Markdown エンジン、LayoutLMv3・Donut のような事前学習済みドキュメントモデル、Pixtral 12B・Florence-2 のようなマルチモーダル LLM が
2026-05-15 · 30 分で読めます #ocr#document-ai#pdf#mistral-ocr#markerマルチモーダルLLM完全ガイド: Vision、文書理解、OCR、動画、音声、韓国語の特殊性 (2025)
テキストだけを扱う時代は終わった。2025年のLLMは画像・文書・映像・音声を自然に処理する。GPT-4o/Claude 3.5/Gemini/Qwen2-VL/Pixtralの比較、Document AIとレイアウト理解、OCRの現代化、動画・音声、韓国語文書の特殊性、そしてマルチモーダルRAGまで。実戦ケースで整理した一本。
2026-04-15 · 18 分で読めます #multimodal#vision-llm#document-ai#ocr#whisperDocument Parsing技術ガイド: PDF解析・OCR・レイアウト分析・LLMベース文書抽出の実践パイプライン
PDF解析ライブラリ(PyMuPDF、pdfplumber)の比較、OCRエンジン(Tesseract、EasyOCR、PaddleOCR)の活用法、レイアウト分析モデル(LayoutLM、DiT、Donut)、テーブル抽出、LLMベースのマルチモーダル文書理解、RAGチャンキング戦略、プロダクションパイプライン構築まで、Document Parsingの全てを実践コードとともに解説します。
2026-03-13 · 33 分で読めます #llm#document-parsing#pdf#ocr#layout-analysis