タグ: #document-ai
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 4 件
Mistral OCR 4.1のブロック単位の信頼度スコア — 文書パイプラインで人をどこに置くかを決める値
MistralがOCR 4.1を公開し、段落単位のバウンディングボックスと構造ブロックのラベル、そしてブロックごとの信頼度スコアを出しました。文書パイプラインを作ったことがある人にとって実際に重要なのは3つ目です。信頼度スコアがあれば全数レビューと無レビューの間に閾値という選択肢が生まれるからです。その閾値をどう決めるか、信頼度を確率と取り違えると何が壊れるか、そしてページ単価を基準に自前構築がいつ有利になるかを計算します。
2026-08-14 · 12 分で読めます #ocr#document-ai#data-pipeline#human-in-the-loop#cost-optimizationOCR・文書理解の技術レポート、何を読むか — パースはなぜまだ終わっていないのか
OCRと文書理解の技術レポート10本を、arXivの原文アブストラクトで直接確認して整理しました。DonutとNougatからGOT-OCR2.0、olmOCR、DeepSeek-OCRとその後継、GLM-OCR、Qianfan-OCR、MinerU2.5-Pro、HunyuanOCR-1.5まで、それぞれ何を新しく行い著者がどんな限界を述べたかを読みます。順位は扱いません。文書パースのスコアはベンチマークのバージョンと採点方法にとりわ
2026-08-12 · 13 分で読めます #ai-papers#paper-review#technical-report#ocr#document-ai文書 AI / OCR 2026 — Mistral OCR / Marker / Surya / LlamaParse / Docling / OlmoOCR 徹底ガイド
2026 年の文書 AI はもう「Tesseract でテキストを取り出す」ではない。Mistral OCR(2025 年 3 月)などの専用 API、Marker / Surya / Docling / OlmoOCR などのオープンソース PDF-to-Markdown エンジン、LayoutLMv3・Donut のような事前学習済みドキュメントモデル、Pixtral 12B・Florence-2 のようなマルチモーダル LLM が
2026-05-15 · 30 分で読めます #ocr#document-ai#pdf#mistral-ocr#markerマルチモーダルLLM完全ガイド: Vision、文書理解、OCR、動画、音声、韓国語の特殊性 (2025)
テキストだけを扱う時代は終わった。2025年のLLMは画像・文書・映像・音声を自然に処理する。GPT-4o/Claude 3.5/Gemini/Qwen2-VL/Pixtralの比較、Document AIとレイアウト理解、OCRの現代化、動画・音声、韓国語文書の特殊性、そしてマルチモーダルRAGまで。実戦ケースで整理した一本。
2026-04-15 · 18 分で読めます #multimodal#vision-llm#document-ai#ocr#whisper