タグ: #donut
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 2 件
OCR を超えて — OCR-free な文書理解と統合モデル
従来の OCR パイプラインは検出・認識・レイアウトを段階に分けますが誤差が累積します。Donut 系と VLM ベースの OCR-free 文書理解、高解像度と表処理、統合モデルへの流れまで、文書 AI の転換を整理します。
2026-06-26 · 38 分で読めます #ai-papers#ocr-free#document-understanding#multimodal#donut文書 AI / OCR 2026 — Mistral OCR / Marker / Surya / LlamaParse / Docling / OlmoOCR 徹底ガイド
2026 年の文書 AI はもう「Tesseract でテキストを取り出す」ではない。Mistral OCR(2025 年 3 月)などの専用 API、Marker / Surya / Docling / OlmoOCR などのオープンソース PDF-to-Markdown エンジン、LayoutLMv3・Donut のような事前学習済みドキュメントモデル、Pixtral 12B・Florence-2 のようなマルチモーダル LLM が
2026-05-15 · 30 分で読めます #ocr#document-ai#pdf#mistral-ocr#marker