태그: #document-ai
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 4 편
Mistral OCR 4.1의 블록 단위 신뢰도 점수 — 문서 파이프라인에서 사람을 어디에 넣을지 정하는 값
Mistral이 OCR 4.1을 공개하면서 문단 단위 바운딩 박스와 구조 블록 레이블, 그리고 블록별 신뢰도 점수를 내놓았습니다. 문서 파이프라인을 만들어 본 사람에게 실제로 중요한 것은 셋째입니다. 신뢰도 점수가 있으면 전수 검토와 무검토 사이에 임계값이라는 선택지가 생기기 때문입니다. 그 임계값을 어떻게 정하는지, 신뢰도를 확률로 착각하면 무엇이 깨지는지, 그리고 페이지 단가 기준으로 자
2026-08-14 · 13 분 읽기 #ocr#document-ai#data-pipeline#human-in-the-loop#cost-optimizationOCR·문서 이해 기술 리포트, 무엇을 읽을 것인가 — 파싱은 왜 아직 안 끝났나
OCR과 문서 이해 기술 리포트 열 편을 arXiv 원문 초록에서 직접 확인해 정리했습니다. Donut과 Nougat에서 GOT-OCR2.0, olmOCR, DeepSeek-OCR과 그 후속, GLM-OCR, Qianfan-OCR, MinerU2.5-Pro, HunyuanOCR-1.5까지 각각 무엇을 새로 했고 저자들이 어떤 한계를 밝혔는지 읽습니다. 순위는 다루지 않습니다. 문서 파싱 점수
2026-08-12 · 14 분 읽기 #ai-papers#paper-review#technical-report#ocr#document-ai문서 AI / OCR 2026 — Mistral OCR / Marker / Surya / LlamaParse / Docling / OlmoOCR 심층 가이드
2026년의 문서 AI는 더 이상 "Tesseract로 텍스트 뽑기"가 아니다. Mistral OCR(2025.3) 같은 전용 API, Marker / Surya / Docling / OlmoOCR 같은 오픈소스 PDF-to-Markdown 엔진, LayoutLMv3·Donut 같은 사전학습 문서 모델, Pixtral 12B·Florence-2 같은 멀티모달 LLM이 모두 같은 문제(스캔된
2026-05-15 · 35 분 읽기 #ocr#document-ai#pdf#mistral-ocr#marker멀티모달 LLM 완전 가이드: Vision, 문서 이해, OCR, 비디오, 오디오, 한국어 특수성 (2025)
텍스트만 다루던 시대가 끝났다. 2025년 LLM은 이미지·문서·영상·오디오를 자연스럽게 처리한다. GPT-4o/Claude 3.5/Gemini/Qwen2-VL/Pixtral 비교, Document AI와 레이아웃 이해, OCR의 현대화, 비디오·오디오, 한국어 문서 특수성, 그리고 멀티모달 RAG까지. 실전 케이스로 정리한 한 편.
2026-04-15 · 19 분 읽기 #multimodal#vision-llm#document-ai#ocr#whisper