태그: #ocr
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 7 편
Mistral OCR 4.1의 블록 단위 신뢰도 점수 — 문서 파이프라인에서 사람을 어디에 넣을지 정하는 값
Mistral이 OCR 4.1을 공개하면서 문단 단위 바운딩 박스와 구조 블록 레이블, 그리고 블록별 신뢰도 점수를 내놓았습니다. 문서 파이프라인을 만들어 본 사람에게 실제로 중요한 것은 셋째입니다. 신뢰도 점수가 있으면 전수 검토와 무검토 사이에 임계값이라는 선택지가 생기기 때문입니다. 그 임계값을 어떻게 정하는지, 신뢰도를 확률로 착각하면 무엇이 깨지는지, 그리고 페이지 단가 기준으로 자
2026-08-14 · 13 분 읽기 #ocr#document-ai#data-pipeline#human-in-the-loop#cost-optimization비전과 멀티모달: 이미지 이해, OCR, VLM 고르기
비전 모델은 하나의 범주가 아닙니다. 대화형 VLM, OCR 전용, 문서 구조화, 이미지 검색용 임베딩은 서로 다른 물건이고 대체되지 않습니다. 이 글은 2026-08-12에 확인한 각 범주의 오픈 모델 카드 값을 정리하고, 해상도와 다중 이미지 처리 같은 실제 제약, 그리고 카드가 명시한 금지 용도를 함께 다룹니다. 오픈 모델 가이드 시리즈 6편입니다.
2026-08-12 · 13 분 읽기 #ai#huggingface#open-source-llm#vision-language-model#ocrOCR·문서 이해 기술 리포트, 무엇을 읽을 것인가 — 파싱은 왜 아직 안 끝났나
OCR과 문서 이해 기술 리포트 열 편을 arXiv 원문 초록에서 직접 확인해 정리했습니다. Donut과 Nougat에서 GOT-OCR2.0, olmOCR, DeepSeek-OCR과 그 후속, GLM-OCR, Qianfan-OCR, MinerU2.5-Pro, HunyuanOCR-1.5까지 각각 무엇을 새로 했고 저자들이 어떤 한계를 밝혔는지 읽습니다. 순위는 다루지 않습니다. 문서 파싱 점수
2026-08-12 · 14 분 읽기 #ai-papers#paper-review#technical-report#ocr#document-aiRTX 5090 한 장으로 작은 모델들 직접 굴려보기 — microGPT·OCR·음악 생성
RTX 5090(Blackwell, 32GB) 한 장에 SSH로 붙어 작은 모델 셋을 직접 돌려봤습니다. char-level GPT를 밑바닥부터 28초 만에 학습시키고(10.75M 파라미터, 117만 tokens/s), 전용 OCR(TrOCR)과 소형 VLM(Qwen2-VL-2B)을 같은 이미지에 붙여 CER로 대결시키고, MusicGen으로 8초짜리 음악을 1.9초(4.2배 실시간)에 생성
2026-07-11 · 12 분 읽기 #pytorch#gpu#llm#ocr#hands-on문서 AI / OCR 2026 — Mistral OCR / Marker / Surya / LlamaParse / Docling / OlmoOCR 심층 가이드
2026년의 문서 AI는 더 이상 "Tesseract로 텍스트 뽑기"가 아니다. Mistral OCR(2025.3) 같은 전용 API, Marker / Surya / Docling / OlmoOCR 같은 오픈소스 PDF-to-Markdown 엔진, LayoutLMv3·Donut 같은 사전학습 문서 모델, Pixtral 12B·Florence-2 같은 멀티모달 LLM이 모두 같은 문제(스캔된
2026-05-15 · 35 분 읽기 #ocr#document-ai#pdf#mistral-ocr#marker멀티모달 LLM 완전 가이드: Vision, 문서 이해, OCR, 비디오, 오디오, 한국어 특수성 (2025)
텍스트만 다루던 시대가 끝났다. 2025년 LLM은 이미지·문서·영상·오디오를 자연스럽게 처리한다. GPT-4o/Claude 3.5/Gemini/Qwen2-VL/Pixtral 비교, Document AI와 레이아웃 이해, OCR의 현대화, 비디오·오디오, 한국어 문서 특수성, 그리고 멀티모달 RAG까지. 실전 케이스로 정리한 한 편.
2026-04-15 · 19 분 읽기 #multimodal#vision-llm#document-ai#ocr#whisperDocument Parsing 기술 가이드: PDF 파싱·OCR·레이아웃 분석·LLM 기반 문서 추출 실전 파이프라인
PDF 파싱 라이브러리(PyMuPDF, pdfplumber) 비교, OCR 엔진(Tesseract, EasyOCR, PaddleOCR) 활용법, 레이아웃 분석 모델(LayoutLM, DiT, Donut), 테이블 추출, LLM 기반 멀티모달 문서 이해, RAG 청킹 전략, 프로덕션 파이프라인 구축까지 Document Parsing의 모든 것을 실전 코드와 함께 다룹니다.
2026-03-13 · 37 분 읽기 #llm#document-parsing#pdf#ocr#layout-analysis