태그: #vision-language-model
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 5 편
비전과 멀티모달: 이미지 이해, OCR, VLM 고르기
비전 모델은 하나의 범주가 아닙니다. 대화형 VLM, OCR 전용, 문서 구조화, 이미지 검색용 임베딩은 서로 다른 물건이고 대체되지 않습니다. 이 글은 2026-08-12에 확인한 각 범주의 오픈 모델 카드 값을 정리하고, 해상도와 다중 이미지 처리 같은 실제 제약, 그리고 카드가 명시한 금지 용도를 함께 다룹니다. 오픈 모델 가이드 시리즈 6편입니다.
2026-08-12 · 13 분 읽기 #ai#huggingface#open-source-llm#vision-language-model#ocrOCR·문서 이해 기술 리포트, 무엇을 읽을 것인가 — 파싱은 왜 아직 안 끝났나
OCR과 문서 이해 기술 리포트 열 편을 arXiv 원문 초록에서 직접 확인해 정리했습니다. Donut과 Nougat에서 GOT-OCR2.0, olmOCR, DeepSeek-OCR과 그 후속, GLM-OCR, Qianfan-OCR, MinerU2.5-Pro, HunyuanOCR-1.5까지 각각 무엇을 새로 했고 저자들이 어떤 한계를 밝혔는지 읽습니다. 순위는 다루지 않습니다. 문서 파싱 점수
2026-08-12 · 14 분 읽기 #ai-papers#paper-review#technical-report#ocr#document-aiVision LLM 아키텍처 — 이미지가 언어가 되기까지
비전-언어 모델은 이미지를 비전 인코더로 처리한 뒤 프로젝터를 거쳐 LLM이 이해할 수 있는 토큰으로 바꿉니다. 패치 임베딩부터 임의 해상도 처리까지, 이미지가 언어 토큰이 되는 전 과정을 구조적으로 살펴봅니다.
2026-06-26 · 41 분 읽기 #llm#vision-language-model#multimodal#vit#qwen2-vlVision LLM 학습법 — input과 output을 어떻게 가르치나
비전-언어 모델은 정렬 사전학습부터 인스트럭션 파인튜닝까지 단계적으로 학습됩니다. 비전 인코더 동결 전략, 데이터 구성, 입력 포맷과 출력 형태, 손실 계산까지 무엇을 어떻게 가르치는지 학습 파이프라인 관점에서 정리합니다.
2026-06-26 · 35 분 읽기 #mlops#vision-language-model#multimodal#training#instruction-tuningOCR을 넘어서 — OCR-free 문서 이해와 통합 모델
전통적인 OCR 파이프라인은 검출-인식-레이아웃을 단계로 나누지만 오류가 누적됩니다. Donut류와 VLM 기반의 OCR-free 문서 이해, 고해상도와 표 처리, 통합 모델의 흐름까지 문서 AI의 전환을 정리합니다.
2026-06-26 · 40 분 읽기 #ai-papers#ocr-free#document-understanding#multimodal#donut