LabHub

블로그

멀티모달 LLM 완전 가이드: Vision, 문서 이해, OCR, 비디오, 오디오, 한국어 특수성 (2025)

한국어English日本語中文

Season 4 Ep 8 — Ep 1–7은 대부분 텍스트 중심이었다. Ep 8부터는 LLM이 보고, 듣고, 읽는 세계로 확장된다. "이제 문서 처리는 LLM에 맡기면 된다"는 주장의 진실과 거짓을 같이 본다.

Prologue — "VLM이 OCR을 죽였다"는 소문

2024년 말부터 유튜브와 트위터에 자주 올라오는 주장: "GPT-4o/Claude/Gemini에 이미지 던지면 OCR이 필요 없다. 전통 파이프라인은 죽었다."

절반은 맞다. 깔끔한 영수증·스크린샷은 VLM 한 번으로 충분하다. 하지만:

그래서 2025년의 정답은 하이브리드: 전통 OCR/레이아웃 분석 + VLM 후처리 + 검증 루프.


1장 · 멀티모달 LLM 지형 2025

1.1 주요 모델

모델제공특징
GPT-4o / GPT-4.1OpenAI범용성 최고, 음성·이미지 실시간
Claude 3.5 / 4 Sonnet·OpusAnthropic문서·코드·추론 강함
Gemini 2 / 2.5 Pro/FlashGoogle1M+ 컨텍스트, 비디오 네이티브
Qwen2-VL / Qwen2.5-VLAlibaba (오픈)오픈 VLM 최강권, 한국어도 양호
Pixtral 12B / LargeMistral (오픈)유럽 오픈 VLM
Llama 3.2-VisionMeta (오픈)11B/90B, 생태계
Molmo / InternVLAllen AI / 상하이오픈, 벤치 경쟁
Phi 3.5-VisionMicrosoft작고 빠름
DeepSeek-VL2DeepSeek가성비

1.2 선택 기준

1.3 텍스트-only 모델과 함께 쓰기

많은 제품이 VLM으로 이미지→텍스트 설명 or 구조화 데이터로 변환만 하고, 이후 분석·생성은 텍스트 모델이 수행. 비용·지연·가용성 면에서 실용적.


2장 · Vision 기본 원리

2.1 아키텍처

대부분의 VLM은:

  1. Vision Encoder(CLIP, SigLIP 등)가 이미지를 패치 임베딩으로
  2. Projector(MLP/Q-Former)가 LLM의 토큰 공간으로 매핑
  3. LLM이 이미지 토큰 + 텍스트 토큰을 함께 처리

2.2 해상도가 중요하다

2.3 토큰 단가


3장 · Document AI — 문서 이해

3.1 과거 파이프라인

PDF/ImageOCR(Tesseract/ABBYY/Clova OCR)
Layout analysis (DocBank/LayoutLM/DocLayNet)
Table/Form extraction
          → 규칙 기반 or 분류기

3.2 2025년 스택

3.3 VLM + 좌표의 힘

VLM에 이미지뿐 아니라 OCR 결과(단어+좌표)를 같이 주면:

예:

<image>contract.png</image>
<ocr>
  {word: "갑", bbox: [..]}
  {word: "주식회사", bbox: [..]}
  ...
</ocr>
Task: 계약 당사자 이름과 체결일을 JSON으로 추출.  필드에 대한 bbox 포함.

3.4 사용 사례

3.5 한국어 특수성


4장 · OCR의 현대화

4.1 전통 OCR

4.2 LLM-native OCR 시대

4.3 하이브리드 베스트 프랙티스

1) 고속 OCR로 텍스트+좌표 획득
2) VLM이 의미 구조화(필드 분류, 엔티티 추출)
3) VLM 출력은 반드시 OCR 원문과 교차 검증
4) 검증 실패 시 재시도 or 사람 확인

4.4 벤치마크 주의


5장 · 차트·표·도면 — 가장 어려운 영역

5.1 차트 이해

5.2 표 추출

5.3 도면·건축

5.4 과학·공학 그림


6장 · 비디오 이해

6.1 접근 방식

6.2 사용 사례

6.3 비용·지연


7장 · 오디오 — STT와 TTS

7.1 STT (Speech-to-Text)

모델특징
Whisper (large-v3)오픈, 다국어 우수
Deepgram Nova상용, 지연 짧음
AssemblyAI상용, 화자 분리·감정
Rev.ai / Speechmatics상용
Naver Clova Speech한국어 특화
Kakao Speech한국어 특화

7.2 실시간 파이프라인

7.3 TTS

7.4 음성 LLM(Speech LLM)

7.5 한국어 STT 팁


8장 · 멀티모달 RAG

8.1 기본 아이디어

"질문 텍스트"로 "이미지·PDF·비디오 구간"까지 검색하는 것.

8.2 접근 3가지

(a) 텍스트화 후 RAG

(b) 멀티모달 임베딩

(c) 하이브리드

8.3 PDF RAG 실전

8.4 주의


9장 · UX 설계 — 멀티모달 인터페이스

9.1 업로드

9.2 결과 표시

9.3 검증 루프


10장 · 비용·지연 현실

10.1 이미지 비용

10.2 지연

10.3 전략


11장 · 보안·프라이버시

11.1 이미지 속 PII

11.2 데이터 잔존

11.3 규제

11.4 Prompt injection via image


12장 · 실전 케이스 3

12.1 영수증·세금계산서 처리

12.2 계약서 요약·이슈 탐지

12.3 콜센터 녹취 분석


13장 · 안티패턴 10선

13.1 VLM만 쓰고 OCR 폐기

감사·정확도 저하. 하이브리드 권장.

13.2 해상도 맥스

비용·지연 폭발. 썸네일 → 필요 시 고해상도.

13.3 이미지 프롬프트 인젝션 무방비

이미지 속 텍스트를 지시로 해석 → 사고.

13.4 라이선스 미확인

학습 이미지 저작권, 상업 라이선스.

13.5 차트 숫자 검증 없이 사용

환각 위험. 인용·교차 확인 필수.

13.6 비디오 전체 1시간을 한 번에 밀어넣기

토큰 폭발. 샘플링·오디오 1차 처리.

13.7 한국어 OCR인데 영문 OCR 사용

정확도 큰 차이. Clova/Upstage/Kakao 우선 검토.

13.8 TTS 보이스 가이드라인 없음

브랜드 일관성 깨짐. 톤·속도·억양 규정.

13.9 실시간 음성에 큰 LLM 무작정

지연이 불가. 작은/증류 모델로 first response, 필요시 백엔드에서 큰 모델.

13.10 결과 검증 UI 부재

자동화 맹신 → 오류 누적. 사용자 교정 UI 필수.


14장 · 체크리스트 — 멀티모달 런칭 전 12가지


15장 · 다음 글 예고 — Season 4 Ep 9: "Voice AI 실전"

Ep 8에서 오디오는 맛보기였다. Ep 9은 음성 제품만 집중.

"화면 없는 AI"의 시대를 Ep 9에서 정리한다.

다음 글에서 만나자.


요약: 2025년 멀티모달은 "모든 걸 VLM 한 번에"가 아니라 "각 모달에 최적 도구 + VLM 후처리 + 검증 루프"의 조합이다. Vision은 해상도·토큰을 관리하고, Document AI는 OCR+VLM 하이브리드, 비디오는 샘플링+오디오 병행, 오디오는 STT/TTS/음성 LLM의 적재적소. 한국어·한국 문서는 Clova/Upstage/Kakao 같은 현지 강점과 글로벌 VLM을 함께 써서 품질 경계를 극대화한다. "VLM이 OCR을 죽였다"는 말은 밈이지, 엔지니어링 판단이 아니다.

댓글

아직 댓글이 없습니다.

로그인하면 댓글을 쓸 수 있습니다