LabHub

博客

多模态 LLM 完全指南:Vision、文档理解、OCR、视频、音频、韩语的特殊性(2025)

한국어English日本語中文

Season 4 Ep 8 — Ep 1–7 基本都以文本为中心。从 Ep 8 开始,LLM 扩展到 会看、会听、会读 的世界。“文档处理交给 LLM 就行了”这个说法里哪些是真、哪些是假,我们一起来看。

Prologue — “VLM 杀死了 OCR”的传闻

从 2024 年底开始频繁出现在 YouTube 和 Twitter 上的说法: “把图片丢给 GPT-4o/Claude/Gemini 就不需要 OCR 了。传统流水线已经死了。”

对了一半。干净的收据、截图,VLM 跑一次就够了。但是:

所以 2025 年的答案是 混合式:传统 OCR/版面分析 + VLM 后处理 + 验证回路。


第 1 章 · 多模态 LLM 版图 2025

1.1 主要模型

模型提供方特点
GPT-4o / GPT-4.1OpenAI通用性最强,语音·图像实时
Claude 3.5 / 4 Sonnet·OpusAnthropic文档、代码、推理都强
Gemini 2 / 2.5 Pro/FlashGoogle1M+ 上下文,视频原生
Qwen2-VL / Qwen2.5-VLAlibaba(开源)开源 VLM 第一梯队,韩语也不错
Pixtral 12B / LargeMistral(开源)欧洲的开源 VLM
Llama 3.2-VisionMeta(开源)11B/90B,生态
Molmo / InternVLAllen AI / 上海开源,跑分上有竞争力
Phi 3.5-VisionMicrosoft小而快
DeepSeek-VL2DeepSeek性价比

1.2 选型标准

1.3 与纯文本模型搭配使用

很多产品只用 VLM 做 图像→文本描述或结构化数据 的转换,之后的分析与生成交给文本模型。在成本、延迟、可用性上都很实用。


第 2 章 · Vision 的基本原理

2.1 架构

大多数 VLM 是这样:

  1. Vision Encoder(CLIP、SigLIP 等)把图像变成 patch 嵌入
  2. Projector(MLP/Q-Former)映射到 LLM 的 token 空间
  3. LLM 把图像 token + 文本 token 一起处理

2.2 分辨率很重要

2.3 Token 单价


第 3 章 · Document AI — 文档理解

3.1 过去的流水线

PDF/ImageOCR(Tesseract/ABBYY/Clova OCR)
Layout analysis (DocBank/LayoutLM/DocLayNet)
Table/Form extraction
          → 基于规则 or 分类器

3.2 2025 年的技术栈

3.3 VLM + 坐标的威力

给 VLM 的不只是图像,还一起给上 OCR 结果(单词+坐标)的话:

例:

<image>contract.png</image>
<ocr>
  {word: "갑", bbox: [..]}
  {word: "주식회사", bbox: [..]}
  ...
</ocr>
Task: 将合同当事人姓名与签订日期提取为 JSON。每个字段都要包含 bbox。

3.4 使用场景

3.5 韩语的特殊性


第 4 章 · OCR 的现代化

4.1 传统 OCR

4.2 LLM 原生 OCR 的时代

4.3 混合式最佳实践

1) 用高速 OCR 拿到文本+坐标
2) VLM 做语义结构化(字段分类、实体抽取)
3) VLM 的输出必须与 OCR 原文交叉验证
4) 验证失败时重试 or 交给人确认

4.4 小心跑分


第 5 章 · 图表、表格、图纸 — 最难的领域

5.1 图表理解

5.2 表格抽取

5.3 图纸·建筑

5.4 科学·工程图


第 6 章 · 视频理解

6.1 几种做法

6.2 使用场景

6.3 成本与延迟


第 7 章 · 音频 — STT 与 TTS

7.1 STT (Speech-to-Text)

模型特点
Whisper (large-v3)开源,多语言优秀
Deepgram Nova商用,延迟短
AssemblyAI商用,说话人分离·情感
Rev.ai / Speechmatics商用
Naver Clova Speech韩语特化
Kakao Speech韩语特化

7.2 实时流水线

7.3 TTS

7.4 语音 LLM(Speech LLM)

7.5 韩语 STT 小贴士


第 8 章 · 多模态 RAG

8.1 基本思路

用“问题文本”一直检索到“图像、PDF、视频片段”。

8.2 三种做法

(a) 先文本化再 RAG

(b) 多模态嵌入

(c) 混合式

8.3 PDF RAG 实战

8.4 注意


第 9 章 · UX 设计 — 多模态界面

9.1 上传

9.2 结果展示

9.3 验证回路


第 10 章 · 成本与延迟的现实

10.1 图像成本

10.2 延迟

10.3 策略


第 11 章 · 安全与隐私

11.1 图像里的 PII

11.2 数据残留

11.3 监管

11.4 Prompt injection via image


第 12 章 · 三个实战案例

12.1 收据与税务发票处理

12.2 合同摘要与争议点检测

12.3 呼叫中心录音分析


第 13 章 · 十大反模式

13.1 只用 VLM 把 OCR 废掉

审计与精度都会下降。推荐混合式。

13.2 分辨率拉满

成本与延迟爆炸。缩略图 → 需要时再上高分辨率。

13.3 对图像提示注入毫无防备

把图像里的文本当成指令 → 事故。

13.4 不确认授权

训练图像的版权、商用授权。

13.5 不验证就用图表里的数字

幻觉风险。引用与交叉确认是必须的。

13.6 把 1 小时的视频整段一次性塞进去

token 爆炸。要采样、先用音频做一遍处理。

13.7 明明是韩语 OCR 却用英文 OCR

精度差距很大。优先考虑 Clova/Upstage/Kakao。

13.8 没有 TTS 声音规范

品牌一致性会崩。要规定语调、语速、抑扬。

13.9 实时语音里硬塞大模型

延迟上不可能。first response 用小/蒸馏模型,需要时后端再上大模型。

13.10 没有结果验证 UI

盲信自动化 → 错误不断累积。用户纠错 UI 是必须的。


第 14 章 · 检查清单 — 多模态上线前的 12 项


第 15 章 · 下期预告 — Season 4 Ep 9:“Voice AI 实战”

Ep 8 里音频只是尝了一口。Ep 9 只专注 语音产品

Ep 9 会把 “没有屏幕的 AI”的时代 讲清楚。

下一篇文章见。


总结:2025 年的多模态不是“一次 VLM 搞定一切”,而是“给每个模态配最合适的工具 + VLM 后处理 + 验证回路”的组合。Vision 要管好分辨率与 token,Document AI 走 OCR+VLM 混合式,视频要采样并与音频并行,音频则把 STT/TTS/语音 LLM 各放在合适的位置。韩语与韩国的文档,把 Clova/Upstage/Kakao 这类本地强项与全球 VLM 一起用,把质量的边界推到最大。“VLM 杀死了 OCR”这句话是个梗,不是工程判断。

评论

还没有评论。

登录后即可发表评论