标签: #ocr
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 2 篇
RTX 5090 单卡亲手跑几个小模型 — microGPT·OCR·音乐生成
用一张 RTX 5090(Blackwell,32GB),通过 SSH 连上去直接跑了三个小模型。从零开始用 28 秒训练出一个 char-level GPT(10.75M 参数,117 万 tokens/s),把专用 OCR(TrOCR)和小型 VLM(Qwen2-VL-2B)放到同一张图上用 CER 一决高下,再用 MusicGen 在 1.9 秒(实时的 4.2 倍)里生成一段 8 秒的音乐。连同过程中遇到的那些诚实的陷阱 — 没
2026-07-11 · 10 分钟阅读 #pytorch#gpu#llm#ocr#hands-on多模态 LLM 完全指南:Vision、文档理解、OCR、视频、音频、韩语的特殊性(2025)
只处理文本的时代结束了。2025 年的 LLM 能自然地处理图像、文档、视频与音频。GPT-4o/Claude 3.5/Gemini/Qwen2-VL/Pixtral 对比、Document AI 与版面理解、OCR 的现代化、视频与音频、韩语文档的特殊性,以及多模态 RAG。用实战案例梳理的一篇。
2026-04-15 · 18 分钟阅读 #multimodal#vision-llm#document-ai#ocr#whisper