标签: #multimodal
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 8 篇
人人可懂的 AI 第4篇 — 用137万参数给图像配句子,以及第3篇的 bug 为何没出现在这里
把 CNN 编码器接上 Transformer 解码器,给 Fashion-MNIST 图像配字幕。137万参数、十分钟训练,标签命中率达到 91%。本文讲清编码器-解码器结构中 cross-attention 在做什么,并把两个函数并排放在一起,说明让第3篇正确率跌到 7.5% 的 EOS bug 为何没有出现在这份代码里。
2026-08-22 · 9 分钟阅读 #ai#captioning#multimodal#transformer#pytorch人人可懂的 AI 第3篇 — 损失0.0017却只有7.5%正确率,元凶是一格填充
我们用148万参数做了一个 VQA 模型:同时接收图像和问题并给出答案。训练损失降到 0.0017,正确率却只有 7.5%,比随机猜还差。原因不在模型,而在生成标签的一行代码;改掉之后变成 99.5%。本文用真实输出说明:为什么低损失并不保证好模型,以及如何识破这个陷阱。
2026-08-21 · 10 分钟阅读 #ai#vqa#multimodal#debugging#pytorch文本、图像、智能体分别怎么测 —— 三个领域的测量为何根本不同
文本、图像、智能体都在用"性能"这同一个词,但测量结构完全不同。文本分裂成假装有正确答案的选择题和没有正确答案的生成式任务;图像的分布距离和人类判断对不上;智能体则因为部分成功、环境状态、非确定性,从一开始就无法压缩成一个数字。本文在定义层面拆解各领域代表性指标实际计算的是什么,并为每个领域各配上一个"指标很高但实际很差"的案例。最后用一张表总结领域、任务、指标,以及每个指标遗漏了什么。
2026-08-02 · 32 分钟阅读 #llm-evaluation#multimodal#llm-as-judge#agent-benchmark#metrics多模态 AI 的训练方法 — 把多种感觉揉进一个模型
梳理让多模态 AI 在同一个模型里处理图像、文本、音频、视频的训练原理。依次讲解模态对齐与对比学习、融合方式、共享嵌入空间、预训练与微调、数据与评估,以及幻觉之类的局限,并配代码展示训练流水线。
2026-06-26 · 28 分钟阅读 #ai-papers#multimodal#clip#vision-language#contrastive-learning超越 OCR — OCR-free 文档理解与统一模型
传统 OCR 流水线把检测、识别、布局拆分成多个阶段,但误差会逐级累积。本文梳理文档 AI 的这场转变 — 从 Donut 系与基于 VLM 的 OCR-free 文档理解,到高分辨率与表格处理,再到统一模型的走向。
2026-06-26 · 34 分钟阅读 #ai-papers#ocr-free#document-understanding#multimodal#donut多模态 LLM 完全指南:Vision、文档理解、OCR、视频、音频、韩语的特殊性(2025)
只处理文本的时代结束了。2025 年的 LLM 能自然地处理图像、文档、视频与音频。GPT-4o/Claude 3.5/Gemini/Qwen2-VL/Pixtral 对比、Document AI 与版面理解、OCR 的现代化、视频与音频、韩语文档的特殊性,以及多模态 RAG。用实战案例梳理的一篇。
2026-04-15 · 18 分钟阅读 #multimodal#vision-llm#document-ai#ocr#whisperGemini 2.5 开发者实战指南:如何选择 Pro、Flash 与 Flash-Lite
本文以 2025 年 3 月 25 日发布的 Gemini 2.5 为基准,从实务角度梳理 Pro、Flash、Flash-Lite 该如何选择、reasoning 模型如何改变工作流,以及团队实际应该部署什么。
2026-04-12 · 9 分钟阅读 #google#gemini#gemini-2-5#coding#agentic-coding多模态 AI 完全指南:掌握 CLIP、LLaVA、GPT-4V 与 Gemini Vision
从多模态 AI 的基础到最新的视觉-语言模型,一份助你彻底掌握的完整指南。通过实战代码学习 CLIP、BLIP-2、LLaVA、InstructBLIP、GPT-4V、Gemini Vision、Claude Vision 的用法,并覆盖多模态 RAG。
2026-03-17 · 36 分钟阅读 #multimodal#vision-language#clip#llava#gpt-4v