标签: #vision-language
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 3 篇
SOTA多模态LLM解析 — 用一个模型看、听、说
一个只用文本训练出来的LLM,是如何走到能够理解并生成图像、音频乃至视频的?本文梳理了各模态的编码器与投影器、统一token空间、any-to-any流程、原生多模态与适配器拼接两种路线的对比,以及训练策略、基准测试与局限性。
2026-06-30 · 37 分钟阅读 #multimodal-llm#any-to-any#vision-language#audio#architecture多模态 AI 的训练方法 — 把多种感觉揉进一个模型
梳理让多模态 AI 在同一个模型里处理图像、文本、音频、视频的训练原理。依次讲解模态对齐与对比学习、融合方式、共享嵌入空间、预训练与微调、数据与评估,以及幻觉之类的局限,并配代码展示训练流水线。
2026-06-26 · 28 分钟阅读 #ai-papers#multimodal#clip#vision-language#contrastive-learning多模态 AI 完全指南:掌握 CLIP、LLaVA、GPT-4V 与 Gemini Vision
从多模态 AI 的基础到最新的视觉-语言模型,一份助你彻底掌握的完整指南。通过实战代码学习 CLIP、BLIP-2、LLaVA、InstructBLIP、GPT-4V、Gemini Vision、Claude Vision 的用法,并覆盖多模态 RAG。
2026-03-17 · 36 分钟阅读 #multimodal#vision-language#clip#llava#gpt-4v