标签: #audio
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 2 篇
SOTA多模态LLM解析 — 用一个模型看、听、说
一个只用文本训练出来的LLM,是如何走到能够理解并生成图像、音频乃至视频的?本文梳理了各模态的编码器与投影器、统一token空间、any-to-any流程、原生多模态与适配器拼接两种路线的对比,以及训练策略、基准测试与局限性。
2026-06-30 · 37 分钟阅读 #multimodal-llm#any-to-any#vision-language#audio#architecturetorchaudio 完全指南 — 从音频处理到语音识别、TTS、音乐分析
用 torchaudio 讲透音频加载、频谱图变换、Mel 滤波器组、MFCC、语音识别(Wav2Vec2/Whisper)、TTS、说话人分离、降噪。音频 AI 的方方面面,全部用 PyTorch 覆盖。
2026-03-02 · 10 分钟阅读 #ai-platform#pytorch#torchaudio#audio#speech-recognition