タグ: #q-former
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 1 件
マルチモーダルのトークナイゼーションと融合 — 画像・音声をトークンへ
画像・音声・動画をどうトークンへ変え、テキストと一つの列へ編むのかを整理します。パッチおよびVQベースの画像トークン化、離散コーデックによる音声トークン化、フレームサンプリング、インターリービングと区切りトークン、トークン爆発と圧縮、コンテキストコストまで、マルチモーダルLLMの入力構成を深く扱います。
2026-06-26 · 26 分で読めます #llm#multimodal#tokenization#vision-language#q-former