태그: #vision-language
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 4 편
SOTA 멀티모달 LLM 분석 — 하나의 모델로 보고 듣고 말하다
텍스트 하나로 학습된 LLM이 어떻게 이미지, 오디오, 비디오까지 이해하고 생성하게 되었는지 살펴봅니다. 모달별 인코더와 프로젝터, 통합 토큰 공간, any-to-any 흐름, 네이티브 멀티모달과 어댑터 접합 방식, 그리고 학습 전략과 벤치마크·한계까지 정리합니다.
2026-06-30 · 47 분 읽기 #multimodal-llm#any-to-any#vision-language#audio#architecture멀티모달 토크나이제이션과 융합 — 이미지·오디오를 토큰으로
이미지와 오디오, 비디오를 어떻게 토큰으로 바꾸고 텍스트와 하나의 시퀀스로 엮는지 정리합니다. 패치·VQ 기반 이미지 토큰화, 이산 코덱 오디오 토큰화, 프레임 샘플링, 인터리빙과 구분 토큰, 토큰 폭증과 압축, 컨텍스트 비용까지 멀티모달 LLM의 입력 구성을 깊이 다룹니다.
2026-06-26 · 30 분 읽기 #llm#multimodal#tokenization#vision-language#q-former멀티모달 AI 학습법 — 여러 감각을 하나의 모델로
이미지·텍스트·오디오·비디오를 하나의 모델로 다루는 멀티모달 AI의 학습 원리를 정리합니다. 모달리티 정렬과 대조학습, 융합 방식, 공유 임베딩 공간, 사전학습과 파인튜닝, 데이터와 평가, 그리고 환각 같은 한계까지 학습 파이프라인을 코드와 함께 살펴봅니다.
2026-06-26 · 34 분 읽기 #ai-papers#multimodal#clip#vision-language#contrastive-learning멀티모달 AI 완전 정복: CLIP, LLaVA, GPT-4V, Gemini Vision 마스터하기
멀티모달 AI의 기초부터 최신 비전-언어 모델까지 완전히 마스터하는 가이드. CLIP, BLIP-2, LLaVA, InstructBLIP, GPT-4V, Gemini Vision, Claude Vision 활용법과 멀티모달 RAG까지 실전 코드로 배웁니다.
2026-03-17 · 41 분 읽기 #multimodal#vision-language#clip#llava#gpt-4v