태그: #clip
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 4 편
멀티모달 AI 학습법 — 여러 감각을 하나의 모델로
이미지·텍스트·오디오·비디오를 하나의 모델로 다루는 멀티모달 AI의 학습 원리를 정리합니다. 모달리티 정렬과 대조학습, 융합 방식, 공유 임베딩 공간, 사전학습과 파인튜닝, 데이터와 평가, 그리고 환각 같은 한계까지 학습 파이프라인을 코드와 함께 살펴봅니다.
2026-06-26 · 34 분 읽기 #ai-papers#multimodal#clip#vision-language#contrastive-learning비전-언어 모델(VLM) 2026 완벽 가이드 - CLIP · LLaVA · InternVL3 · Qwen2.5-VL · GPT-4o · Gemini 2.5 · Claude 4.7 · DINOv2 · SAM 2 · Florence-2 심층 분석
2026년 5월 기준 비전-언어 모델(VLM)의 모든 것을 한 글에 담는다. CLIP 계열(SigLIP, EVA-CLIP)부터 오픈 VLM(LLaVA-NeXT, InternVL3, Qwen2.5-VL, Pixtral, Molmo, Idefics3, MiniCPM-V), 폐쇄형(GPT-4o, Claude 4.7, Gemini 2.5), 비전 파운데이션(DINOv2/v3, SAM 2, Flore
2026-05-16 · 34 분 읽기 #vision-language-models#vlm#clip#llava#internvl자기지도 학습(Self-Supervised Learning) 완전 정복: SimCLR, MAE, DINO, CLIP
자기지도 학습을 완전히 마스터하는 가이드. 대조 학습(SimCLR, MoCo), 마스크드 오토인코더(MAE, BEiT), DINO, CLIP까지 레이블 없이도 강력한 표현을 학습하는 방법을 실전 코드와 함께 배웁니다.
2026-03-17 · 40 분 읽기 #self-supervised-learning#contrastive-learning#simclr#mae#dino멀티모달 AI 완전 정복: CLIP, LLaVA, GPT-4V, Gemini Vision 마스터하기
멀티모달 AI의 기초부터 최신 비전-언어 모델까지 완전히 마스터하는 가이드. CLIP, BLIP-2, LLaVA, InstructBLIP, GPT-4V, Gemini Vision, Claude Vision 활용법과 멀티모달 RAG까지 실전 코드로 배웁니다.
2026-03-17 · 41 분 읽기 #multimodal#vision-language#clip#llava#gpt-4v