태그: #vit
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 4 편
Vision LLM 아키텍처 — 이미지가 언어가 되기까지
비전-언어 모델은 이미지를 비전 인코더로 처리한 뒤 프로젝터를 거쳐 LLM이 이해할 수 있는 토큰으로 바꿉니다. 패치 임베딩부터 임의 해상도 처리까지, 이미지가 언어 토큰이 되는 전 과정을 구조적으로 살펴봅니다.
2026-06-26 · 41 분 읽기 #llm#vision-language-model#multimodal#vit#qwen2-vl비전 모델 개발·파인튜닝 완전 가이드 2026 — CNN, ViT, DETR, SAM 2, VLM 까지 실전 의사결정 트리
2026년 비전 모델 개발은 더 이상 ResNet 한 줄 가져다 학습하는 시대가 아니다. CNN, ViT, DETR, SAM 2, 그리고 LLaVA·Qwen-VL·Gemini Vision·Claude Vision 같은 VLM 까지 — 같은 사진 한 장에 대해서도 어떤 모델을 쓰느냐로 비용이 100배, 정확도가 30%p 갈린다. 이 글은 분류·탐지·세그멘테이션·OCR·캡셔닝·VQA 라는 6가지
2026-05-14 · 30 분 읽기 #computer-vision#vision-model#cnn#vit#detr컴퓨터 비전 완전 정복: CNN부터 ViT, YOLO, Stable Diffusion까지
ResNet, EfficientNet CNN 아키텍처부터 YOLO 객체 탐지, SAM 세그멘테이션, Vision Transformer, Stable Diffusion 생성 모델까지 컴퓨터 비전 완전 정복 가이드입니다.
2026-03-17 · 19 분 읽기 #computer-vision#cnn#yolo#vit#stable-diffusionVision Transformer(ViT) 논문 완벽 분석: 이미지 한 장은 16x16 단어의 가치가 있다
Google의 ViT 논문을 심층 분석한다. 이미지를 패치 시퀀스로 변환하는 혁신적 접근, Patch Embedding과 Position Embedding의 원리, CNN 대비 성능과 데이터 효율성 트레이드오프, 그리고 DeiT, Swin Transformer, BEiT 등 후속 연구까지 총정리한다.
2026-03-01 · 45 분 읽기 #vit#vision-transformer#computer-vision#transformer#image-classification