태그: #sam
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 6 편
SOTA 분할·검출 모델 분석 — SAM과 DETR, YOLO의 계보
객체 검출과 이미지 분할의 SOTA 계보를 정리합니다. 2단계 R-CNN에서 1단계 YOLO/SSD, 트랜스포머 기반 DETR로 이어지는 검출의 흐름과, 시맨틱·인스턴스·판옵틱 분할, 그리고 프롬프트 가능 분할을 연 Segment Anything(SAM)까지 아키텍처 원리 중심으로 살펴봅니다.
2026-06-30 · 41 분 읽기 #ai-papers#computer-vision#object-detection#segmentation#sam비전-언어 모델(VLM) 2026 완벽 가이드 - CLIP · LLaVA · InternVL3 · Qwen2.5-VL · GPT-4o · Gemini 2.5 · Claude 4.7 · DINOv2 · SAM 2 · Florence-2 심층 분석
2026년 5월 기준 비전-언어 모델(VLM)의 모든 것을 한 글에 담는다. CLIP 계열(SigLIP, EVA-CLIP)부터 오픈 VLM(LLaVA-NeXT, InternVL3, Qwen2.5-VL, Pixtral, Molmo, Idefics3, MiniCPM-V), 폐쇄형(GPT-4o, Claude 4.7, Gemini 2.5), 비전 파운데이션(DINOv2/v3, SAM 2, Flore
2026-05-16 · 34 분 읽기 #vision-language-models#vlm#clip#llava#internvl컴퓨터 비전 프레임워크 2026 완벽 가이드 - OpenCV 4 · MediaPipe · Detectron2 · YOLO v11 · MMDetection · SAM 2 · Grounding DINO 심층 분석
2026년의 컴퓨터 비전 스택은 더 이상 "픽셀을 만지는 일"이 아니다. OpenCV 4.10이 ONNX 추론을 기본기로 받아들이고, MediaPipe Studio가 모바일 실시간 파이프라인을 한 줄로 줄이고, YOLO v11이 Ultralytics에서 NAS·세그멘테이션·자세 추정까지 한 모델에 묶고, SAM 2가 비디오 마스크를 실시간으로 추적하고, Grounding DINO 1.6과 F
2026-05-16 · 36 분 읽기 #computer-vision#opencv#mediapipe#detectron2#yolo비전 모델 개발·파인튜닝 완전 가이드 2026 — CNN, ViT, DETR, SAM 2, VLM 까지 실전 의사결정 트리
2026년 비전 모델 개발은 더 이상 ResNet 한 줄 가져다 학습하는 시대가 아니다. CNN, ViT, DETR, SAM 2, 그리고 LLaVA·Qwen-VL·Gemini Vision·Claude Vision 같은 VLM 까지 — 같은 사진 한 장에 대해서도 어떤 모델을 쓰느냐로 비용이 100배, 정확도가 30%p 갈린다. 이 글은 분류·탐지·세그멘테이션·OCR·캡셔닝·VQA 라는 6가지
2026-05-14 · 30 분 읽기 #computer-vision#vision-model#cnn#vit#detr컴퓨터 비전 완전 정복: CNN부터 ViT, YOLO, Stable Diffusion까지
ResNet, EfficientNet CNN 아키텍처부터 YOLO 객체 탐지, SAM 세그멘테이션, Vision Transformer, Stable Diffusion 생성 모델까지 컴퓨터 비전 완전 정복 가이드입니다.
2026-03-17 · 19 분 읽기 #computer-vision#cnn#yolo#vit#stable-diffusionSegment Anything Model 완전 정복: SAM 1 → SAM 2 → SAM 3 논문 분석과 실전 가이드
Meta AI의 Segment Anything Model(SAM) 시리즈를 완전 정복한다. SAM 1(이미지 프롬프터블 세그멘테이션), SAM 2(비디오 실시간 세그멘테이션), SAM 3(개념 인식 세그멘테이션)까지 아키텍처, 데이터셋, 핵심 혁신, 성능 벤치마크, 그리고 설치·실행 방법을 총정리한다.
2026-03-01 · 28 분 읽기 #sam#segment-anything#computer-vision#image-segmentation#video-segmentation