태그: #computer-vision
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 15 편
모두를 위한 AI 5편 — 47만 파라미터 U-Net으로 흑백 사진에 색 입히기, 그리고 왜 색이 바랬는가
시리즈에서 가장 작은 모델인 47만 파라미터 U-Net으로 CIFAR-10 흑백 이미지를 컬러로 복원했습니다. 형태는 정확히 살렸지만 색이 눈에 띄게 바랬는데, 이건 모델 용량 문제가 아니라 L1 손실을 고른 결과입니다. skip connection이 무엇을 나르는지, 그리고 회귀 손실이 왜 채도를 죽이는지를 실제 결과 이미지로 확인합니다.
2026-08-23 · 14 분 읽기 #ai#computer-vision#unet#colorization#pytorch3D를 만드는 두 가지 길 — 복원(NeRF·가우시안 스플래팅)과 생성(TRELLIS·Hunyuan3D)
"3D 모델을 만든다"는 말에는 완전히 다른 두 문제가 숨어 있습니다. 실제로 존재하는 장면을 사진 여러 장으로 되살리는 복원(reconstruction)과, 존재하지 않는 것을 텍스트·이미지 한 장에서 지어내는 생성(generation)입니다. 복원의 계보를 SfM에서 NeRF, 그리고 판을 바꾼 3D 가우시안 스플래팅과 feedforward 복원(Meta MapAnything)까지 따라가
2026-07-09 · 15 분 읽기 #3d#ai#gaussian-splatting#nerf#computer-visionSOTA 3D 비전 분석 — 단안 깊이와 3D 가우시안 스플래팅
3D 비전의 SOTA 흐름을 정리합니다. 단안 깊이 추정(상대·미터 깊이)과 Depth Anything 계열의 개념, 스테레오·MVS 개요, 그리고 NeRF에서 3D 가우시안 스플래팅으로 이어지는 실시간 렌더링의 발전을 표현·학습·응용 관점에서 아키텍처 원리 중심으로 살펴봅니다.
2026-06-30 · 44 분 읽기 #ai-papers#3d-vision#monocular-depth#gaussian-splatting#nerfSOTA 분할·검출 모델 분석 — SAM과 DETR, YOLO의 계보
객체 검출과 이미지 분할의 SOTA 계보를 정리합니다. 2단계 R-CNN에서 1단계 YOLO/SSD, 트랜스포머 기반 DETR로 이어지는 검출의 흐름과, 시맨틱·인스턴스·판옵틱 분할, 그리고 프롬프트 가능 분할을 연 Segment Anything(SAM)까지 아키텍처 원리 중심으로 살펴봅니다.
2026-06-30 · 41 분 읽기 #ai-papers#computer-vision#object-detection#segmentation#samSOTA 실시간 비디오 분석 — 추적, 이해, 효율 추론
실시간 비디오 분석의 SOTA 흐름을 정리합니다. 행동 인식·객체 추적·시간적 분할 같은 비디오 이해 과제, SAM 2 계열의 비디오 분할·추적 개념, 트랜스포머 기반 비디오 모델, 그리고 경량화·스트리밍을 통한 실시간 추론 최적화를 아키텍처 원리 중심으로 살펴봅니다.
2026-06-30 · 46 분 읽기 #ai-papers#video-understanding#object-tracking#sam2#action-recognition로봇의 눈 — 3D 인식과 SLAM
로봇이 세상을 어떻게 보는지 다룹니다. RGB-D·LiDAR·스테레오 센서, SLAM 파이프라인, 포인트클라우드와 복셀, 6D 자세 추정, 딥러닝 인식, 그리고 NeRF와 3D 가우시안까지 로봇 인식의 전체 그림을 코드와 다이어그램으로 살펴봅니다.
2026-06-29 · 33 분 읽기 #ai-papers#robotics#slam#3d-perception#pointcloud컴퓨터 비전 프레임워크 2026 완벽 가이드 - OpenCV 4 · MediaPipe · Detectron2 · YOLO v11 · MMDetection · SAM 2 · Grounding DINO 심층 분석
2026년의 컴퓨터 비전 스택은 더 이상 "픽셀을 만지는 일"이 아니다. OpenCV 4.10이 ONNX 추론을 기본기로 받아들이고, MediaPipe Studio가 모바일 실시간 파이프라인을 한 줄로 줄이고, YOLO v11이 Ultralytics에서 NAS·세그멘테이션·자세 추정까지 한 모델에 묶고, SAM 2가 비디오 마스크를 실시간으로 추적하고, Grounding DINO 1.6과 F
2026-05-16 · 36 분 읽기 #computer-vision#opencv#mediapipe#detectron2#yolo비전 모델 개발·파인튜닝 완전 가이드 2026 — CNN, ViT, DETR, SAM 2, VLM 까지 실전 의사결정 트리
2026년 비전 모델 개발은 더 이상 ResNet 한 줄 가져다 학습하는 시대가 아니다. CNN, ViT, DETR, SAM 2, 그리고 LLaVA·Qwen-VL·Gemini Vision·Claude Vision 같은 VLM 까지 — 같은 사진 한 장에 대해서도 어떤 모델을 쓰느냐로 비용이 100배, 정확도가 30%p 갈린다. 이 글은 분류·탐지·세그멘테이션·OCR·캡셔닝·VQA 라는 6가지
2026-05-14 · 30 분 읽기 #computer-vision#vision-model#cnn#vit#detr컴퓨터 비전 완전 정복: CNN부터 ViT, YOLO, Stable Diffusion까지
ResNet, EfficientNet CNN 아키텍처부터 YOLO 객체 탐지, SAM 세그멘테이션, Vision Transformer, Stable Diffusion 생성 모델까지 컴퓨터 비전 완전 정복 가이드입니다.
2026-03-17 · 19 분 읽기 #computer-vision#cnn#yolo#vit#stable-diffusionCNN 아키텍처 완전 정복: LeNet부터 EfficientNet, Vision Transformer까지
CNN 아키텍처의 역사와 발전을 완전히 이해하는 가이드. LeNet, AlexNet, VGG, ResNet, DenseNet, EfficientNet, Vision Transformer까지 구조 분석과 PyTorch 구현으로 완벽히 마스터합니다.
2026-03-17 · 32 분 읽기 #cnn#computer-vision#deep-learning#resnet#vggtorchvision 완전 가이드 — 이미지 분류부터 Object Detection, Segmentation까지
torchvision의 transforms v2, 사전학습 모델(ResNet~ViT), 데이터셋, Object Detection(Faster R-CNN, YOLO), Segmentation, 그리고 실전 파인튜닝까지. 컴퓨터 비전 실무를 PyTorch로 정복합니다.
2026-03-02 · 9 분 읽기 #ai-platform#pytorch#torchvision#computer-vision#cnn자율주행/로보틱스 기술 스택 완전 정복: C++, ROS2, CUDA, TensorRT부터 VLM/VLA, 시뮬레이션까지
자율주행과 로보틱스의 핵심 기술 스택을 총정리한다. Modern C++, ROS/ROS2, CUDA 병렬 프로그래밍, TensorRT 최적화, 모델 경량화(양자화/프루닝), 센서 퓨전(GPS/IMU/카메라/LiDAR), VLM/VLA 모델, SIL/HIL 테스팅, 시뮬레이션(CARLA/Isaac Sim), 자율주행 풀 스택, VR/AR 디지털 트윈, 클라우드 인프라까지 13개 핵심 영역을 실
2026-03-01 · 31 분 읽기 #autonomous-driving#robotics#ros2#cuda#tensorrtSegment Anything Model 완전 정복: SAM 1 → SAM 2 → SAM 3 논문 분석과 실전 가이드
Meta AI의 Segment Anything Model(SAM) 시리즈를 완전 정복한다. SAM 1(이미지 프롬프터블 세그멘테이션), SAM 2(비디오 실시간 세그멘테이션), SAM 3(개념 인식 세그멘테이션)까지 아키텍처, 데이터셋, 핵심 혁신, 성능 벤치마크, 그리고 설치·실행 방법을 총정리한다.
2026-03-01 · 28 분 읽기 #sam#segment-anything#computer-vision#image-segmentation#video-segmentationVision Transformer(ViT) 논문 완벽 분석: 이미지 한 장은 16x16 단어의 가치가 있다
Google의 ViT 논문을 심층 분석한다. 이미지를 패치 시퀀스로 변환하는 혁신적 접근, Patch Embedding과 Position Embedding의 원리, CNN 대비 성능과 데이터 효율성 트레이드오프, 그리고 DeiT, Swin Transformer, BEiT 등 후속 연구까지 총정리한다.
2026-03-01 · 45 분 읽기 #vit#vision-transformer#computer-vision#transformer#image-classificationResNet 논문 완벽 분석: 잔차 연결(Residual Connection)이 딥러닝의 깊이 한계를 돌파한 방법
Microsoft의 ResNet 논문을 심층 분석한다. Degradation 문제의 발견, Skip Connection의 수학적 원리, Bottleneck 구조, ImageNet ILSVRC 2015 우승 아키텍처를 수식과 코드로 정리하고 ResNet이 현대 딥러닝에 미친 영향을 조망한다.
2026-03-01 · 42 분 읽기 #resnet#residual-learning#cnn#computer-vision#image-classification