태그: #ai-papers
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 78 편
SOTA 실시간 비디오 분석 — 추적, 이해, 효율 추론
실시간 비디오 분석의 SOTA 흐름을 정리합니다. 행동 인식·객체 추적·시간적 분할 같은 비디오 이해 과제, SAM 2 계열의 비디오 분할·추적 개념, 트랜스포머 기반 비디오 모델, 그리고 경량화·스트리밍을 통한 실시간 추론 최적화를 아키텍처 원리 중심으로 살펴봅니다.
2026-06-30 · 46 분 읽기 #ai-papers#video-understanding#object-tracking#sam2#action-recognitionSOTA 자율주행 인식 분석 — BEV, Occupancy, 엔드투엔드
자율주행 인식의 최신 흐름을 정리합니다. 인식-예측-계획-제어 스택, BEV 멀티카메라 융합, occupancy network의 3D 점유 표현, 비전 중심 대 라이다 융합, 엔드투엔드 학습과 월드모델까지 아키텍처 원리를 살펴봅니다.
2026-06-30 · 35 분 읽기 #ai-papers#autonomous-driving#bev#occupancy-network#end-to-endSOTA 음성 인식·합성 분석 — Whisper에서 코덱 언어모델까지
음성 인식(ASR)과 음성 합성(TTS)의 최신 흐름을 정리합니다. HMM에서 CTC/어텐션, Whisper의 대규모 약지도 학습, 그리고 Tacotron에서 뉴럴 보코더와 코덱 언어모델까지 계보와 아키텍처 원리를 살펴봅니다.
2026-06-30 · 35 분 읽기 #ai-papers#speech-recognition#text-to-speech#whisper#neural-codec휴머노이드 전신 제어 — 두 발로 걷고 손으로 다루기
휴머노이드 로봇이 두 발로 걷고 손으로 물건을 다루기까지, 이족보행 제어와 전신 제어(whole-body control)의 핵심 개념을 정리합니다. ZMP와 MPC, 강화학습 기반 로코모션, 균형과 낙상 회복, 보행과 조작의 통합, 그리고 시뮬레이션 학습을 실물로 옮기는 흐름을 다이어그램과 함께 살펴봅니다.
2026-06-29 · 40 분 읽기 #ai-papers#robotics#humanoid#locomotion#whole-body-controlSim-to-Real — 시뮬레이션에서 배운 것을 현실로
시뮬레이션에서 학습한 로봇 정책이 현실에서 무너지는 이유(현실 격차)를 분석하고, 도메인 랜덤화·도메인 적응·시스템 식별·디지털 트윈 같은 대응 기법과, 촉각·마찰 등 재현이 어려운 물리, zero-shot 전이의 가능성과 한계를 다이어그램과 사례로 설명합니다.
2026-06-29 · 34 분 읽기 #ai-papers#robotics#sim-to-real#domain-randomization#digital-twin로봇 파운데이션 모델 — 하나의 정책으로 여러 일을
하나의 정책으로 여러 로봇, 여러 작업을 해내려는 로봇 파운데이션 모델의 흐름을 정리합니다. 제너럴리스트 정책의 개념, Open X-Embodiment 같은 대규모 로봇 데이터, 크로스 임바디먼트, VLA와의 관계, 스케일링 관점, 그리고 데이터·안전·평가라는 과제를 다이어그램과 함께 살펴봅니다.
2026-06-29 · 38 분 읽기 #ai-papers#robotics#foundation-model#generalist-policy#open-x-embodiment사람 영상에서 배우는 로봇 — 웹 스케일 데이터의 꿈
사람이 물건을 다루는 영상에서 로봇이 배울 수 있을까요. 어포던스와 궤적, 도메인 갭, 표현학습과 사전학습, 원샷 모방, 웹 비디오 스케일업, 그리고 로봇 데이터와의 결합까지 사례와 한계를 짚습니다.
2026-06-29 · 37 분 읽기 #ai-papers#robotics#imitation-learning#representation-learning#video로봇 안전과 정렬 — 강력한 로봇을 신뢰하려면
점점 강력해지는 로봇을 어떻게 신뢰할 수 있을까요. 물리적 안전, 제약 강화학습과 안전층, 분포 이탈 대응, 사람-로봇 협업 안전, 검증과 표준, 그리고 임바디드 AI의 정렬 과제까지 균형 있게 살펴봅니다.
2026-06-29 · 34 분 읽기 #ai-papers#robotics#safety#alignment#reinforcement-learning월드 모델 — 로봇이 미래를 상상하다
월드 모델의 개념(환경 동역학을 학습하는 것)을 설명하고, 모델 기반 강화학습, 잠재 공간 예측, 비디오 예측·생성 모델의 로봇 응용, 상상 롤아웃과 MPC를 통한 계획, 그리고 보행·조작에의 적용과 한계를 다이어그램으로 정리합니다.
2026-06-29 · 34 분 읽기 #ai-papers#robotics#world-models#model-based-rl#planning로봇은 어떻게 배우는가 — 모방학습과 강화학습
로봇이 기술을 습득하는 네 가지 방식을 개괄하고, 모방학습(텔레오퍼레이션·행동 복제·DAgger)과 강화학습(보상·정책·탐험)의 원리와 장단점, 데이터 효율의 차이, 그리고 두 접근을 결합하는 방법을 다이어그램과 비교표로 정리합니다.
2026-06-29 · 33 분 읽기 #ai-papers#robotics#imitation-learning#reinforcement-learning#robot-learning로봇의 눈 — 3D 인식과 SLAM
로봇이 세상을 어떻게 보는지 다룹니다. RGB-D·LiDAR·스테레오 센서, SLAM 파이프라인, 포인트클라우드와 복셀, 6D 자세 추정, 딥러닝 인식, 그리고 NeRF와 3D 가우시안까지 로봇 인식의 전체 그림을 코드와 다이어그램으로 살펴봅니다.
2026-06-29 · 33 분 읽기 #ai-papers#robotics#slam#3d-perception#pointcloud촉각 센싱과 정교한 조작 — 로봇이 손끝으로 느끼다
로봇이 손끝으로 세상을 느끼기 시작했습니다. 비전 기반 촉각 센서(GelSight류)와 전자피부, 촉각이 담당하는 미끄러짐·힘·재질 감지, 시각-촉각 융합, 정교한 인핸드 조작, 그리고 촉각 sim2real과 학습 방법을 다이어그램과 함께 정리합니다.
2026-06-29 · 41 분 읽기 #ai-papers#robotics#tactile-sensing#manipulation#gelsight휴머노이드를 위한 두 개의 뇌 — GR00T N1과 Helix
휴머노이드 로봇을 위한 VLA는 빠른 반사와 느린 사고를 함께 갖춰야 합니다. NVIDIA GR00T N1과 Figure AI Helix를 중심으로, 빠른 저수준 제어(System 1)와 느린 계획(System 2)을 결합하는 듀얼 시스템 아키텍처, 학습 방식, 과제와 전망을 정리합니다.
2026-06-27 · 29 분 읽기 #ai-papers#robotics#humanoid#groot-n1#helixDiffusion Policy와 π0 — 부드러운 로봇 행동의 비밀
이산 액션 토큰의 한계를 넘어, 행동을 연속값으로 생성하는 두 흐름을 살펴봅니다. Diffusion Policy는 행동을 디노이징으로 생성하고, π0는 flow-matching으로 고주파 연속 액션을 만듭니다. 두 접근의 아이디어, 아키텍처, 제어 주파수, 강점과 한계를 정리합니다.
2026-06-27 · 28 분 읽기 #ai-papers#robotics#diffusion-policy#pi0#flow-matching로봇이 보고 듣고 움직이다 — VLA 모델 RT-2와 OpenVLA 리뷰
비전-언어-행동(VLA) 모델은 카메라 영상과 자연어 지시를 받아 로봇의 행동을 직접 출력합니다. RT-2, Open X-Embodiment, OpenVLA를 중심으로 VLA 패러다임의 아이디어, 아키텍처, 액션 토큰화, 강점과 한계를 정리합니다.
2026-06-27 · 29 분 읽기 #ai-papers#robotics#vla#rt-2#openvla멀티모달 AI 학습법 — 여러 감각을 하나의 모델로
이미지·텍스트·오디오·비디오를 하나의 모델로 다루는 멀티모달 AI의 학습 원리를 정리합니다. 모달리티 정렬과 대조학습, 융합 방식, 공유 임베딩 공간, 사전학습과 파인튜닝, 데이터와 평가, 그리고 환각 같은 한계까지 학습 파이프라인을 코드와 함께 살펴봅니다.
2026-06-26 · 34 분 읽기 #ai-papers#multimodal#clip#vision-language#contrastive-learningOCR을 넘어서 — OCR-free 문서 이해와 통합 모델
전통적인 OCR 파이프라인은 검출-인식-레이아웃을 단계로 나누지만 오류가 누적됩니다. Donut류와 VLM 기반의 OCR-free 문서 이해, 고해상도와 표 처리, 통합 모델의 흐름까지 문서 AI의 전환을 정리합니다.
2026-06-26 · 40 분 읽기 #ai-papers#ocr-free#document-understanding#multimodal#donutAI 하드웨어 최신 연구 동향 2026 — 논문으로 보는 미래
2026년의 AI 하드웨어 연구 흐름을 논문 단위로 훑어봅니다. 웨이퍼스케일과 포토닉스, 인메모리 컴퓨팅, FP4 저정밀 학습, 희소성과 MoE 하드웨어, 광 인터커넥트, 차세대 메모리, 뉴로모픽, 하드웨어-소프트웨어 공동설계까지 핵심 아이디어와 의의, 한계를 정리합니다.
2026-06-16 · 40 분 읽기 #ai-papers#ai-hardware#photonics#compute-in-memory#low-precisionLLM 랜드마크 논문 2026 완벽 가이드 - Transformer · Scaling Laws · Flash Attention · Mamba · DeepSeek-R1 · Titans 심층 분석
2017년 Attention Is All You Need에서 2026년 Titans와 DeepSeek-R1까지, LLM 시대를 만든 50여 편의 랜드마크 논문을 테마별로 정리한다. Transformer · BERT · GPT 시리즈 · Scaling Laws · Chinchilla · InstructGPT · PaLM · Flash Attention 1/2/3 · LLaMA 1/2/3/4 ·
2026-05-16 · 34 분 읽기 #llm-papers#transformer#scaling-laws#flash-attention#mambaMixture of Experts(MoE) 아키텍처 논문 심층 분석: GShard에서 DeepSeek-MoE까지
Mixture of Experts 아키텍처의 핵심 논문을 분석하고, GShard, Switch Transformer, Mixtral, DeepSeek-MoE의 라우팅 전략과 학습 안정성 기법을 비교합니다.
2026-03-14 · 34 분 읽기 #ai-papers#moe#transformer#deepseek