블로그
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 3672 편
#2026-03 762#culture 283#deep-dive 275#kubernetes 260#career 233#ai 220#llm 216#devops 195#2026-04 158#security 147#observability 118#database 113#communication 108#history 107#architecture 101#productivity 98#performance 93#linux 90#networking 89#finance 87#economy 84#mindset 80#psychology 79#ai-papers 78#food 78#it 78#travel 78#japanese 76#deep-learning 75#english 74#gpu 74#ai-agent 69#business-travel 69#postgresql 66#cs-fundamentals 63#rag 63#systems 63#python 55#learning 54#self-improvement 53
3D 파이프라인 — 게임 실시간과 영상 오프라인의 차이
모델링부터 렌더까지 이어지는 3D 자산 파이프라인 전체를 조망합니다. 게임 엔진의 실시간 렌더와 영화의 오프라인 렌더팜이 어떻게 다른지, LOD와 폴리 예산, 드로콜 같은 최적화 개념, glTF와 USD 같은 교환 포맷, 그리고 협업 방식을 다이어그램과 비교표로 정리합니다.
2026-06-27 · 33 분 읽기 #3d-pipeline#real-time#offline-rendering#game-engine#gltf휴머노이드를 위한 두 개의 뇌 — GR00T N1과 Helix
휴머노이드 로봇을 위한 VLA는 빠른 반사와 느린 사고를 함께 갖춰야 합니다. NVIDIA GR00T N1과 Figure AI Helix를 중심으로, 빠른 저수준 제어(System 1)와 느린 계획(System 2)을 결합하는 듀얼 시스템 아키텍처, 학습 방식, 과제와 전망을 정리합니다.
2026-06-27 · 29 분 읽기 #ai-papers#robotics#humanoid#groot-n1#helixDiffusion Policy와 π0 — 부드러운 로봇 행동의 비밀
이산 액션 토큰의 한계를 넘어, 행동을 연속값으로 생성하는 두 흐름을 살펴봅니다. Diffusion Policy는 행동을 디노이징으로 생성하고, π0는 flow-matching으로 고주파 연속 액션을 만듭니다. 두 접근의 아이디어, 아키텍처, 제어 주파수, 강점과 한계를 정리합니다.
2026-06-27 · 28 분 읽기 #ai-papers#robotics#diffusion-policy#pi0#flow-matching로봇이 보고 듣고 움직이다 — VLA 모델 RT-2와 OpenVLA 리뷰
비전-언어-행동(VLA) 모델은 카메라 영상과 자연어 지시를 받아 로봇의 행동을 직접 출력합니다. RT-2, Open X-Embodiment, OpenVLA를 중심으로 VLA 패러다임의 아이디어, 아키텍처, 액션 토큰화, 강점과 한계를 정리합니다.
2026-06-27 · 29 분 읽기 #ai-papers#robotics#vla#rt-2#openvla엔지니어를 위한 대화법: 기술 결정을 설득하는 법
좋은 아이디어가 채택되지 않는 이유는 대개 아이디어가 나빠서가 아니라 전달이 나빠서입니다. 이 글은 설계 문서와 RFC로 제안하는 법, 해답이 아니라 문제로 먼저 설득하는 법, 경영진과 동료 엔지니어에게 메시지를 다르게 맞추는 법, 논쟁에서 진 뒤에 나아가는 "동의하지 않지만 따른다", 비동기와 동기 커뮤니케이션의 선택, 모든 결정의 비용을 명시하는 법, 그리고 "강한 의견, 느슨하게 쥐기"
2026-06-27 · 26 분 읽기 #career#communication#engineering생일 역설과 해시 충돌 — 왜 23명이면 절반이 겹치는가
23명만 모여도 생일이 겹칠 확률이 절반을 넘습니다. 이 반직관적인 결과의 뿌리에는 √N이라는 근사가 있고, 같은 수학이 UUID와 해시 충돌 확률, 왜 128비트면 충분한지, 해시 테이블의 부하율과 리사이징, 그리고 git이 SHA-1에서 SHA-256으로 옮겨간 이유까지 관통합니다.
2026-06-27 · 20 분 읽기 #math#hashing#fundamentalsRust로 CLI 만들기: clap과 ripgrep·fd·bat의 비결
지난 몇 년간 명령줄 도구들이 조용히 Rust로 다시 쓰였습니다. ripgrep, fd, bat, eza, zoxide, bacon. 왜 이런 르네상스가 일어났는지, 그리고 여러분이 직접 CLI를 만들 때 무엇이 필요한지 정리합니다. clap의 derive API로 인자와 서브커맨드를 선언하고, GC 없는 성능과 SIMD·mmap의 이점을 살피고, 단일 정적 바이너리로 배포하는 방법과 any
2026-06-27 · 16 분 읽기 #rust#cli#toolsVision LLM 아키텍처 — 이미지가 언어가 되기까지
비전-언어 모델은 이미지를 비전 인코더로 처리한 뒤 프로젝터를 거쳐 LLM이 이해할 수 있는 토큰으로 바꿉니다. 패치 임베딩부터 임의 해상도 처리까지, 이미지가 언어 토큰이 되는 전 과정을 구조적으로 살펴봅니다.
2026-06-26 · 41 분 읽기 #llm#vision-language-model#multimodal#vit#qwen2-vl멀티모달 토크나이제이션과 융합 — 이미지·오디오를 토큰으로
이미지와 오디오, 비디오를 어떻게 토큰으로 바꾸고 텍스트와 하나의 시퀀스로 엮는지 정리합니다. 패치·VQ 기반 이미지 토큰화, 이산 코덱 오디오 토큰화, 프레임 샘플링, 인터리빙과 구분 토큰, 토큰 폭증과 압축, 컨텍스트 비용까지 멀티모달 LLM의 입력 구성을 깊이 다룹니다.
2026-06-26 · 30 분 읽기 #llm#multimodal#tokenization#vision-language#q-formerVision LLM 학습법 — input과 output을 어떻게 가르치나
비전-언어 모델은 정렬 사전학습부터 인스트럭션 파인튜닝까지 단계적으로 학습됩니다. 비전 인코더 동결 전략, 데이터 구성, 입력 포맷과 출력 형태, 손실 계산까지 무엇을 어떻게 가르치는지 학습 파이프라인 관점에서 정리합니다.
2026-06-26 · 35 분 읽기 #mlops#vision-language-model#multimodal#training#instruction-tuningLLM 추론 서빙 2026 — vLLM, SGLang, TensorRT-LLM 비교
2026년의 LLM 추론 서빙을 한눈에 정리합니다. prefill과 decode의 성격 차이, continuous batching, paged KV 캐시 같은 핵심 원리부터 vLLM, SGLang, TensorRT-LLM의 강약점 비교와 선택 가이드, 실제 배포 설정까지 개발자 관점에서 다룹니다.
2026-06-26 · 27 분 읽기 #llm-serving#vllm#sglang#tensorrt-llm#inference위치 인코딩 완전 이해 — 사인파에서 RoPE까지
왜 Transformer에 위치 정보가 필요한지부터 시작해 sinusoidal, learned, 상대 위치 인코딩, 그리고 RoPE와 ALiBi를 단계적으로 설명합니다. 길이 외삽과 컨텍스트 확장(NTK, YaRN), 멀티모달의 M-RoPE까지 연결하고 흔한 함정을 정리합니다.
2026-06-26 · 29 분 읽기 #llm#positional-encoding#rope#alibi#long-contextTransformer 구조 완전 해부 — Attention부터 KV Cache까지
Transformer의 self-attention, 멀티헤드, 위치 인코딩, FFN, 잔차 연결과 정규화를 처음부터 분해해 설명합니다. 텐서 shape와 파라미터 수 계산, causal mask, 인코더/디코더 구조, 그리고 추론 단계의 KV cache까지 연결해 전체 그림을 그립니다.
2026-06-26 · 26 분 읽기 #llm#transformer#attention#positional-encoding#kv-cache어텐션의 진화 — MQA, GQA, FlashAttention, 그리고 긴 컨텍스트
표준 어텐션의 메모리와 연산 비용을 분석하고, MQA와 GQA가 KV cache를 어떻게 줄이는지, FlashAttention이 IO를 어떻게 최적화하는지 설명합니다. 슬라이딩 윈도우와 롱컨텍스트 기법, 그리고 이 모든 선택이 서빙 메모리에 미치는 영향까지 비교합니다.
2026-06-26 · 31 분 읽기 #llm#attention#flashattention#gqa#mqa추론을 빠르게 — Speculative Decoding과 처리량 최적화
LLM의 decode가 느린 근본 이유부터 speculative decoding으로 속도를 끌어올리는 원리, 메두사와 EAGLE 같은 변형, chunked prefill과 prefill/decode 분리, 지연과 처리량의 트레이드오프, 그리고 TTFT/TPOT 같은 측정 지표까지 추론 가속의 핵심을 정리합니다.
2026-06-26 · 23 분 읽기 #speculative-decoding#throughput#inference#mlops#latency멀티모달 LLM 서빙 — 이미지 입력이 만드는 새로운 과제
텍스트 전용 LLM 서빙과 무엇이 다른지부터, 비전 인코더 추가 단계, 가변 비주얼 토큰 수, 프리필 비용 급증, 멀티모달 KV 캐시와 배칭의 난점, 지연 분해와 처리량 최적화, 비용과 운영 함정까지 멀티모달 LLM 서빙의 실무를 정리합니다.
2026-06-26 · 30 분 읽기 #mlops#multimodal#llm-serving#vllm#kv-cacheKV 캐시와 PagedAttention — 추론 메모리의 모든 것
LLM 추론에서 메모리를 가장 많이 먹는 주범인 KV 캐시를 깊이 파헤칩니다. KV 캐시가 무엇이고 왜 메모리를 잡아먹는지, 메모리 산수와 단편화 문제, PagedAttention의 블록 관리, prefix 공유와 KV 양자화까지 개발자 관점에서 정리합니다.
2026-06-26 · 22 분 읽기 #kv-cache#paged-attention#inference#gpu-memory#quantization멀티모달 AI 학습법 — 여러 감각을 하나의 모델로
이미지·텍스트·오디오·비디오를 하나의 모델로 다루는 멀티모달 AI의 학습 원리를 정리합니다. 모달리티 정렬과 대조학습, 융합 방식, 공유 임베딩 공간, 사전학습과 파인튜닝, 데이터와 평가, 그리고 환각 같은 한계까지 학습 파이프라인을 코드와 함께 살펴봅니다.
2026-06-26 · 34 분 읽기 #ai-papers#multimodal#clip#vision-language#contrastive-learningRust 매크로: 선언적 매크로 vs 절차적 매크로(derive)
Rust의 매크로는 컴파일 시점에 코드를 생성하는 메타프로그래밍 도구입니다. 패턴 기반의 선언적 매크로(macrorules!)와, 코드를 토큰 스트림으로 받아 조작하는 절차적 매크로(derive·attribute·function-like)를 구분해 설명합니다. serde의 [derive(Serialize)]가 실제로 무엇을 하는지, syn과 quote로 TokenStream을 다루는 흐름,
2026-06-26 · 18 분 읽기 #rust#macros#metaprogramming머지되는 PR과 커밋 메시지 쓰기
리뷰가 빨리 끝나고 빨리 머지되는 PR에는 공통점이 있습니다. 작고 목적이 하나인 PR, Conventional Commits, "무엇"이 아니라 "왜"를 담은 커밋 본문, 스스로 하는 셀프 리뷰, 맥락·변경·테스트를 담은 PR 설명, 리뷰어에 대한 공감, 그리고 스택 PR까지. 리뷰어의 시간을 아끼는 것이 곧 내 PR을 빨리 통과시키는 길입니다.
2026-06-26 · 16 분 읽기 #git#code-review#collaboration