태그: #optimization
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 24 편
Hybrid SWA로 긴 컨텍스트 추론 최적화하기 — Xiaomi MiMo v2.5가 실제로 한 것
슬라이딩 윈도우 어텐션(SWA)과 풀 어텐션을 층별로 섞는 하이브리드 SWA는 긴 컨텍스트 추론의 KV 캐시 메모리와 연산량을 함께 줄이는 최근의 주류 설계입니다. Xiaomi가 공개한 MiMo v2.5 추론 최적화 글을 근거로, 하이브리드 SWA가 무엇이고 왜 중요한지, MiMo v2.5가 실제로 어떤 아키텍처와 시스템 엔지니어링을 했는지(70층 중 10층만 풀 어텐션, 윈도우 128, 이
2026-07-11 · 15 분 읽기 #ai#llm#inference#attention#optimization최신 LLM 양자화 기술 총정리 — GPTQ·AWQ부터 FP8·MXFP4·KV 캐시 양자화까지
양자화는 모델의 숫자를 더 적은 비트로 표현해 메모리와 비용을 줄이는 기술입니다. 비트가 줄어도 품질이 버티는 이유(이상치와 스케일링), GPTQ와 AWQ의 접근 차이, llama.cpp GGUF의 k-quant, QLoRA의 NF4, 그리고 2026년의 중심축인 FP8과 마이크로스케일링 FP4(MXFP4·NVFP4), 다음 병목인 KV 캐시 양자화까지 — W4A16 같은 표기법 읽는 법과
2026-07-08 · 15 분 읽기 #ai#llm#quantization#inference#optimization3D 파이프라인 — 게임 실시간과 영상 오프라인의 차이
모델링부터 렌더까지 이어지는 3D 자산 파이프라인 전체를 조망합니다. 게임 엔진의 실시간 렌더와 영화의 오프라인 렌더팜이 어떻게 다른지, LOD와 폴리 예산, 드로콜 같은 최적화 개념, glTF와 USD 같은 교환 포맷, 그리고 협업 방식을 다이어그램과 비교표로 정리합니다.
2026-06-27 · 33 분 읽기 #3d-pipeline#real-time#offline-rendering#game-engine#gltf추론을 빠르게 — 양자화, 희소성, Dataflow의 하드웨어 관점
추론 비용의 구조를 메모리 월 관점에서 풀어내고, 양자화(INT8/FP8/FP4)와 구조적 희소성(2:4), dataflow 아키텍처, 연산자 융합, 배칭과 KV 캐시까지 하드웨어-소프트웨어 공동설계의 큰 그림을 정리합니다. 2026년 Blackwell FP4와 Vera Rubin 흐름을 반영해 실무 적용 포인트를 짚습니다.
2026-06-16 · 35 분 읽기 #inference#quantization#sparsity#dataflow#gpuLLVM Deep Dive — 현대 컴파일러 인프라의 IR, Optimizer, Backend, MLIR 완전 정복 (2025)
Rust, Swift, Clang, Julia, Kotlin Native, WebAssembly. 이 모두의 공통점은 LLVM을 백엔드로 사용한다는 것입니다. 이 글은 LLVM의 내부를 처음부터 해부합니다. 3단 아키텍처(프론트엔드 → IR → 백엔드), SSA 기반 LLVM IR의 구조, 수백 개의 옵티마이저 패스들(InstCombine, GVN, LICM, 인라이너), SelectionD
2026-04-15 · 41 분 읽기 #llvm#compiler#mlir#clang#optimizationJIT 컴파일 완전 가이드 2025: V8, JVM HotSpot, .NET, Tiered Compilation, 성능 분석
JIT 컴파일의 모든 것! 인터프리터 vs JIT vs AOT, V8(TurboFan/Maglev), JVM HotSpot(C1/C2/Graal), .NET Tiered, Tracing JIT vs Method JIT, 인라이닝/분기 예측/탈최적화, 성능 분석.
2026-04-15 · 18 분 읽기 #jit#compiler#v8#jvm#hotspot게임 개발 완전 가이드 2025: Unity vs Unreal vs Godot, ECS, 멀티플레이어, 최적화
게임 개발의 모든 것! Unity DOTS/ECS, Unreal Engine 5(Lumen/Nanite), Godot 4, 게임 루프, 물리 엔진, 멀티플레이어(Netcode/Mirror), 성능 최적화(드로우콜/배칭), 모바일 vs 콘솔 vs PC 출시.
2026-04-15 · 17 분 읽기 #game-development#unity#unreal-engine#godot#ecs컴파일러 & 인터프리터 설계 완전 가이드 2025: Lexer, Parser, AST, 코드 생성
컴파일러/인터프리터 설계의 모든 것! Lexer(토큰화), Parser(구문 분석/재귀 하강/Pratt), AST(추상 구문 트리), 의미 분석(타입 체크), IR(중간 표현), 코드 생성(LLVM/WebAssembly), 최적화(상수 폴딩/인라이닝/루프), 실전 미니 언어 구현.
2026-04-14 · 40 분 읽기 #compiler#interpreter#lexer#parser#ast백엔드 성능 엔지니어링 완전 가이드 2025: 프로파일링, 부하 테스트, 병목 분석, 최적화
백엔드 성능의 모든 것! 프로파일링(CPU/메모리/I-O), 부하 테스트(k6/Artillery/Locust), 병목 분석(DB/네트워크/CPU/메모리), N+1 해결, 커넥션 풀 튜닝, 캐싱 전략(Redis/CDN/Application), 비동기 처리, 배치 최적화.
2026-04-14 · 36 분 읽기 #backend-performance#profiling#load-testing#optimization#k6Advanced Prompt Engineering 완전 가이드 2025: CoT, ToT, Self-Consistency, 메타프롬프팅
Prompt Engineering 심화! Chain-of-Thought(CoT), Tree-of-Thought(ToT), Self-Consistency, ReAct, 메타프롬프팅, Structured Output(JSON Mode), System Prompt 설계, Few-shot 최적화, Prompt Chaining, 평가(auto-eval), 프로덕션 프롬프트 관리.
2026-04-14 · 40 분 읽기 #prompt-engineering#chain-of-thought#tree-of-thought#few-shot#system-promptFinOps & 클라우드 비용 최적화 완전 가이드 2025: AWS/GCP/Azure 비용 절감 전략
FinOps의 모든 것! 클라우드 비용 가시성(Cost Explorer/Billing), 최적화 전략(Reserved/Spot/Savings Plans), 리소스 라이트사이징, 자동 스케일링, 스토리지 계층화, K8s 비용(Kubecost), AI/ML 비용 관리, FinOps 문화 구축.
2026-04-13 · 37 분 읽기 #finops#cloud-cost#optimization#aws#gcpUnsloth로 LLM 파인튜닝 완전 가이드 2025: QLoRA, 4bit 양자화, 2배 빠른 학습
Unsloth로 LLM 파인튜닝의 모든 것! QLoRA/LoRA 원리, 4bit 양자화(bitsandbytes), Unsloth 2x 속도 비밀, Llama 3/Mistral/Qwen 파인튜닝, 데이터 준비, 학습 설정, VRAM 최적화, GGUF/GPTQ 변환, 배포까지.
2026-03-25 · 25 분 읽기 #unsloth#llm#fine-tuning#qlora#lora공업수학 시리즈 24편: 수치해석, 최적화, 그래프, 확률과 통계 로드맵
공업수학 시리즈의 첫 사이클을 마무리하며 수치해석, 최적화, 그래프, 확률과 통계가 왜 중요한지와 앞으로 어떤 순서로 공부하면 좋은지 정리합니다.
2026-03-19 · 8 분 읽기 #engineering-math#numerical-methods#optimization#probability#statisticsAI 모델 서빙과 추론 최적화 완전 가이드: vLLM, TensorRT, Triton, Ollama
AI 모델을 프로덕션에서 효율적으로 서빙하는 완전 가이드. vLLM, TensorRT, NVIDIA Triton Inference Server, Ollama, 양자화(INT8/INT4), 배치 처리, 지연 최적화까지 실전 예제로 마스터합니다.
2026-03-17 · 29 분 읽기 #mlops#model-serving#vllm#tensorrt#tritonLLM 추론 최적화 완전 가이드: KV Cache, Speculative Decoding, Continuous Batching
LLM 추론을 극한까지 최적화하는 완전 가이드. KV Cache, Speculative Decoding, Continuous Batching, PagedAttention, FlashInfer, 멀티GPU 추론, 그리고 DeepSeek MLA까지 심층 분석합니다.
2026-03-17 · 41 분 읽기 #llm#inference#optimization#kv-cache#speculative-decoding딥러닝 학습 방법론 완전 정복: 최적화부터 분산 학습까지
딥러닝 모델을 효과적으로 학습시키는 모든 기법을 다루는 완전 가이드. 경사 하강법, 옵티마이저, 학습률 스케줄링, 정규화, 배치 정규화, 전이학습, 파인튜닝, 분산 학습까지 실전 코드와 함께 배웁니다.
2026-03-17 · 42 분 읽기 #deep-learning#training#optimization#regularization#distributed-training딥러닝 디버깅 완전 가이드: 학습 실패 진단부터 성능 최적화까지
딥러닝 모델 학습 실패를 체계적으로 진단하고 해결하는 완전 가이드. Loss NaN, 기울기 소실/폭발, 과적합, 느린 수렴, 메모리 부족 등 모든 일반적인 문제의 원인과 해결책을 실전 코드와 함께 배웁니다.
2026-03-17 · 33 분 읽기 #deep-learning#debugging#pytorch#training#optimizationLLM 양자화 기법 비교 가이드 — GPTQ, AWQ, GGUF, bitsandbytes 실전 적용
LLM 양자화 기법인 GPTQ, AWQ, GGUF, bitsandbytes의 원리, 벤치마크 비교, 실전 적용 가이드를 정리합니다. 모델 선택부터 서빙까지의 전체 워크플로우를 다룹니다.
2026-03-09 · 25 분 읽기 #llm#quantization#gptq#awq#ggufAI/ML 논문 읽기에 필요한 수학 + LaTeX/KaTeX 총정리
AI/ML 논문을 읽을 때 반드시 만나는 수학 개념(선형대수·미적분·확률통계·최적화)과 LaTeX/KaTeX 수식 문법을 실전 예시 중심으로 총정리합니다. 기호 치트시트, 수식 패턴 해설, MDX 블로그 렌더링 팁까지 한 번에 다룹니다.
2026-03-08 · 26 분 읽기 #ai-papers#math#latex#katex#linear-algebraN+1 문제 완전 해부 — ORM의 조용한 성능 킬러
N+1 문제가 뭔지, 왜 위험한지, 어떻게 찾고, 어떻게 고치는지. Django, SQLAlchemy, JPA/Hibernate, Prisma, ActiveRecord까지 모든 ORM에서의 해결법을 실전 코드로 완전 정복합니다.
2026-03-02 · 11 분 읽기 #database#n-plus-1#orm#django#sqlalchemy