태그: #npu
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 3 편
온디바이스·엣지 AI — AI가 기기 안으로 들어온다
클라우드에 머물던 AI 추론이 스마트폰·PC·임베디드 기기 안으로 이동하고 있습니다. 지연·프라이버시·비용이라는 세 가지 동인과 NPU·온디바이스 LLM의 부상, 그리고 투자·산업 관점의 시사점과 리스크를 균형 있게 정리합니다.
2026-06-18 · 35 분 읽기 #ai#edge-ai#on-device#npu#llm엣지 AI와 NPU — 온디바이스 추론 가속기
추론을 클라우드가 아니라 기기에서 직접 돌리는 엣지 AI의 이유(지연·프라이버시·비용)와, 이를 가능케 하는 NPU의 개념을 정리합니다. Apple Neural Engine, Qualcomm, Edge TPU, ARM Ethos부터 모델 경량화, 온디바이스 LLM, 런타임(TFLite/ONNX/CoreML), 클라우드-엣지 하이브리드까지 개발자 시작 가이드를 담았습니다.
2026-06-16 · 42 분 읽기 #edge-ai#npu#on-device#inference#quantizationNPU 완전 해부: 트랜스포머 아키텍처가 실리콘 위에서 어떻게 달리는가
NPU가 CPU/GPU와 무엇이 다른지, 트랜스포머의 모든 연산이 하드웨어에 어떻게 매핑되는지, 왜 LLM 추론은 메모리 바운드인지를 루프라인 모델과 실제 코드로 완전 해부합니다. Apple ANE부터 Qualcomm Hexagon, Groq LPU까지.
2026-03-18 · 28 분 읽기 #npu#트랜스포머#ai-hardware#양자화#KV캐시