태그: #on-device-ai
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 3 편
llama.cpp가 브라우저로 들어왔다 — WebGPU 백엔드가 16개 기기에서 측정한 천장
UC Santa Cruz 팀이 2026년 5월에 공개한 LlamaWeb은 llama.cpp의 WebGPU 백엔드로, 8개 벤더의 기기 16대에서 브라우저 LLM 추론을 실측한 지금까지 가장 넓은 데이터셋을 남겼습니다. 결과는 양면적입니다. 기존 브라우저 프레임워크(WebLLM, Transformers.js)보다 메모리를 29~33% 덜 쓰고 디코드 처리량은 45~69% 높지만, prefill
2026-07-16 · 31 분 읽기 #webgpu#llm-inference#llama-cpp#on-device-ai#browserMac mini가 온디바이스 AI 머신이 된 이유 — 애플 실리콘 임원 인터뷰가 말하는 것, 말하지 않는 것
애플 실리콘 수석 프로덕트 매니저 더그 브룩스가 The Deep View 인터뷰에서 Mac mini와 Mac Studio에 대한 수요와 온디바이스 AI의 방향을 이야기했습니다. 개발자들이 왜 이 작은 데스크톱을 로컬 LLM·에이전트 머신으로 고르는지, 통합 메모리 구조의 진짜 이점은 무엇인지, 그리고 CUDA 생태계 격차와 최근 가격 인상이라는 정직한 트레이드오프까지 — 임원의 발언을 그대로
2026-07-11 · 11 분 읽기 #apple-silicon#on-device-ai#local-llm#mac-mini#inference온디바이스 AI 2026: 당신의 스마트폰이 개인 AI 서버가 되는 시대
온디바이스 AI는 2026년 모바일 혁신의 중심입니다. Apple Silicon의 신경처리장치(NPU), Snapdragon AI 칩, Google Tensor의 AI 최적화로, 개인정보 보호와 극저지연을 동시에 달성하면서 클라우드 의존도를 획기적으로 줄이고 있습니다.
2026-03-16 · 16 분 읽기 #on-device-ai#edge-inference#apple-intelligence#privacy#mobile-ai