태그: #llama-cpp
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 6 편
llama.cpp가 브라우저로 들어왔다 — WebGPU 백엔드가 16개 기기에서 측정한 천장
UC Santa Cruz 팀이 2026년 5월에 공개한 LlamaWeb은 llama.cpp의 WebGPU 백엔드로, 8개 벤더의 기기 16대에서 브라우저 LLM 추론을 실측한 지금까지 가장 넓은 데이터셋을 남겼습니다. 결과는 양면적입니다. 기존 브라우저 프레임워크(WebLLM, Transformers.js)보다 메모리를 29~33% 덜 쓰고 디코드 처리량은 45~69% 높지만, prefill
2026-07-16 · 31 분 읽기 #webgpu#llm-inference#llama-cpp#on-device-ai#browser로컬 LLM 인퍼런스 최적화 — 양자화부터 VRAM 한계 돌파까지
프라이버시와 비용, 그리고 빅테크 피로감 속에 로컬 LLM이 다시 뜨고 있습니다. VRAM 중심의 하드웨어 선택, GGUF와 AWQ 양자화, llama.cpp와 vLLM과 Ollama 비교, KV cache 메모리 산수, VRAM을 스왑으로 쓰는 역발상 해킹까지 로컬 인퍼런스 최적화의 전체 지도를 그립니다.
2026-06-12 · 29 분 읽기 #llm#inference#quantization#llama-cpp#vllm로컬 AI & 온디바이스 LLM 2026 완벽 가이드 — Ollama · LM Studio · Jan · Msty · Open WebUI · GPT4All · AnythingLLM · Faraday 심층 분석
2026년, 로컬 AI는 더 이상 "취미"가 아니다. M4 Max MacBook Pro에서 Llama 4 Scout 109B MoE가 24토큰/초로 도는 시대다. Ollama, LM Studio, Jan, Msty 같은 데스크탑 런타임이 GUI/CLI를 통일하고, Open WebUI, AnythingLLM, LibreChat이 ChatGPT급 인터페이스를 제공한다. 백엔드는 llama.cpp
2026-05-16 · 36 분 읽기 #local-ai#on-device-llm#ollama#lm-studio#janLLM 서빙 & 로컬 추론 2026 — vLLM / llama.cpp / MLX / Ollama / LM Studio / SGLang / TGI 심층 비교
2026년 LLM 서빙·추론 프레임워크의 지도를 그린다. 데이터센터 진영(vLLM·SGLang·TGI·Triton·TensorRT-LLM), 로컬 진영(llama.cpp·MLX·llamafile·Ollama·LM Studio·GPT4All), 신생 진영(KTransformers·MLC LLM·Modular MAX), 그리고 클라우드 서빙 SaaS(Together·Fireworks·Groq·C
2026-05-16 · 37 분 읽기 #llm#model-serving#inference#vllm#llama-cpp엣지 AI & TinyML 2026 — LiteRT / ExecuTorch / Edge Impulse / Jetson / Coral / Hailo / Sipeed K230 / llama.cpp / Phi-4 심층 가이드
2026년 엣지 AI / TinyML 생태계의 풀스택 지도 — TFLite Micro 가 LiteRT 로 리브랜드된 후 ExecuTorch 가 GA 가 되며 형성된 듀얼 표준, Edge Impulse 가 만든 TinyML 클라우드 워크플로, NVIDIA Jetson Orin Nano/NX/Thor/AGX 와 Coral Dev Board 의 가속기 격돌, 이스라엘 Hailo-15/8 과 중국
2026-05-16 · 53 분 읽기 #edge-ai#tinyml#tflite-micro#litert#executorchAI 추론 엔진 2026 완벽 가이드 - vLLM · SGLang · llama.cpp · TGI · TensorRT-LLM · MLX · mistral.rs · DeepSpeed-MII · Aphrodite 심층 분석
2026년 LLM 추론은 더 이상 모델 선택의 문제가 아니라 엔진 선택의 문제가 됐다. vLLM V1, SGLang 0.4, TensorRT-LLM, TGI 3.x, llama.cpp, MLX-LM, mistral.rs, DeepSpeed-MII, Aphrodite, CTranslate2, ExLlamaV3, OpenVINO, AWS Neuron, Triton — 10개+ 엔진을 PagedA
2026-05-16 · 31 분 읽기 #llm-inference#vllm#sglang#llama-cpp#tgi