标签: #on-device-ai
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 2 篇
llama.cpp 走进浏览器 — WebGPU 后端在 16 台设备上测出的天花板
UC Santa Cruz 团队于 2026 年 5 月发布的 LlamaWeb 是 llama.cpp 的 WebGPU 后端,在 8 家厂商的 16 台设备上实测了浏览器端 LLM 推理,留下了迄今为止最广的数据集。结果是双面的。它比现有浏览器框架(WebLLM、Transformers.js)少用 29%~33% 的内存,解码吞吐量高出 45%~69%,但 prefill 仍只有 WebLLM 的 49% 水平,相比原生 CUDA
2026-07-16 · 25 分钟阅读 #webgpu#llm-inference#llama-cpp#on-device-ai#browserMac mini 为何成为端侧 AI 机器 — Apple Silicon 高管访谈说了什么、没说什么
Apple Silicon 高级产品经理道格·布鲁克斯(Doug Brooks)在 The Deep View 的访谈中谈到了 Mac mini 与 Mac Studio 的需求以及端侧 AI 的走向。开发者和小型团队为何选择这台小小的台式机作为本地 LLM 与智能体机器、统一内存架构的真正优势是什么,以及 CUDA 生态差距与近期涨价这一诚实的取舍 — 本文原样引用高管的发言,同时剥离营销话术加以梳理。
2026-07-11 · 9 分钟阅读 #apple-silicon#on-device-ai#local-llm#mac-mini#inference