タグ: #mlx
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 6 件
ローカルAI & オンデバイスLLM 2026 完全ガイド — Ollama · LM Studio · Jan · Msty · Open WebUI · GPT4All · AnythingLLM · Faraday 徹底解説
2026年5月、ローカルAIはもはや「趣味」ではない。M4 Max MacBook ProがLlama 4 Scout 109B MoEを毎秒24トークンで動かす時代だ。Ollama、LM Studio、Jan、MstyのようなデスクトップランタイムがGUI/CLIを統一し、Open WebUI、AnythingLLM、LibreChatがChatGPT級のインターフェースを提供する。バックエンドはllama.cpp、MLX-LM、vL
2026-05-16 · 28 分で読めます #local-ai#on-device-llm#ollama#lm-studio#janLLM サービング & ローカル推論 2026 — vLLM / llama.cpp / MLX / Ollama / LM Studio / SGLang / TGI 徹底比較
2026 年の LLM サービング・推論フレームワークの地図を描く。データセンター陣営(vLLM・SGLang・TGI・Triton・TensorRT-LLM)、ローカル陣営(llama.cpp・MLX・llamafile・Ollama・LM Studio・GPT4All)、新興陣営(KTransformers・MLC LLM・Modular MAX)、そしてクラウドサービング SaaS(Together・Fireworks・Groq・
2026-05-16 · 34 分で読めます #llm#model-serving#inference#vllm#llama-cppLLMファインチューニング2026 完全ガイド - LoRA · QLoRA · DoRA · GaLore · Unsloth · Axolotl · TRL · PEFT · MLX-LM 深層解析
2026年のLLMファインチューニング生態系は、LoRAというシンプルなアダプターから出発して、QLoRAの4ビット、DoRAの分解、GaLoreの勾配射影まで、五年の間に巨大な枝を広げた。Hugging FaceのPEFT 0.14とTRL 0.13が標準インターフェースを固め、Unslothが2倍の高速学習でシングルGPU市場を揺るがし、AxolotlとLLaMA-FactoryがYAMLでファインチューニングを民主化した。Appl
2026-05-16 · 36 分で読めます #llm-fine-tuning#lora#qlora#dora#galoreAI 推論エンジン 2026 完全ガイド - vLLM · SGLang · llama.cpp · TGI · TensorRT-LLM · MLX · mistral.rs · DeepSpeed-MII · Aphrodite 徹底解剖
2026 年の LLM エンジニアリングはもうモデル選定の問題ではなく、エンジン選定の問題になった。vLLM V1、SGLang 0.4、TensorRT-LLM、TGI 3.x、llama.cpp、MLX-LM、mistral.rs、DeepSpeed-MII、Aphrodite、CTranslate2、ExLlamaV3、OpenVINO、AWS Neuron、Triton — 10 以上のエンジンを PagedAttention・
2026-05-16 · 26 分で読めます #llm-inference#vllm#sglang#llama-cpp#tgiMLX 徹底解剖 — Apple Silicon 専用 ML フレームワーク、統合メモリ・遅延グラフ・Mac ネイティブのワークフロー (2026 ハンズオン)
MLX は、PyTorch と JAX を作った Apple の ML チームが、今度は Apple Silicon だけのために書き直した配列フレームワークだ。中核となる命題はひとつ — M シリーズの GPU は CPU と同じ RAM を使う、つまりホストとデバイスの間に複製がない (統合メモリ)。本記事は、その統合メモリ命題、遅延 (lazy) 計算グラフ、mlx-lm・mlx-vlm・mlx-data サブパッケージ、Pyth
2026-05-14 · 28 分で読めます #mlx#apple-silicon#ml-framework#unified-memory#metalApple SiliconでLLMを動かす:M4/M5チップのAI推論の秘密と限界
Apple M4/M5チップのユニファイドメモリアーキテクチャがLLM推論に与える影響を深く掘り下げます。Neural Engine、MLXフレームワーク、llama.cpp Metalバックエンドを使った実測ベンチマークと、NVIDIAとの正直な比較を提供します。
2026-03-18 · 18 分で読めます #apple-silicon#m5#LLMサービング#ユニファイドメモリ#mlx