태그: #mlx
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 6 편
로컬 AI & 온디바이스 LLM 2026 완벽 가이드 — Ollama · LM Studio · Jan · Msty · Open WebUI · GPT4All · AnythingLLM · Faraday 심층 분석
2026년, 로컬 AI는 더 이상 "취미"가 아니다. M4 Max MacBook Pro에서 Llama 4 Scout 109B MoE가 24토큰/초로 도는 시대다. Ollama, LM Studio, Jan, Msty 같은 데스크탑 런타임이 GUI/CLI를 통일하고, Open WebUI, AnythingLLM, LibreChat이 ChatGPT급 인터페이스를 제공한다. 백엔드는 llama.cpp
2026-05-16 · 36 분 읽기 #local-ai#on-device-llm#ollama#lm-studio#janLLM 파인튜닝 2026 완벽 가이드 - LoRA · QLoRA · DoRA · GaLore · Unsloth · Axolotl · TRL · PEFT · MLX-LM 심층 분석
2026년 LLM 파인튜닝 생태계는 LoRA의 단순한 어댑터에서 출발해 QLoRA의 4비트, DoRA의 분해, GaLore의 그라디언트 프로젝션까지 5년 만에 거대한 가지를 펼쳤다. Hugging Face의 PEFT 0.14와 TRL 0.13이 표준 인터페이스를 잡았고, Unsloth가 2배 빠른 학습으로 단일 GPU 시장을 흔들었으며, Axolotl과 LLaMA-Factory가 YAML로
2026-05-16 · 41 분 읽기 #llm-fine-tuning#lora#qlora#dora#galoreLLM 서빙 & 로컬 추론 2026 — vLLM / llama.cpp / MLX / Ollama / LM Studio / SGLang / TGI 심층 비교
2026년 LLM 서빙·추론 프레임워크의 지도를 그린다. 데이터센터 진영(vLLM·SGLang·TGI·Triton·TensorRT-LLM), 로컬 진영(llama.cpp·MLX·llamafile·Ollama·LM Studio·GPT4All), 신생 진영(KTransformers·MLC LLM·Modular MAX), 그리고 클라우드 서빙 SaaS(Together·Fireworks·Groq·C
2026-05-16 · 37 분 읽기 #llm#model-serving#inference#vllm#llama-cppAI 추론 엔진 2026 완벽 가이드 - vLLM · SGLang · llama.cpp · TGI · TensorRT-LLM · MLX · mistral.rs · DeepSpeed-MII · Aphrodite 심층 분석
2026년 LLM 추론은 더 이상 모델 선택의 문제가 아니라 엔진 선택의 문제가 됐다. vLLM V1, SGLang 0.4, TensorRT-LLM, TGI 3.x, llama.cpp, MLX-LM, mistral.rs, DeepSpeed-MII, Aphrodite, CTranslate2, ExLlamaV3, OpenVINO, AWS Neuron, Triton — 10개+ 엔진을 PagedA
2026-05-16 · 31 분 읽기 #llm-inference#vllm#sglang#llama-cpp#tgiMLX 심층 분석 — Apple Silicon용 ML 프레임워크, 통합 메모리·지연 그래프·Mac 네이티브 워크플로 (2026 핸즈온)
MLX는 PyTorch와 JAX를 만들었던 Apple 머신러닝 팀이, 이번에는 Apple Silicon만을 위해 다시 쓴 배열 프레임워크다. 핵심 명제는 단순하다 — M 시리즈 GPU는 CPU와 같은 RAM을 쓴다, 즉 호스트/디바이스 복사가 없다(통합 메모리). 이 글은 통합 메모리 명제, 지연(lazy) 계산 그래프, mlx-lm·mlx-vlm·mlx-data 서브패키지, Python과
2026-05-14 · 31 분 읽기 #mlx#apple-silicon#ml-framework#unified-memory#metalApple Silicon에서 LLM 서빙하기: M4/M5 칩의 비밀과 한계
Apple M4/M5 칩의 유니파이드 메모리 아키텍처가 LLM 추론에 미치는 영향을 깊이 파헤칩니다. Neural Engine, MLX 프레임워크, llama.cpp Metal 백엔드를 활용한 실전 벤치마크와 함께 NVIDIA GPU 대비 실질적인 선택 기준을 제시합니다.
2026-03-18 · 21 분 읽기 #apple-silicon#m5#LLM서빙#유니파이드메모리#mlx