태그: #local-llm
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 6 편
Qwen3.8-27B의 하이브리드 어텐션 — 64개 층 중 16개만 KV 캐시를 쌓는 구조
27B 모델이 26만 토큰 컨텍스트를 노트북에서 감당하는 이유는 파라미터 수가 아니라 층 구성에 있습니다. Qwen3.8-27B는 64개 층 중 48개를 선형 어텐션(Gated DeltaNet)으로, 16개만 일반 어텐션으로 배치해 KV 캐시가 자라는 층 자체를 4분의 1로 줄였습니다. 이 구조가 무엇을 아끼고 무엇을 잃는지, FP8 블록 양자화가 어디에 적용되는지, 그리고 로컬 추론을 검토
2026-08-14 · 15 분 읽기 #llm#inference#quantization#local-llm#attention로컬에서 LLM 돌리려면 VRAM이 얼마나 필요한가 — 표 말고 공식으로 계산하기
"8B 모델에 몇 GB 필요한가요"의 정답은 표가 아니라 두 개의 공식입니다. 가중치는 파라미터 수 곱하기 bpw 나누기 8이고, KV 캐시는 2 곱하기 레이어 수 곱하기 KV 헤드 수 곱하기 headdim 곱하기 바이트 수 곱하기 토큰 수입니다. 이 글은 두 공식을 llama.cpp 소스와 공식 표에 직접 대조해 검증합니다 — ggml 블록 구조체에서 유도한 Q80의 8.5 bpw는 lla
2026-07-17 · 43 분 읽기 #llm#quantization#kv-cache#local-llm#gpuMac mini가 온디바이스 AI 머신이 된 이유 — 애플 실리콘 임원 인터뷰가 말하는 것, 말하지 않는 것
애플 실리콘 수석 프로덕트 매니저 더그 브룩스가 The Deep View 인터뷰에서 Mac mini와 Mac Studio에 대한 수요와 온디바이스 AI의 방향을 이야기했습니다. 개발자들이 왜 이 작은 데스크톱을 로컬 LLM·에이전트 머신으로 고르는지, 통합 메모리 구조의 진짜 이점은 무엇인지, 그리고 CUDA 생태계 격차와 최근 가격 인상이라는 정직한 트레이드오프까지 — 임원의 발언을 그대로
2026-07-11 · 11 분 읽기 #apple-silicon#on-device-ai#local-llm#mac-mini#inferenceMLX 심층 분석 — Apple Silicon용 ML 프레임워크, 통합 메모리·지연 그래프·Mac 네이티브 워크플로 (2026 핸즈온)
MLX는 PyTorch와 JAX를 만들었던 Apple 머신러닝 팀이, 이번에는 Apple Silicon만을 위해 다시 쓴 배열 프레임워크다. 핵심 명제는 단순하다 — M 시리즈 GPU는 CPU와 같은 RAM을 쓴다, 즉 호스트/디바이스 복사가 없다(통합 메모리). 이 글은 통합 메모리 명제, 지연(lazy) 계산 그래프, mlx-lm·mlx-vlm·mlx-data 서브패키지, Python과
2026-05-14 · 31 분 읽기 #mlx#apple-silicon#ml-framework#unified-memory#metal2026 AI 데스크톱 앱 스냅숏 — Granola · Cleft · Lex · Highlight · Raycast AI · Ollama, 그리고 'Ambient AI' 카테고리의 조용한 부상
2026년 봄, 챗봇 탭이 아니라 '내 데스크톱에 살고 있는 AI'들이 조용히 자기 카테고리를 만들었다. Granola(회의 노트), Cleft·Superwhisper·MacWhisper(로컬 받아쓰기), Lex(글쓰기), Highlight(시스템 어시스턴트), Raycast AI(런처), AnythingLLM·Jan·GPT4All·LM Studio(로컬 모델 채팅), 그리고 이들 다수가 올
2026-05-14 · 67 분 읽기 #ai-desktop#granola#cleft#lex-app#highlight-ai로컬 LLM 시대 완전 가이드: Llama, Qwen, Mistral, vLLM, 양자화, Apple Silicon (2025)
외부 API에 모든 걸 의존하던 시절이 끝나간다. 2025년은 소비자 GPU와 Apple Silicon에서 30B–70B 모델이 "쓸 만하게" 돌아가는 시대. 모델 선택(Llama/Qwen/Mistral/Gemma/Solar), 엔진(vLLM/TGI/SGLang/llama.cpp/Ollama), 양자화(AWQ/GPTQ/EXL2/GGUF), 하드웨어, 비용·전력, 그리고 Privacy-firs
2026-04-15 · 19 분 읽기 #local-llm#llama#qwen#mistral#vllm