태그: #quantization
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 31 편
Qwen3.8-27B의 하이브리드 어텐션 — 64개 층 중 16개만 KV 캐시를 쌓는 구조
27B 모델이 26만 토큰 컨텍스트를 노트북에서 감당하는 이유는 파라미터 수가 아니라 층 구성에 있습니다. Qwen3.8-27B는 64개 층 중 48개를 선형 어텐션(Gated DeltaNet)으로, 16개만 일반 어텐션으로 배치해 KV 캐시가 자라는 층 자체를 4분의 1로 줄였습니다. 이 구조가 무엇을 아끼고 무엇을 잃는지, FP8 블록 양자화가 어디에 적용되는지, 그리고 로컬 추론을 검토
2026-08-14 · 15 분 읽기 #llm#inference#quantization#local-llm#attention라이선스와 배포: 유형 읽는 법과 양자화 배포판 출처 확인
오픈 모델의 license 필드에 적힌 짧은 식별자는 목차일 뿐이고 실제 조건은 전문에 있습니다. 이 글은 2026-08-12에 실제로 마주친 라이선스 유형들을 정리하고, 커뮤니티 라이선스와 비상업 조건이 무엇을 요구하는지, 게이트 저장소가 배포 파이프라인에서 왜 문제가 되는지, 그리고 GGUF 같은 양자화 배포판의 출처를 어떻게 확인해야 하는지를 설명합니다. 오픈 모델 가이드 시리즈 마지막
2026-08-12 · 13 분 읽기 #ai#llm#huggingface#open-source-llm#licensevLLM 내부 구조 (7) — 배포 튜닝과 흔한 함정, OOM 진단 순서
vLLM 배포를 실제로 튜닝하는 순서를 정리했습니다. gpumemoryutilization이 무엇을 정하는지, 텐서 병렬과 파이프라인 병렬을 언제 쓰는지, 양자화와 KV 캐시 자료형을 어떻게 고르는지, 그리고 OOM이 났을 때 기동 단계와 운영 단계를 나눠 진단하는 순서까지 공식 문서 기준으로 확인해 정리했습니다. vLLM 내부 구조 시리즈 마지막 편.
2026-08-12 · 17 분 읽기 #vllm#gpu#quantization#tensor-parallel#llm지금 허깅페이스에서 무엇이 뜨는가 — 2026년 8월 트렌딩 지도
2026년 8월 2일 기준으로 허깅페이스 트렌딩 목록을 직접 훑고, 용도별로 실제 쓸 만한 모델을 정리했습니다. 범용 LLM, 코딩, 임베딩과 리랭커, 비전, 음성, 이미지·비디오 생성, 소형 온디바이스 순으로 만든 곳과 규모와 라이선스, 그리고 쓰기 전에 알아야 할 제약을 함께 적었습니다. 핵심은 트렌딩 목록의 상당수가 새 모델이 아니라 양자화 재업로드와 커뮤니티 파인튜닝이라는 점입니다.
2026-08-02 · 30 분 읽기 #llm#huggingface#open-weights#model-selection#quantization이 모델들은 어떻게 만들어졌나 — 2026년 오픈 웨이트 파이프라인 해부
2026년 8월 기준 허깅페이스 상위권에 올라 있는 오픈 웨이트 모델들의 카드와 기술 보고서를 읽고, 데이터 수집부터 양자화 배포까지 제작 파이프라인을 순서대로 정리했습니다. MoE 희소성이 20배를 넘어선 이유, 전역 어텐션을 줄이는 네 가지 접근, 사전학습 토큰 예산과 안정화 기법, SFT 이후의 선호 최적화와 강화학습, 그리고 증류와 저비트 배포까지 실제 모델을 예시로 다룹니다. 중요한
2026-08-02 · 32 분 읽기 #llm#pretraining#moe#post-training#quantization26B 모델을 2GB 램으로 돌리는 원리 — 상주 메모리와 워킹셋은 같은 숫자가 아니다
2026년 7월 29일 Show HN에 올라온 TurboFieldfare는 Gemma 4 26B-A4B를 M 시리즈 맥에서 약 2GB 램으로 돌린다고 주장합니다. 디스크에는 14.3GB가 깔리고, 램에 상주하는 것은 1.35GB짜리 공유 코어뿐이며, 토큰마다 필요한 전문가 가중치를 SSD에서 읽어 옵니다. 이 글은 그 숫자들을 직접 유도해 검증합니다 — 4비트 그룹 64 양자화가 왜 가중치당
2026-07-31 · 20 분 읽기 #ai#llm#quantization#apple-silicon#moeLLM 추론 VRAM 계산법 — 가중치보다 KV 캐시가 먼저 터집니다
"이 모델이 우리 GPU에 올라갑니까"라는 질문에 곱셈 몇 번으로 답하는 방법을 정리했습니다. 가중치 메모리는 파라미터 수 곱하기 바이트로 끝나지만, 실제로 배포를 막는 것은 시퀀스 길이와 배치에 비례해서 자라는 KV 캐시입니다. KV 캐시 공식과 GQA가 이를 몇 분의 일로 줄이는 원리, 프리필 활성화와 프레임워크 오버헤드의 크기, PagedAttention이 없앤 단편화 손실, 그리고 4
2026-07-26 · 21 분 읽기 #llm#inference#vram#kv-cache#quantization로컬에서 LLM 돌리려면 VRAM이 얼마나 필요한가 — 표 말고 공식으로 계산하기
"8B 모델에 몇 GB 필요한가요"의 정답은 표가 아니라 두 개의 공식입니다. 가중치는 파라미터 수 곱하기 bpw 나누기 8이고, KV 캐시는 2 곱하기 레이어 수 곱하기 KV 헤드 수 곱하기 headdim 곱하기 바이트 수 곱하기 토큰 수입니다. 이 글은 두 공식을 llama.cpp 소스와 공식 표에 직접 대조해 검증합니다 — ggml 블록 구조체에서 유도한 Q80의 8.5 bpw는 lla
2026-07-17 · 43 분 읽기 #llm#quantization#kv-cache#local-llm#gpu벡터 인덱스의 기본값이 HNSW에서 디스크로 바뀐 이유 — Elasticsearch bbq_disk의 트레이드오프
Elasticsearch 9.4(2026-05-05)부터 float 벡터의 기본 인덱스 타입이 bbqdisk, 즉 디스크 기반 IVF로 바뀌었습니다. 1년 사이에 기본값이 int8hnsw에서 bbqhnsw로, 다시 그래프가 아닌 디스크 인덱스로 옮겨간 것인데, 이 이동은 벡터 검색의 진짜 비용이 계산이 아니라 RAM에 있다는 판단을 담고 있습니다. 이 글은 HNSW의 메모리 절벽이 벤더 벤치
2026-07-16 · 41 분 읽기 #vector-database#elasticsearch#ann-index#quantization#hnswKV 캐시를 4비트로 — SAW-INT4와 시스템을 아는 INT4 양자화
긴 컨텍스트 LLM 서빙에서 진짜 메모리 병목은 가중치가 아니라 KV 캐시입니다. 이를 INT4로 그냥 줄이면 정확도가 무너지는데, 2026년 4월 프리프린트 SAW-INT4는 토큰 단위 INT4 양자화에 블록 대각 아다마르 회전을 더해 순진한 INT4가 잃은 정확도를 거의 되찾는다고 보고합니다. 이 논문의 진짜 각도는 정확도만이 아니라 처리량입니다 — 페이지드 KV 캐시 레이아웃에 바로 통
2026-07-11 · 13 분 읽기 #ai#llm#quantization#inference#kv-cache느린 컴퓨터에서 GLM-5.2 돌리기 — colibrì가 744B 모델을 디스크에서 스트리밍하는 법
colibrì는 순수 C 약 1,300줄로 작성된 추론 엔진으로, 744B(7,440억) 파라미터 MoE 모델인 GLM-5.2를 램 25GB짜리 소비자용 PC에서 돌립니다. 핵심은 MoE 희소성과 디스크 스트리밍입니다 — 밀집 레이어 약 9.9GB만 램에 상주시키고, 약 370GB의 라우팅 전문가는 NVMe SSD에 두고 토큰마다 필요한 것만 읽습니다. 대가는 정직하게 느립니다: 콜드 상태
2026-07-11 · 8 분 읽기 #ai#llm#local-inference#moe#quantization최신 LLM 양자화 기술 총정리 — GPTQ·AWQ부터 FP8·MXFP4·KV 캐시 양자화까지
양자화는 모델의 숫자를 더 적은 비트로 표현해 메모리와 비용을 줄이는 기술입니다. 비트가 줄어도 품질이 버티는 이유(이상치와 스케일링), GPTQ와 AWQ의 접근 차이, llama.cpp GGUF의 k-quant, QLoRA의 NF4, 그리고 2026년의 중심축인 FP8과 마이크로스케일링 FP4(MXFP4·NVFP4), 다음 병목인 KV 캐시 양자화까지 — W4A16 같은 표기법 읽는 법과
2026-07-08 · 15 분 읽기 #ai#llm#quantization#inference#optimizationKV 캐시와 PagedAttention — 추론 메모리의 모든 것
LLM 추론에서 메모리를 가장 많이 먹는 주범인 KV 캐시를 깊이 파헤칩니다. KV 캐시가 무엇이고 왜 메모리를 잡아먹는지, 메모리 산수와 단편화 문제, PagedAttention의 블록 관리, prefix 공유와 KV 양자화까지 개발자 관점에서 정리합니다.
2026-06-26 · 22 분 읽기 #kv-cache#paged-attention#inference#gpu-memory#quantization추론을 빠르게 — 양자화, 희소성, Dataflow의 하드웨어 관점
추론 비용의 구조를 메모리 월 관점에서 풀어내고, 양자화(INT8/FP8/FP4)와 구조적 희소성(2:4), dataflow 아키텍처, 연산자 융합, 배칭과 KV 캐시까지 하드웨어-소프트웨어 공동설계의 큰 그림을 정리합니다. 2026년 Blackwell FP4와 Vera Rubin 흐름을 반영해 실무 적용 포인트를 짚습니다.
2026-06-16 · 35 분 읽기 #inference#quantization#sparsity#dataflow#gpu엣지 AI와 NPU — 온디바이스 추론 가속기
추론을 클라우드가 아니라 기기에서 직접 돌리는 엣지 AI의 이유(지연·프라이버시·비용)와, 이를 가능케 하는 NPU의 개념을 정리합니다. Apple Neural Engine, Qualcomm, Edge TPU, ARM Ethos부터 모델 경량화, 온디바이스 LLM, 런타임(TFLite/ONNX/CoreML), 클라우드-엣지 하이브리드까지 개발자 시작 가이드를 담았습니다.
2026-06-16 · 42 분 읽기 #edge-ai#npu#on-device#inference#quantization메모리 월과 HBM — AI 성능을 가르는 진짜 병목
연산은 싸지고 데이터 이동은 비싸진 시대, AI 성능의 진짜 병목은 메모리입니다. 메모리 월 개념부터 HBM 세대, roofline 모델과 산술 강도, KV 캐시, 양자화로 대역폭을 절감하는 법까지 개발자 관점에서 정리합니다.
2026-06-16 · 43 분 읽기 #memory-wall#hbm#bandwidth#roofline#inference로컬 LLM 인퍼런스 최적화 — 양자화부터 VRAM 한계 돌파까지
프라이버시와 비용, 그리고 빅테크 피로감 속에 로컬 LLM이 다시 뜨고 있습니다. VRAM 중심의 하드웨어 선택, GGUF와 AWQ 양자화, llama.cpp와 vLLM과 Ollama 비교, KV cache 메모리 산수, VRAM을 스왑으로 쓰는 역발상 해킹까지 로컬 인퍼런스 최적화의 전체 지도를 그립니다.
2026-06-12 · 29 분 읽기 #llm#inference#quantization#llama-cpp#vllm로컬 AI & 온디바이스 LLM 2026 완벽 가이드 — Ollama · LM Studio · Jan · Msty · Open WebUI · GPT4All · AnythingLLM · Faraday 심층 분석
2026년, 로컬 AI는 더 이상 "취미"가 아니다. M4 Max MacBook Pro에서 Llama 4 Scout 109B MoE가 24토큰/초로 도는 시대다. Ollama, LM Studio, Jan, Msty 같은 데스크탑 런타임이 GUI/CLI를 통일하고, Open WebUI, AnythingLLM, LibreChat이 ChatGPT급 인터페이스를 제공한다. 백엔드는 llama.cpp
2026-05-16 · 36 분 읽기 #local-ai#on-device-llm#ollama#lm-studio#janLLM 서빙 & 로컬 추론 2026 — vLLM / llama.cpp / MLX / Ollama / LM Studio / SGLang / TGI 심층 비교
2026년 LLM 서빙·추론 프레임워크의 지도를 그린다. 데이터센터 진영(vLLM·SGLang·TGI·Triton·TensorRT-LLM), 로컬 진영(llama.cpp·MLX·llamafile·Ollama·LM Studio·GPT4All), 신생 진영(KTransformers·MLC LLM·Modular MAX), 그리고 클라우드 서빙 SaaS(Together·Fireworks·Groq·C
2026-05-16 · 37 분 읽기 #llm#model-serving#inference#vllm#llama-cpp로컬 LLM 시대 완전 가이드: Llama, Qwen, Mistral, vLLM, 양자화, Apple Silicon (2025)
외부 API에 모든 걸 의존하던 시절이 끝나간다. 2025년은 소비자 GPU와 Apple Silicon에서 30B–70B 모델이 "쓸 만하게" 돌아가는 시대. 모델 선택(Llama/Qwen/Mistral/Gemma/Solar), 엔진(vLLM/TGI/SGLang/llama.cpp/Ollama), 양자화(AWQ/GPTQ/EXL2/GGUF), 하드웨어, 비용·전력, 그리고 Privacy-firs
2026-04-15 · 19 분 읽기 #local-llm#llama#qwen#mistral#vllm