태그: #quantization
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 31 편
LLM 추론 최적화 완전 가이드 2025: vLLM, TensorRT-LLM, KV Cache, Speculative Decoding
LLM 추론 최적화의 모든 것! vLLM(PagedAttention), TensorRT-LLM(FP8/INT4), KV Cache 관리, Speculative Decoding, Continuous Batching, FlashAttention, 양자화(GPTQ/AWQ/GGUF), 모델 서빙(Triton/vLLM/TGI), GPU 메모리 최적화, 비용 분석.
2026-04-14 · 34 분 읽기 #llm-inference#vllm#tensorrt-llm#kv-cache#speculative-decodingEdge AI 완전 가이드 2025: 온디바이스 추론, 모델 최적화, TensorRT/ONNX/CoreML
Edge AI의 모든 것! 온디바이스 추론(TensorRT/ONNX Runtime/CoreML/TFLite), 모델 최적화(양자화/프루닝/지식 증류), 하드웨어(NVIDIA Jetson/Apple Neural Engine/Qualcomm NPU), Federated Learning, 프라이버시 보존 AI, 실전 배포.
2026-04-13 · 32 분 읽기 #edge-ai#on-device#inference#tensorrt#onnxUnsloth로 LLM 파인튜닝 완전 가이드 2025: QLoRA, 4bit 양자화, 2배 빠른 학습
Unsloth로 LLM 파인튜닝의 모든 것! QLoRA/LoRA 원리, 4bit 양자화(bitsandbytes), Unsloth 2x 속도 비밀, Llama 3/Mistral/Qwen 파인튜닝, 데이터 준비, 학습 설정, VRAM 최적화, GGUF/GPTQ 변환, 배포까지.
2026-03-25 · 25 분 읽기 #unsloth#llm#fine-tuning#qlora#lora딥러닝 모델 양자화 완전 정복: INT8, INT4, GPTQ, AWQ, GGUF 마스터하기
딥러닝 모델 양자화를 완전히 마스터하는 가이드. FP32에서 INT8, INT4까지의 양자화 원리, GPTQ, AWQ, GGUF, bitsandbytes, AutoGPTQ, llama.cpp까지 실전 예제로 완벽히 이해합니다.
2026-03-17 · 38 분 읽기 #quantization#model-compression#gptq#awq#gguf온디바이스 AI 2026: 당신의 스마트폰이 개인 AI 서버가 되는 시대
온디바이스 AI는 2026년 모바일 혁신의 중심입니다. Apple Silicon의 신경처리장치(NPU), Snapdragon AI 칩, Google Tensor의 AI 최적화로, 개인정보 보호와 극저지연을 동시에 달성하면서 클라우드 의존도를 획기적으로 줄이고 있습니다.
2026-03-16 · 16 분 읽기 #on-device-ai#edge-inference#apple-intelligence#privacy#mobile-aiLLM 양자화(Quantization) 실전 가이드: GPTQ·AWQ·GGUF 포맷 비교와 정밀도-성능 트레이드오프
LLM 양자화 기술의 핵심 원리부터 GPTQ, AWQ, GGUF, bitsandbytes NF4까지 주요 포맷을 비교 분석하고, 실전 코드와 벤치마크를 통해 프로덕션 환경에서의 최적 전략을 제시합니다.
2026-03-14 · 28 분 읽기 #llm#quantization#gptq#awq#ggufLLM 양자화 기법 비교 가이드 — GPTQ, AWQ, GGUF, bitsandbytes 실전 적용
LLM 양자화 기법인 GPTQ, AWQ, GGUF, bitsandbytes의 원리, 벤치마크 비교, 실전 적용 가이드를 정리합니다. 모델 선택부터 서빙까지의 전체 워크플로우를 다룹니다.
2026-03-09 · 25 분 읽기 #llm#quantization#gptq#awq#ggufLLM 양자화 기법 완벽 비교: GPTQ, AWQ, GGUF 실전 적용 가이드
LLM 양자화의 핵심 원리부터 GPTQ, AWQ, GGUF, BitsAndBytes 기법을 비교 분석하고, vLLM·llama.cpp 환경에서의 실전 적용과 품질-성능 트레이드오프를 다룬다.
2026-03-06 · 19 분 읽기 #llm#quantization#gptq#awq#ggufBitNet 논문 분석: 1-Bit LLM의 시대 — 삼진 가중치부터 CPU 추론까지
Microsoft Research의 BitNet 시리즈(v1, b1.58, a4.8, 2B4T) 논문을 분석하고, 삼진 가중치 학습 원리부터 bitnet.cpp 추론 프레임워크, 실전 벤치마크까지 다루는 종합 가이드.
2026-03-06 · 37 분 읽기 #ai-papers#bitnet#1-bit-llm#quantization#model-efficiencyLLM Quantization 완벽 비교 — GPTQ vs AWQ vs GGUF
양자화 원리부터 GPTQ, AWQ, GGUF 각 방식의 비교, vLLM/llama.cpp 연동, 실전 벤치마크까지 LLM Quantization을 완벽하게 정리합니다.
2026-03-03 · 7 분 읽기 #llm#quantization#gptq#awq#ggufvLLM & Ollama 완벽 가이드: LLM 서빙 엔진의 구동, 파라미터, 환경변수 총정리
vLLM의 PagedAttention 아키텍처와 Ollama의 로컬 LLM 실행 환경을 심층 비교한다. 설치부터 서버 구동, API 호출, 주요 CLI 인자, 샘플링 파라미터, 환경변수, 양자화(AWQ/GPTQ/GGUF), 멀티 GPU 구성, Docker 배포, 성능 튜닝까지 — LLM 서빙에 필요한 모든 설정을 실전 예제와 함께 총정리한다.
2026-03-01 · 56 분 읽기 #vllm#ollama#model-serving#inference#gpu