태그: #gguf
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 7 편
로컬 AI & 온디바이스 LLM 2026 완벽 가이드 — Ollama · LM Studio · Jan · Msty · Open WebUI · GPT4All · AnythingLLM · Faraday 심층 분석
2026년, 로컬 AI는 더 이상 "취미"가 아니다. M4 Max MacBook Pro에서 Llama 4 Scout 109B MoE가 24토큰/초로 도는 시대다. Ollama, LM Studio, Jan, Msty 같은 데스크탑 런타임이 GUI/CLI를 통일하고, Open WebUI, AnythingLLM, LibreChat이 ChatGPT급 인터페이스를 제공한다. 백엔드는 llama.cpp
2026-05-16 · 36 분 읽기 #local-ai#on-device-llm#ollama#lm-studio#jan엣지 AI & TinyML 2026 — LiteRT / ExecuTorch / Edge Impulse / Jetson / Coral / Hailo / Sipeed K230 / llama.cpp / Phi-4 심층 가이드
2026년 엣지 AI / TinyML 생태계의 풀스택 지도 — TFLite Micro 가 LiteRT 로 리브랜드된 후 ExecuTorch 가 GA 가 되며 형성된 듀얼 표준, Edge Impulse 가 만든 TinyML 클라우드 워크플로, NVIDIA Jetson Orin Nano/NX/Thor/AGX 와 Coral Dev Board 의 가속기 격돌, 이스라엘 Hailo-15/8 과 중국
2026-05-16 · 53 분 읽기 #edge-ai#tinyml#tflite-micro#litert#executorch딥러닝 모델 양자화 완전 정복: INT8, INT4, GPTQ, AWQ, GGUF 마스터하기
딥러닝 모델 양자화를 완전히 마스터하는 가이드. FP32에서 INT8, INT4까지의 양자화 원리, GPTQ, AWQ, GGUF, bitsandbytes, AutoGPTQ, llama.cpp까지 실전 예제로 완벽히 이해합니다.
2026-03-17 · 38 분 읽기 #quantization#model-compression#gptq#awq#ggufLLM 양자화(Quantization) 실전 가이드: GPTQ·AWQ·GGUF 포맷 비교와 정밀도-성능 트레이드오프
LLM 양자화 기술의 핵심 원리부터 GPTQ, AWQ, GGUF, bitsandbytes NF4까지 주요 포맷을 비교 분석하고, 실전 코드와 벤치마크를 통해 프로덕션 환경에서의 최적 전략을 제시합니다.
2026-03-14 · 28 분 읽기 #llm#quantization#gptq#awq#ggufLLM 양자화 기법 비교 가이드 — GPTQ, AWQ, GGUF, bitsandbytes 실전 적용
LLM 양자화 기법인 GPTQ, AWQ, GGUF, bitsandbytes의 원리, 벤치마크 비교, 실전 적용 가이드를 정리합니다. 모델 선택부터 서빙까지의 전체 워크플로우를 다룹니다.
2026-03-09 · 25 분 읽기 #llm#quantization#gptq#awq#ggufLLM 양자화 기법 완벽 비교: GPTQ, AWQ, GGUF 실전 적용 가이드
LLM 양자화의 핵심 원리부터 GPTQ, AWQ, GGUF, BitsAndBytes 기법을 비교 분석하고, vLLM·llama.cpp 환경에서의 실전 적용과 품질-성능 트레이드오프를 다룬다.
2026-03-06 · 19 분 읽기 #llm#quantization#gptq#awq#ggufLLM Quantization 완벽 비교 — GPTQ vs AWQ vs GGUF
양자화 원리부터 GPTQ, AWQ, GGUF 각 방식의 비교, vLLM/llama.cpp 연동, 실전 벤치마크까지 LLM Quantization을 완벽하게 정리합니다.
2026-03-03 · 7 분 읽기 #llm#quantization#gptq#awq#gguf