LabHub

블로그

로컬 LLM 시대 완전 가이드: Llama, Qwen, Mistral, vLLM, 양자화, Apple Silicon (2025)

Season 4 Ep 7 — 로컬 LLM은 "마이너"가 아니라 2025년 AI 스택의 절반이다. 외부 API가 못 하는 걸 해낼 때만 가치가 있다는 걸 먼저 이해하자.

Prologue — "왜 로컬인가"라는 질문에 대한 2025년의 답

2023년엔 로컬 LLM이 "가난한 자의 대안"이었다. 2024년엔 "프라이버시 오타쿠의 장난감". 2025년엔 제품의 정당한 선택지가 됐다.

이유:

  1. 모델 품질: 7B–14B 오픈 모델이 2022년 GPT-3.5를 아득히 넘어섬. 70B는 2024년 초 GPT-4 수준
  2. 하드웨어: 소비자 GPU(4090/5090)로 30B–70B QLoRA/Inference 가능. Apple M3/M4 Ultra로 100B+도 가능(느리게)
  3. 엔진: vLLM·TGI·SGLang으로 서빙 TPS가 수십 배 개선
  4. 양자화: INT4로 품질 손실 2–5% 수준, 메모리 4배 절감
  5. 규제·데이터주권: 금융·의료·공공·유럽 등 외부 API 금지 환경

하지만 모든 문제에 로컬이 답이 아니다. 이 글은 "언제 로컬이 말 되고, 언제 외부 API가 맞는지" 경계선도 같이 긋는다.


1장 · 언제 로컬인가

1.1 로컬이 말 되는 경우

1.2 외부 API가 맞는 경우

1.3 하이브리드가 정답인 경우

많은 2025년 제품은 둘 다 쓴다.

"라우터"가 로컬/외부를 결정한다. 이 라우터 자체는 작은 분류 모델(LoRA 파인튜닝)이 될 수 있다.


2장 · 모델 지형 2025

2.1 오픈 기반 모델(Base/Chat)

모델크기강점라이선스
Llama 3.1 / 3.2 / 3.31B–405B광범위, 생태계 최강Llama 라이선스
Qwen 2.5 / Qwen 30.5B–72B다국어·코드·한국어 우수Apache 2.0 (일부)
Mistral / Mixtral / Ministral3B–8x22B효율적 아키텍처Apache / EU 상업
Gemma 2 / 32B–27BGoogle, 안전성 튜닝 강함Gemma 라이선스
Phi 3 / 3.53.8B–14B작은데 상대적으로 강함MIT
DeepSeek V2.5 / V316B–671B MoE가성비 높음, 추론 강함DeepSeek 라이선스
Yi / Yi-VL6B–34B멀티모달 포함Yi 라이선스
Command R / R+35B / 104BRAG·툴 사용 특화Cohere 비상업
Solar (Upstage)10.7B 등한국어 특화Apache 2.0
EXAONE (LG)7.8B 등한국어 고품질연구+일부 상업

2.2 선택 기준

2.3 코드·멀티모달 특화


3장 · 양자화 — 메모리와 속도의 연금술

3.1 왜 양자화

3.2 주요 기법

3.3 실전 선택

환경추천 포맷
vLLM/TGI 서버AWQ 또는 GPTQ 4-bit
llama.cpp/OllamaQ4_K_M, Q5_K_M, Q6_K
Apple SiliconGGUF (Metal 가속)
Consumer GPU 극한EXL2 4.0–6.0 bpw
Fine-tune 중bitsandbytes 4-bit

3.4 품질 손실 상식

3.5 KV cache 양자화


4장 · 서빙 엔진 — vLLM, TGI, SGLang, llama.cpp, Ollama

4.1 vLLM

4.2 TGI (Text Generation Inference)

4.3 SGLang

4.4 llama.cpp

4.5 Ollama

4.6 LMDeploy (InternLM 쪽)

4.7 TensorRT-LLM

4.8 선택 가이드

상황추천
프로토타입·개인 사용Ollama
사내 서버, 쉽게 시작vLLM
극한 성능·대규모TensorRT-LLM / SGLang
복합 LLM 파이프라인SGLang
Apple Siliconllama.cpp / Ollama / MLX
CPU-only 엣지llama.cpp

5장 · 하드웨어

5.1 NVIDIA 소비자 GPU

카드VRAM적정 모델 (4-bit)메모
RTX 409024GB13B 쾌적, 34B 가능가성비 여전히 좋음
RTX 509032GB34B 쾌적, 70B 가능Blackwell 세대
RTX 6000 Ada48GB70B 쾌적워크스테이션용
RTX 5000/6000 (Blackwell)다양프로 워크스테이션2025 출시

5.2 데이터센터 GPU

5.3 AMD·Intel

5.4 Apple Silicon

5.5 엣지·모바일

5.6 실전 권장


6장 · 속도·지연 감각 (2025년 기준)

6.1 토큰/초 감각

세팅단일 스트림 TPS
7B Q4, RTX 409060–100
13B Q4, RTX 409030–50
70B Q4, 4090 x2 or H100 115–30
7B Q4, M3 Max 36GB30–60
70B Q4, M3 Ultra 192GB8–15

6.2 배치 시 처리량

6.3 TTFT (First Token)

6.4 벤치마크 팁


7장 · 비용·전력 계산

7.1 자체 호스팅 고정비

7.2 외부 API 대비 손익분기

7.3 전력

7.4 총소유비용(TCO) 항목


8장 · 프라이버시 중심 제품 설계

8.1 장점

8.2 패턴 3가지

(a) On-prem 서버형

(b) On-device (브라우저/모바일)

(c) Hybrid

8.3 UX 설계


9장 · 한국어 로컬 LLM 실전

9.1 후보

9.2 전처리·토크나이저

9.3 사내 문서 기반 RAG + 로컬

9.4 주요 사용 사례


10장 · 실전 셋업 예 — 개인 개발자

10.1 M3/M4 Max MacBook 세팅

# Ollama 설치
curl -fsSL https://ollama.com/install.sh | sh

# 한국어·영어 모델
ollama pull qwen2.5:14b
ollama pull solar:10.7b

# OpenAI 호환 API 서버로 노출 (Ollama가 자동)
# http://localhost:11434/v1/chat/completions

10.2 RTX 4090 Linux 워크스테이션

# vLLM 설치
pip install vllm

# 서빙 (Qwen2.5 14B AWQ)
vllm serve Qwen/Qwen2.5-14B-Instruct-AWQ \
  --gpu-memory-utilization 0.9 \
  --max-model-len 8192

10.3 Docker/K8s 배포

10.4 프론트엔드


11장 · 학습·Fine-tune (Ep 4 연결)


12장 · 안전·보안 고려

12.1 On-prem도 사고 난다

12.2 체인 공급 위험

12.3 격리


13장 · 안티패턴 10선

13.1 외부 API로 충분한데 로컬 강행

운영 비용·인력 낭비. 월 호출·보안 요구를 냉정히 계산.

13.2 2-bit 양자화 프로덕션

품질 리스크 큼. 최소 4-bit.

13.3 엔진 튜닝 없이 "느리다" 불평

--gpu-memory-utilization, batch 크기, max_model_len, prefix caching 등 미튜닝.

13.4 Apple Silicon에 vLLM 억지

Metal 지원 약함. llama.cpp/Ollama/MLX가 맞음.

13.5 양자화 품질 검증 없이 배포

4-bit도 태스크별로 편차 있음. 평가셋으로 회귀 체크.

13.6 동시 요청 처리 고려 없이 설계

단일 스트림만 빨라도 생산성 한계. 배치·파라렐 필수.

13.7 로컬 모델 업데이트 없음

오픈 모델도 월 단위로 좋아진다. 분기 1회 재평가.

13.8 보안 정책이 "외부 아님=안전"

격리·감사·접근제어 동일 요구.

13.9 라이선스 미확인

상업 배포 시 Llama, Gemma, Command R 조건 체크.

13.10 하드웨어 먼저 사고 소프트웨어 나중

요구 태스크·모델 정한 뒤 하드웨어 선택이 순서.


14장 · 체크리스트 — 로컬 LLM 배포 전 12가지


15장 · 다음 글 예고 — Season 4 Ep 8: "멀티모달 — Vision, Audio, 문서 이해"

텍스트만 다루던 LLM이 이미지·오디오·동영상·문서를 자연스럽게 처리하기 시작한 2025년.

텍스트가 전부였던 시대의 종말. Ep 8에서 멀티모달 실전을 정리한다.

다음 글에서 만나자.


요약: 2025년의 로컬 LLM은 "장난감"이 아니라 제품의 정당한 선택지. 언제 로컬이 맞는지(규제·비용·지연·데이터 주권)를 먼저 정하고, 모델(Llama/Qwen/Solar/Mistral/EXAONE)·양자화(AWQ/GPTQ/EXL2/GGUF)·엔진(vLLM/Ollama/llama.cpp)·하드웨어(4090/5090/H100/Apple Silicon)를 팀 규모와 태스크에 맞게 조합한다. 하이브리드(로컬 90% + 외부 10%)가 많은 제품의 현실적 해답. "외부 API 없이 못 산다"는 시대는 끝났고, "로컬로 다 된다"는 시대도 아직 안 왔다.

댓글

아직 댓글이 없습니다.

로그인하면 댓글을 쓸 수 있습니다