태그: #model-routing
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 1 편
LLM API 비용 최적화 — 출력 토큰, 프롬프트 캐싱, 라우팅의 손익분기 계산
LLM API 청구서를 절반으로 줄이는 작업은 감이 아니라 산수입니다. 출력 토큰 단가가 입력의 몇 배라는 구조 때문에 가장 큰 레버는 거의 항상 출력 길이 통제이고, 그다음이 프롬프트 캐싱입니다. 캐싱이 접두사만 잡는다는 제약이 프롬프트 배치 순서를 어떻게 강제하는지, RAG와 전체 컨텍스트의 손익분기가 어디인지, 모델 라우팅의 절감률 공식과 그에 따르는 정확도 손실을 어떻게 같은 단위로
2026-07-26 · 20 분 읽기 #llm#cost-optimization#prompt-caching#rag#model-routing