태그: #prompt-caching
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 7 편
GPT-5.6과 가격 대비 성능의 한계 — 곡선 위에서 내 워크로드의 자리를 찾는 법
OpenAI가 2026년 7월 30일 GPT-5.6 Luna 가격을 80%, Terra를 20% 내렸습니다. 7월 9일 정식 출시로부터 3주 만이고, 최상위 Sol 가격은 그대로입니다. Luna는 100만 토큰당 입력 1달러 출력 6달러에서 입력 0.20달러 출력 1.20달러가 됐습니다. 이 글은 인하폭을 소개하는 대신 곡선을 계산합니다 — 인하 후 세 티어의 단가 비율이 정확히 25 대 1
2026-07-31 · 20 분 읽기 #ai#llm#openai#inference-cost#prompt-cachingLLM API 비용 최적화 — 출력 토큰, 프롬프트 캐싱, 라우팅의 손익분기 계산
LLM API 청구서를 절반으로 줄이는 작업은 감이 아니라 산수입니다. 출력 토큰 단가가 입력의 몇 배라는 구조 때문에 가장 큰 레버는 거의 항상 출력 길이 통제이고, 그다음이 프롬프트 캐싱입니다. 캐싱이 접두사만 잡는다는 제약이 프롬프트 배치 순서를 어떻게 강제하는지, RAG와 전체 컨텍스트의 손익분기가 어디인지, 모델 라우팅의 절감률 공식과 그에 따르는 정확도 손실을 어떻게 같은 단위로
2026-07-26 · 20 분 읽기 #llm#cost-optimization#prompt-caching#rag#model-routingLLM API 비용을 실제로 줄이는 법 — "캐싱 90% 할인"이 청구서에서는 왜 25%인가
프롬프트 캐싱의 캐시 읽기는 입력 가격의 10분의 1입니다. 그런데 그게 청구서를 90% 깎아 주지는 않습니다. Anthropic이 자기 문서에 올려 둔 계산 예제를 그대로 따라가면, 캐시가 완전히 걸린 상태에서도 총액은 0.705달러에서 0.525달러로 25.5%만 줄어듭니다. 이유는 단순합니다 — 할인은 그 항목에 쓰는 돈의 비율만큼만 청구서를 줄이고, 출력 토큰이 이미 비용의 60%를
2026-07-17 · 39 분 읽기 #llm#cost-optimization#prompt-caching#api#aiAI Engineering 프로덕션 실전 완전 가이드 — RAG·Evals·Fine-tuning·LLMOps·Guardrails·Prompt Caching·비용 최적화까지 2025-2026년 현장 노하우
LLM을 프로토타입에서 프로덕션으로 가져가는 여정은 Jupyter 노트북의 데모와 다르다. RAG 파이프라인 설계, eval harness 구축, fine-tuning 결정 트리, LLMOps 관측 가능성, Guardrails와 안전성, Prompt Caching과 비용 최적화까지 2025-2026년 AI 엔지니어의 현장 가이드를 500줄로 정리한다.
2026-04-15 · 20 분 읽기 #ai-engineering#llm#rag#evaluation#fine-tuningGPT-5 개발자 실전 가이드: 에이전트 코딩, 도구 호출, 비용 최적화까지
2025년 8월 7일 공개된 GPT-5를 기준으로, 개발자가 무엇을 다르게 해야 하는지, 어떤 모델 크기와 제어값을 고를지, 그리고 에이전트 코딩과 비용 최적화를 어떻게 함께 설계할지 실무 관점에서 정리합니다.
2026-04-12 · 15 분 읽기 #openai#gpt-5#coding#agentic-coding#tool-use프롬프트 캐싱 실전 가이드: 에이전트 앱의 비용과 지연 시간을 함께 줄이는 방법
에이전트 애플리케이션에서 프롬프트 캐싱이 왜 중요한지, OpenAI와 Anthropic의 차이, 프롬프트 구조화 패턴, ROI 판단법, 흔한 실수, 마이그레이션 체크리스트까지 실무 관점에서 정리합니다.
2026-04-12 · 16 분 읽기 #prompt-caching#latency#cost-optimization#ai-agent#llmopsLLM API 비용을 90% 줄이는 실전 최적화 전략
Prompt Caching, 모델 라우팅, 시맨틱 캐싱, Batch API, 출력 최적화까지 5가지 실전 전략으로 LLM API 비용을 최대 90% 절감하는 방법을 실제 코드와 계산 예시로 설명합니다.
2026-03-18 · 18 분 읽기 #LLM비용최적화#API비용#prompt-caching#모델라우팅#ai-development