태그: #routing
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 4 편
MoE 라우팅 — 전문가는 어떻게 뽑히는가
전문가 혼합 계층의 config 필드를 실제 모델로 읽습니다. Mixtral의 8개 중 2개, Qwen3의 128개 중 8개, DeepSeek-V3의 256개 라우팅 전문가와 공유 전문가, Kimi K2의 희소도 48을 비교하고, 활성 파라미터와 전체 파라미터가 왜 다른 비용을 만드는지, 로드 밸런싱 손실과 보조 손실 없는 편향 방식이 무엇을 맞바꾸는지 정리합니다.
2026-08-12 · 11 분 읽기 #ai-papers#model-internals#mixture-of-experts#moe#routingROV가 막아낸 것, ASPA가 아직 못 막는 것 — 2026년 6월 텔레그램 하이재킹과 라우팅 보안의 다음 층
2026년 6월 16일 인도 Rcom(AS18101)이 텔레그램 프리픽스를 하이재킹했고, Kentik 측정으로 그 경로는 자사 BGP 소스의 1.6%에만 도달했습니다. RPKI ROV가 실제로 작동한 사례입니다. 하지만 이건 origin을 위조하지 않은 서투른 하이재킹이었기 때문이고, ROV의 구조적 천장은 route leak — origin이 정당한 채로 잘못된 경로를 타는 경우 — 을 전
2026-07-16 · 39 분 읽기 #network#bgp#rpki#routing#securityCloudflare AI Gateway 실전 가이드: AI 트래픽을 관찰하고 제어하는 가장 빠른 방법
Cloudflare AI Gateway를 왜 쓰는지, 어떤 제어가 가능한지, Dynamic Routing과 자동 재시도를 어떻게 함께 써야 하는지 2026년 4월 기준으로 실무적으로 정리한다.
2026-04-12 · 11 분 읽기 #ai-platform#cloudflare#ai-gateway#observability#cachingLLM 라우팅·캐스케이드 전략: 멀티 모델 오케스트레이션으로 비용 최적화
LLM 라우팅과 캐스케이드 전략으로 비용을 최적화하는 방법을 다룹니다. 쿼리 복잡도 기반 라우팅, 모델 캐스케이드, 시맨틱 라우터, FrugalGPT 접근법부터 프로덕션 멀티 모델 오케스트레이션 아키텍처까지 구현합니다.
2026-03-08 · 43 분 읽기 #llm#routing#cascade#model-orchestration#cost-optimization