태그: #GPU
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 5 편
#GPU 태그가 붙은 글은 5편이고, 가장 최근 글은 2026-10-06에 올라왔습니다.
함께 자주 붙은 태그: #토스 ML/AI Infra 준비 4 #Kubernetes 2 #LLM 서빙 2 #스케줄링 2 #쿠버네티스 2
최근 90일 동안 많이 읽힌 글:
ML·AI 인프라와 쿠버네티스 엔지니어가 알면 좋은 지식 지도: 직접 재 본 숫자와 함께
GPU 한 장에서 쿠버네티스 위의 서빙까지, ML·AI 인프라 엔지니어와 쿠버네티스 엔지니어가 알아 두면 좋은 지식을 여덟 개 층으로 정리합니다. 층마다 핵심 개념, 직접 재 본 숫자, 흔한 함정, 더 읽을 글을 붙였고 4주 학습 경로와 현장 질문도 담았습니다.
2026-10-06 · 23 분 읽기 #ML 인프라#AI 인프라#쿠버네티스#GPU#LLM 서빙실시간 음성 대화, 부품별로 직접 잰 지연: 음성인식 0.2초, LLM 첫 토큰 0.07초, 음성합성은 길이의 절반
외국어 말하기 연습용 실시간 음성 대화의 세 부품(음성인식, 대화 LLM, 음성합성)을 한국어, 일본어, 중국어, 영어로 직접 쟀습니다. 부품별 지연과 GPU 메모리, 오픈 모델 두 쌍의 비교, 한 턴의 첫 소리까지의 계산, 그리고 측정하면서 만나기 쉬운 함정을 정리했습니다.
2026-10-06 · 27 분 읽기 #음성 에이전트#ASR#TTS#지연 측정#LLM 추론멀티테넌트 GPU 스케줄링과 용량 계획
기본 스케줄러가 GPU를 다루는 방식의 한계에서 출발해 Kueue와 Volcano의 설계 차이, 토폴로지 인식 배치, GPU 공유의 격리 한계, DRA의 현재 상태를 정리합니다. 마지막으로 요청률과 지연 목표에서 GPU 수를 역산하는 방법을 필자의 실험 환경에서 잰 값을 기준점으로 보입니다.
2026-10-06 · 34 분 읽기 #Kubernetes#GPU#Kueue#Volcano#스케줄링하이브리드 GPU 쿠버네티스와 Cilium·Istio 네트워크
온프레미스 GPU 노드와 클라우드 노드를 한 클러스터 또는 여러 클러스터로 묶을 때 선택지와 네트워크 경로, 그리고 Cilium과 Istio의 역할 분담을 정리합니다. LLM 서빙의 긴 연결과 스트리밍 응답이 타임아웃, 로드밸런싱, 헬스체크에서 어떻게 깨지는지를 중심으로 다룹니다.
2026-10-06 · 41 분 읽기 #Kubernetes#하이브리드클라우드#GPU#Cilium#IstioGPU 패스스루와 vfio-pci: VM 에 GPU 를 통째로 넘기는 원리
GPU 를 컨테이너가 아니라 VM 에 통째로 넘기는 패스스루가 어떤 원리로 동작하는지, IOMMU 그룹과 vfio-pci 가 각각 무슨 일을 하는지를 GPU 서버 한 대에서 읽은 예시 값으로 설명합니다. 같은 GPU 에서 nvidia-smi 가 실패하는 이유도 다룹니다.
2026-10-06 · 20 분 읽기 #GPU#패스스루#VFIO#IOMMU#KubeVirt