태그: #mlops
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 52 편
Kubeflow Pipelines v2 ML 워크플로우 자동화와 운영 가이드
Kubeflow Pipelines v2의 아키텍처부터 KFP SDK로 ML 파이프라인 구축, 캐싱, 아티팩트 관리, CI/CD 통합, 프로덕션 운영 트러블슈팅까지.
2026-03-06 · 19 분 읽기 #ai-platform#kubeflow#ml-pipeline#mlops#2026-03BentoML로 ML 모델 서빙 파이프라인 구축하기: 패키징부터 Kubernetes 배포까지
BentoML을 활용한 ML 모델 서빙을 실습합니다. 모델 패키징, API 구현, 멀티모델 파이프라인, Docker 빌드, Kubernetes 배포까지 핸즈온으로 다룹니다.
2026-03-03 · 7 분 읽기 #ai-platform#bentoml#model-serving#mlops#kubernetesRay Serve로 구현하는 확장 가능한 LLM 서빙 파이프라인
Ray Serve를 활용한 ML/LLM 모델 서빙의 핵심 개념부터 멀티모델 파이프라인, 오토스케일링, 배치 추론, 프로덕션 배포까지 코드 예제와 함께 다룹니다.
2026-03-03 · 8 분 읽기 #ai-platform#ray-serve#model-serving#llm#mlopsKubeflow Pipelines v2 실전 가이드 — KFP SDK로 ML 파이프라인 구축하기
Kubeflow Pipelines v2의 KFP SDK를 사용하여 ML 파이프라인을 구축하는 실전 가이드. 컴포넌트 정의, 파이프라인 작성, 아티팩트 관리, Kubernetes 배포까지 코드 중심으로 다룹니다.
2026-03-03 · 29 분 읽기 #ai-platform#kubeflow#kfp#mlops#pipelineMLflow 완벽 가이드: 실험 추적부터 Model Registry, 프로덕션 배포까지
MLflow를 사용한 ML 실험 관리 전체 워크플로우를 실습합니다. Tracking으로 실험 기록, Model Registry로 버전 관리, 프로덕션 배포까지 핸즈온으로 구현합니다.
2026-03-03 · 24 분 읽기 #ai-platform#mlflow#experiment-tracking#model-registry#mlopsMLOps Feature Store 실전 — Feast로 피처 파이프라인 구축하기
Feast를 활용하여 오프라인/온라인 피처 스토어를 구축하고, 학습과 서빙에서 일관된 피처를 제공하는 실전 파이프라인을 만들어본다
2026-03-02 · 13 분 읽기 #mlops#feast#feature-store#machine-learning#data-engineeringMLOps 파이프라인 설계: ML 시스템 프로덕션화 완전 가이드
Google MLOps 가이드와 공식 문서를 기반으로 MLOps 파이프라인의 핵심 구성 요소와 Maturity Model을 체계적으로 분석한다.
2026-03-01 · 40 분 읽기 #mlops#ml-pipeline#production#mlflowMLflow 완전 정복: 실험 추적부터 모델 배포까지
MLflow 공식 문서를 기반으로 Tracking, Projects, Models, Registry 4대 컴포넌트를 기능별로 상세 분석한다.
2026-03-01 · 27 분 읽기 #mlops#mlflow#experiment-tracking#model-registryNVIDIA GPU Operator 완벽 가이드: 구성요소, 설치, KubeVirt GPU 패스스루까지 총정리
NVIDIA GPU Operator의 아키텍처와 7대 핵심 구성요소(Driver, Container Toolkit, Device Plugin, DCGM, MIG Manager, Node Feature Discovery, GFD)의 역할을 상세히 분석하고, Helm 기반 설치, KubeVirt와의 GPU/vGPU 패스스루 통합, MIG 파티셔닝, 모니터링, 트러블슈팅까지 실전 가이드를 총정리한
2026-03-01 · 60 분 읽기 #gpu-operator#nvidia#kubernetes#kubevirt#gpuSlurm 완전 정복: HPC/AI 클러스터 워크로드 매니저 실전 가이드
Slurm 워크로드 매니저를 완전 정복한다. 아키텍처(slurmctld/slurmd/slurmdbd), 핵심 개념(파티션/QoS/Fairshare), 필수 명령어(sbatch/srun/salloc), GPU 스케줄링(GRES/MIG/MPS), 다중 노드 분산 학습(PyTorch DDP/DeepSpeed/Horovod), 컨테이너 통합(Singularity/Enroot+Pyxis), 설정·모니
2026-03-01 · 17 분 읽기 #slurm#hpc#gpu#distributed-training#clusterAirflow로 ML 학습 파이프라인 오케스트레이션하기
Apache Airflow 공식 문서를 기반으로 KubernetesPodOperator, Dynamic Task Mapping 등을 활용한 ML 학습 파이프라인 자동화 방법을 분석한다.
2026-03-01 · 30 분 읽기 #airflow#mlops#ml-pipeline#orchestration#kubernetesKubernetes ML 모델 서빙: KServe와 NVIDIA Triton 완전 분석
KServe와 NVIDIA Triton 공식 문서를 기반으로 Kubernetes 환경에서의 ML 모델 서빙 아키텍처를 체계적으로 분석한다.
2026-03-01 · 31 분 읽기 #mlops#kubernetes#model-serving#kserve#triton