태그: #mlops
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 52 편
지금 주목받는 오픈소스 (5) 데이터와 ML 파이프라인
데이터 파이프라인은 스케줄러 하나로 해결되지 않습니다. 적재, 변환, 오케스트레이션, 실행 엔진, 모델 수명 주기, 검색 저장소가 각각 다른 도구의 영역이 되었습니다. 이 층들에서 실제로 쓰이는 오픈소스 11개를 스타 순위가 아니라 담당 구간별로 묶어 소개합니다. 무엇을 대체하는지, 성숙도가 어느 정도인지, 언제 쓰면 안 되는지를 함께 적었고, 저장소 경로와 라이선스, 스타 수, 최근 푸시는
2026-08-12 · 9 분 읽기 #open-source#data-engineering#mlops#python#rust국내 개발 블로그 명글 큐레이션 3 — AI와 ML 실무, 직접 열어 확인한 14편
AI와 ML을 실무에서 다루는 한국어 글 중에서 구체적이고 재현 가능한 14편을 골랐습니다. LangChain RAG 파이프라인 전 과정, 임베딩과 벡터 유사도로 본 의미 검색의 원리, 벡터 데이터베이스 일곱 종 비교, pgvector에서 Qdrant로 옮긴 마이그레이션 기록, Ollama에서 vLLM으로 옮겨 처리량을 끌어올린 과정, LLM 서빙 지표의 트레이드오프, 사용량 추적기 자작기,
2026-08-12 · 23 분 읽기 #curation#큐레이션#ai#llm#rag코딩 에이전트 비용은 한도로 잡는 게 아니라 마찰로 잡습니다
Databricks가 2026년 7월과 8월에 연달아 공개한 두 편의 엔지니어링 글은 코딩 에이전트 지출을 다루는 방식이 예산 한도에서 게이트웨이와 점진적 마찰로 옮겨 가고 있음을 보여 줍니다. 이 글은 그 설계를 뜯어봅니다. 왜 하드 예산이 마지막 수단인지, 일일 폭주 방지와 월간 거버넌스를 왜 분리하는지, 증분 하나의 크기가 왜 설계의 전부인지, 그리고 실제로 비용을 지배하는 항목이 왜
2026-08-09 · 15 분 읽기 #mlops#llm#cost#ai-gateway#developer-productivityLLM 학습 스택 지도 2026 — 무엇이 무엇을 대신해 주고 무엇을 숨기는가
LLM 학습 프레임워크를 세 개 층으로 나눠 계보를 정리했습니다. 아래층은 PyTorch 분산, DeepSpeed, Megatron-Core 같은 실행 엔진이고, 가운데는 torchtitan과 Megatron-Bridge 같은 학습 루프이며, 위층은 TRL과 Axolotl처럼 설정 파일로 파인튜닝을 돌려 주는 도구입니다. 각 층이 무엇을 대신해 주고 대신 무엇을 감추는지, 그리고 상위 프레임
2026-08-02 · 23 분 읽기 #mlops#llm-training#pytorch#trl#frameworkSlurm으로 GPU 클러스터 쓰기 — 제출보다 중요한 것은 왜 안 도는지 아는 일
GPU 클러스터에서 Slurm을 실무로 쓰는 데 필요한 것만 정리했습니다. 파티션과 QoS, 계정이라는 좌표계를 먼저 세우고, sbatch 스크립트에서 GPU와 CPU, 메모리를 요구하는 방법과 그 사이의 바인딩 함정을 다룹니다. 멀티노드 학습을 srun과 랑데뷰로 띄우는 두 가지 패턴을 실제로 도는 스크립트로 제시하고, 배열 작업과 의존성 체인으로 스윕과 재개를 스케줄러에 맡기는 방법도 넣
2026-08-02 · 23 분 읽기 #mlops#slurm#hpc#gpu-cluster#distributed-trainingLLM Ops가 실제로 하는 일 — 재현, 오염, 체크포인트, 승격, 그리고 롤백
LLM Ops를 도구 목록이 아니라 책임 목록으로 정리했습니다. 학습 실행을 다시 만들 수 있게 하는 실행 명세에 무엇이 들어가야 하는지, 평가 세트 오염을 어떻게 막고 감사하는지, 체크포인트 주기를 장애율에서 역산하는 공식과 보관 비용의 실제 숫자, 평가를 CI에 넣을 때 무엇을 게이트로 삼는지를 다룹니다. 후반부는 학습과 서빙 사이의 인수인계에서 실제로 깨지는 지점들과 배포 후 회귀 감지
2026-08-02 · 23 분 읽기 #mlops#llmops#reproducibility#evaluation#model-registry멀티 GPU 학습의 네 가지 병렬화 — 무엇을 쪼개고 무엇을 통신하는가
데이터 병렬, 텐서 병렬, 파이프라인 병렬, 컨텍스트 병렬이 각각 무엇을 쪼개고 그 대가로 무엇을 통신하는지를 숫자로 정리했습니다. 먼저 Adam 혼합정밀 학습의 파라미터당 16바이트 장부를 세우고, ZeRO 1~3단계가 그 장부의 어느 항을 GPU 수로 나누는지 계산합니다. 이어서 활성화 메모리 공식으로 체크포인팅이 왜 100GB를 1GB로 만드는지 확인하고, 각 병렬화의 통신량을 스텝당
2026-08-02 · 23 분 읽기 #mlops#distributed-training#multi-gpu#fsdp#deepspeed공개된 학습 사례에서 배우기 — 무엇을 시도했고 무엇이 실패했나
공개된 대규모 학습 기술 보고서와 로그북 일곱 건을 골라 성공 지표가 아니라 실패와 대응만 뽑아 정리했습니다. Llama 3 405B의 54일간 419건 중단 통계에서 체크포인트 주기를 역산하고, DeepSeek-V3와 Kimi K2가 손실 스파이크를 각각 다른 층위에서 없앤 방식을 비교합니다. Olmo 계열이 안정성 수정을 아키텍처에 남긴 이유, OPT-175B와 BLOOM 로그북이 남긴
2026-08-02 · 24 분 읽기 #mlops#llm-training#case-study#training-stability#scaling멀티 GPU·멀티노드 학습 플랫폼 총정리 — 프레임워크 지도부터 Slurm·Kubeflow 실전 가이드까지
GPU 여러 장, 노드 여러 대로 모델을 학습시키는 전체 지형을 한 장에 정리합니다. AI 라이브러리·프레임워크 생태계 지도(PyTorch·JAX·HuggingFace·DeepSpeed·Ray), 병렬화 전략(DDP·FSDP·ZeRO·TP·PP)을 언제 무엇으로 고르는지, torchrun 단일노드→멀티노드 확장, HPC의 표준 Slurm 사용 가이드(sbatch 스크립트와 멀티노드 torch
2026-07-09 · 13 분 읽기 #ai#ml#distributed-training#slurm#kubeflowNVIDIA GPU Operator 완전 정복 — 설치·배포부터 MIG 분할 설정까지
쿠버네티스에서 GPU 노드를 손으로 셋업하는 시대는 끝났습니다. NVIDIA GPU Operator가 드라이버부터 디바이스 플러그인, 모니터링까지 전부 오퍼레이터 패턴으로 관리하는 원리와 Helm 설치·검증 방법, 그리고 A100/H100 한 장을 하드웨어 격리된 여러 GPU로 쪼개 쓰는 MIG의 개념·single/mixed 전략·노드 라벨 기반 설정·커스텀 프로필·운영 주의사항까지, 실제
2026-07-07 · 15 분 읽기 #kubernetes#gpu#nvidia#mig#devopsAI 모델 개발, 처음부터 끝까지 — 데이터에서 배포까지의 현실적인 생애주기
모델 개발은 사전학습이 아니라 결정 사다리에서 시작합니다 — 프롬프트로 되는가, RAG로 되는가, 파인튜닝이 필요한가. 평가 셋을 먼저 만드는 eval-first 원칙, 데이터 품질과 합성 데이터의 함정, 스케일링 법칙과 분산 학습, LoRA·DPO로 이어지는 파인튜닝 스펙트럼, 양자화·연속 배칭 서빙, 그리고 배포 후의 데이터 플라이휠까지 — AI 모델 개발의 전체 생애주기를 실무 순서로
2026-07-07 · 16 분 읽기 #ai#ml#llm#mlops#trainingVision LLM 학습법 — input과 output을 어떻게 가르치나
비전-언어 모델은 정렬 사전학습부터 인스트럭션 파인튜닝까지 단계적으로 학습됩니다. 비전 인코더 동결 전략, 데이터 구성, 입력 포맷과 출력 형태, 손실 계산까지 무엇을 어떻게 가르치는지 학습 파이프라인 관점에서 정리합니다.
2026-06-26 · 35 분 읽기 #mlops#vision-language-model#multimodal#training#instruction-tuningLLM 추론 서빙 2026 — vLLM, SGLang, TensorRT-LLM 비교
2026년의 LLM 추론 서빙을 한눈에 정리합니다. prefill과 decode의 성격 차이, continuous batching, paged KV 캐시 같은 핵심 원리부터 vLLM, SGLang, TensorRT-LLM의 강약점 비교와 선택 가이드, 실제 배포 설정까지 개발자 관점에서 다룹니다.
2026-06-26 · 27 분 읽기 #llm-serving#vllm#sglang#tensorrt-llm#inference추론을 빠르게 — Speculative Decoding과 처리량 최적화
LLM의 decode가 느린 근본 이유부터 speculative decoding으로 속도를 끌어올리는 원리, 메두사와 EAGLE 같은 변형, chunked prefill과 prefill/decode 분리, 지연과 처리량의 트레이드오프, 그리고 TTFT/TPOT 같은 측정 지표까지 추론 가속의 핵심을 정리합니다.
2026-06-26 · 23 분 읽기 #speculative-decoding#throughput#inference#mlops#latency멀티모달 LLM 서빙 — 이미지 입력이 만드는 새로운 과제
텍스트 전용 LLM 서빙과 무엇이 다른지부터, 비전 인코더 추가 단계, 가변 비주얼 토큰 수, 프리필 비용 급증, 멀티모달 KV 캐시와 배칭의 난점, 지연 분해와 처리량 최적화, 비용과 운영 함정까지 멀티모달 LLM 서빙의 실무를 정리합니다.
2026-06-26 · 30 분 읽기 #mlops#multimodal#llm-serving#vllm#kv-cache오픈소스 ML 플랫폼 & MLOps 2026 완벽 가이드 - Kubeflow · Metaflow · Flyte · ZenML · MLflow · BentoML · ClearML · DVC · Weights & Biases 심층 분석
2026년 5월 기준 프로덕션 ML 파이프라인을 떠받치는 오픈소스 MLOps 스택을 끝까지 본다. 실험 추적(MLflow 3.0, W&B, Comet, Neptune.ai, Aim), 파이프라인 오케스트레이션(Kubeflow, Metaflow, Flyte, ZenML), 모델 레지스트리, 서빙(BentoML 1.4, Seldon Core 2, KServe, Triton, Ray Serve),
2026-05-16 · 29 분 읽기 #mlops#kubeflow#metaflow#flyte#zenmlMLOps 플랫폼 2026 완전판 - MLflow · Kubeflow · W&B · Vertex AI · SageMaker · Databricks · BentoML · Ray · Modal · Hugging Face 심층 가이드
2026년 5월 기준 MLOps 30여 개 플랫폼을 한 번에 비교한다. MLflow 3, Kubeflow 1.10, Weights & Biases, Comet, Neptune.ai, ClearML, Vertex AI, SageMaker, Azure ML, Databricks ML + Mosaic AI, Hugging Face Inference Endpoints, Determined, Anys
2026-05-16 · 26 분 읽기 #mlops#mlflow#kubeflow#weights-and-biases#vertex-ai피처 스토어 2026 완벽 가이드 - Feast · Tecton · Hopsworks · Databricks · Vertex AI · SageMaker · Featureform · Bytewax · Materialize · RisingWave · Fennel · Chalk 심층 분석
2026년 5월 기준 피처 스토어 시장을 끝까지 본다. Feast(CNCF 샌드박스), Tecton(Eppo 인수 통합), Hopsworks, Vertex AI Feature Store, SageMaker Feature Store, Databricks Feature Engineering in Unity Catalog, Featureform, Bytewax/Feldera/Materialize/
2026-05-16 · 32 분 읽기 #feature-store#feast#tecton#hopsworks#databricksLLMOps 완전 가이드: 모델·프롬프트·평가셋 3축 버전 관리, Canary, 비용 통제, 플랫폼 팀 (2025)
LLM 제품을 빠르게 만드는 법은 쉬워졌다. 지속 가능하게 돌리는 법이 어렵다. 모델·프롬프트·평가셋의 3축 버전 관리, Shadow/Canary/Blue-Green 배포, 토큰·캐시·모델 라우팅으로 비용 통제, 조직 구조(AI 플랫폼/Model 플랫폼/Product AI), 실패 사례, KPI·온콜까지. MLOps의 연장선이되, LLM 고유의 과제를 정면으로 다루는 한 편.
2026-04-15 · 15 분 읽기 #llmops#mlops#devops#canary#cost-controlMLOps 완전 가이드 — 모델 서빙·Feature Store·Drift·A/B 테스트·GPU 경제학 (Season 2 Ep 7, 2025)
모델을 학습하는 것과 프로덕션에서 운영하는 것은 완전히 다른 게임이다. Serving(TorchServe·Triton·vLLM·TGI), Feature Store(Feast·Tecton), Training Infra(Ray·Determined), Experiment Tracking(MLflow·W&B), Data/Concept Drift 감지, Model A/B 테스트와 Shadow Depl
2026-04-15 · 17 분 읽기 #mlops#model-serving#feature-store#drift-detection#ab-testing