태그: #triton
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 12 편
GPU 컴파일러와 프레임워크 지형 — 그래프를 받아 커널을 만드는 하나의 문제, 층마다 다른 답
NVCC와 PTX부터 LLVM, MLIR, Triton, torch.compile, XLA, IREE, TVM까지를 하나의 지도 위에 올렸습니다. 이름이 다르고 소속이 다르지만 이들은 전부 같은 문제를 풉니다. 연산 그래프를 받아 실행 가능한 커널을 만드는 일입니다. 각 층이 그 문제의 어느 부분을 잘라 가져갔는지, 왜 층이 이렇게 많아졌는지, 그리고 엔지니어가 어떤 상황에서 어느 층까지 내
2026-08-02 · 39 분 읽기 #gpu#compiler#mlir#triton#pytorch커널을 쓰는 세 가지 층위 — CUDA C++, Triton, CUTLASS를 같은 문제로 비교하기
같은 GPU 커널을 손으로 쓰는 CUDA C++, 파이썬으로 타일 단위로 쓰는 Triton, 템플릿으로 조립하는 CUTLASS와 CuTe로 각각 접근할 때 무엇이 달라지는지 비교합니다. 행 단위 softmax를 CUDA C++와 Triton으로 실제로 짜서 코드량과 성능을 나란히 재고, 그 차이가 어디서 오는지 컴파일 파이프라인 수준에서 설명합니다. Triton이 커스텀 어텐션 커널의 사실상
2026-08-02 · 28 분 읽기 #triton#cuda#cutlass#gpu-kernel#compilerTriton Gluon — 컴파일러가 숨기던 레이아웃을 손으로 쓰는 언어
Gluon은 Triton과 같은 컴파일러 스택 위에 올라간 하위 레벨 GPU 언어로, Triton이 감춰 두던 레이아웃·공유 메모리·워프 특수화를 커널 작성자에게 그대로 넘깁니다. 존재 이유는 명확합니다 — Triton 컴파일러가 잘 못 뽑는 코드를 만났을 때, 지금까지는 손쓸 방법이 없었기 때문입니다. 이 글은 Gluon이 무엇을 노출하는지, BlockedLayout이 실제로 무엇을 뜻하는
2026-07-16 · 33 분 읽기 #gpu#triton#kernel#compiler#performance리버스 엔지니어링 도구 2026 — Ghidra / IDA Pro / Binary Ninja / radare2 / Frida / x64dbg / angr 심층 가이드
2026년 리버스 엔지니어링 도구 지형도를 디스어셈블러(Ghidra/IDA Pro/Binary Ninja/radare2+Cutter/Hopper), 디버거(x64dbg/OllyDbg/WinDbg/Pwndbg/GEF), 동적 계측(Frida/Cheat Engine/Wireshark), 심볼릭 실행(angr/Triton/KLEE), 그리고 엔진 레이어(Capstone/Keystone/Unicor
2026-05-16 · 40 분 읽기 #reverse-engineering#ghidra#ida-pro#binary-ninja#radare2MLOps 완전 가이드 — 모델 서빙·Feature Store·Drift·A/B 테스트·GPU 경제학 (Season 2 Ep 7, 2025)
모델을 학습하는 것과 프로덕션에서 운영하는 것은 완전히 다른 게임이다. Serving(TorchServe·Triton·vLLM·TGI), Feature Store(Feast·Tecton), Training Infra(Ray·Determined), Experiment Tracking(MLflow·W&B), Data/Concept Drift 감지, Model A/B 테스트와 Shadow Depl
2026-04-15 · 17 분 읽기 #mlops#model-serving#feature-store#drift-detection#ab-testing토스뱅크 ML Engineer (MLOps) 합격 완벽 가이드: MLFlow부터 LLM 플랫폼까지 기술스택 총정리
토스뱅크 ML Platform Team의 MLOps Engineer JD를 완전 분석합니다. MLFlow, Airflow, JupyterHub, Kubeflow, Triton Inference Server, ScyllaDB Feature Store, LLM 플랫폼까지 — 합격을 위한 기술스택 딥다이브, 면접 예상 질문 30선, 6개월 학습 로드맵.
2026-03-21 · 67 분 읽기 #mlops#ml-platform#tossbank#kubernetes#mlflowAI 모델 서빙과 추론 최적화 완전 가이드: vLLM, TensorRT, Triton, Ollama
AI 모델을 프로덕션에서 효율적으로 서빙하는 완전 가이드. vLLM, TensorRT, NVIDIA Triton Inference Server, Ollama, 양자화(INT8/INT4), 배치 처리, 지연 최적화까지 실전 예제로 마스터합니다.
2026-03-17 · 29 분 읽기 #mlops#model-serving#vllm#tensorrt#tritonAI 모델 배포 & 서빙 완전 가이드: Triton, vLLM, BentoML, Kubernetes까지
Docker GPU 컨테이너, Kubernetes HPA, NVIDIA Triton, vLLM LLM 서빙, BentoML, Ray Serve까지 AI 모델 프로덕션 배포 완전 가이드입니다.
2026-03-17 · 18 분 읽기 #model-serving#triton#vllm#bentoml#kubernetesCUDA GPU 프로그래밍 심화: Warp 최적화, Tensor Core, Triton 커널 작성까지
CUDA 메모리 계층, Warp 최적화, Tensor Core WMMA API, Flash Attention 구현, Triton 커스텀 커널 작성까지 AI 모델 학습 가속화를 위한 GPU 프로그래밍 심화 가이드입니다.
2026-03-17 · 26 분 읽기 #cuda#gpu-programming#tensorcore#triton#flash-attentionPyTorch 내부 구조 & 고급 최적화: autograd, torch.compile, FSDP, Triton까지
PyTorch autograd 엔진, torch.compile() TorchInductor 최적화, FSDP 분산 학습, gradient checkpointing, 커스텀 CUDA 연산까지 PyTorch 완전 정복 가이드입니다.
2026-03-17 · 15 분 읽기 #pytorch#torch-compile#fsdp#triton#혼합정밀도NVIDIA Triton Inference Server 프로덕션 가이드: GPU 모델 서빙 최적화 전략
NVIDIA Triton Inference Server를 활용한 GPU 모델 서빙 최적화 가이드. Dynamic Batching, Model Ensemble, TensorRT 통합, 멀티 모델 서빙, Kubernetes 배포, 성능 프로파일링과 프로덕션 트러블슈팅까지 다룹니다.
2026-03-08 · 44 분 읽기 #ai-platform#triton#inference-server#gpu#model-servingKubernetes ML 모델 서빙: KServe와 NVIDIA Triton 완전 분석
KServe와 NVIDIA Triton 공식 문서를 기반으로 Kubernetes 환경에서의 ML 모델 서빙 아키텍처를 체계적으로 분석한다.
2026-03-01 · 31 분 읽기 #mlops#kubernetes#model-serving#kserve#triton