태그: #gpu-kernel
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 2 편
GPU 커널을 직접 손본다는 것 — 전치 커널 하나를 5배 빠르게 만들기까지
GPU 커널을 직접 수정한다는 것이 실제로 무엇을 뜻하는지, 스레드와 워프와 메모리 계층부터 짚습니다. 점유율이 왜 목표가 아니라 증상인지, 그리고 대부분의 커널이 연산이 아니라 메모리 대역폭에 묶여 있다는 사실을 루프라인 관점에서 설명합니다. 행렬 전치 커널 하나를 naive에서 코얼레싱, 셰어드 메모리 타일링, 뱅크 충돌 제거까지 네 단계로 고치면서 각 단계의 유효 대역폭을 직접 재는 하
2026-08-02 · 32 분 읽기 #cuda#gpu-kernel#nsight-compute#memory-bandwidth#performance커널을 쓰는 세 가지 층위 — CUDA C++, Triton, CUTLASS를 같은 문제로 비교하기
같은 GPU 커널을 손으로 쓰는 CUDA C++, 파이썬으로 타일 단위로 쓰는 Triton, 템플릿으로 조립하는 CUTLASS와 CuTe로 각각 접근할 때 무엇이 달라지는지 비교합니다. 행 단위 softmax를 CUDA C++와 Triton으로 실제로 짜서 코드량과 성능을 나란히 재고, 그 차이가 어디서 오는지 컴파일 파이프라인 수준에서 설명합니다. Triton이 커스텀 어텐션 커널의 사실상
2026-08-02 · 28 분 읽기 #triton#cuda#cutlass#gpu-kernel#compiler