태그: #gpu-cuda
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 7 편
Systolic Array와 Dataflow 아키텍처 — TPU의 심장 원리
AI 가속기의 핵심 연산인 행렬곱을 효율적으로 처리하는 systolic array의 동작 원리를 ASCII 다이어그램과 함께 깊이 파헤칩니다. weight-stationary와 output-stationary 같은 dataflow 전략, 데이터 재사용과 에너지, 텐서코어와의 비교, 컴파일러 매핑까지 TPU의 심장 원리를 정리합니다.
2026-06-16 · 38 분 읽기 #gpu-cuda#systolic-array#dataflow#tpu#ai-hardware포토닉 컴퓨팅과 광 인터커넥트 — 빛으로 메모리 월을 넘다
전기 인터커넥트가 메모리 월과 데이터 이동 에너지의 벽에 부딪힌 2026년, 실리콘 포토닉스와 광 인터커넥트가 어떻게 그 한계를 넘으려 하는지 정리합니다. Lightmatter Passage, DARPA 포토닉 프로젝트, 광 텐서코어 연구, 그리고 co-packaged optics의 상용화 과제까지 살펴봅니다.
2026-06-16 · 47 분 읽기 #gpu-cuda#photonics#silicon-photonics#optical-interconnect#co-packaged-opticsAI 반도체 공급망과 시장 — 누가 칩을 만드는가 (2026)
AI 칩 한 장이 만들어지기까지의 가치사슬을 설계, EDA, IP, 파운드리, 패키징, HBM, 장비로 나누어 짚어 봅니다. TSMC와 삼성, ASML의 EUV, CoWoS 병목, 지정학과 수출통제, 클라우드 자체 칩의 부상, 그리고 2026년 투자 사이클 논쟁까지 누가 칩을 만드는지를 정리합니다.
2026-06-16 · 38 분 읽기 #gpu-cuda#ai-hardware#semiconductor#supply-chain#tsmc칩렛과 첨단 패키징 — CoWoS, 3D 적층, 그리고 무어의 법칙 너머
하나의 거대한 다이로는 더 이상 성능을 끌어올릴 수 없는 시대입니다. 이 글에서는 칩렛, CoWoS, 3D 적층, UCIe 표준을 통해 첨단 패키징이 어떻게 AI 가속기의 성능을 가르는 핵심 변수가 되었는지 살펴봅니다. 모놀리식 다이의 한계부터 TSMC 공급망 병목, 열·전력 과제, 그리고 광 통합의 미래까지 정리합니다.
2026-06-16 · 51 분 읽기 #gpu-cuda#chiplet#advanced-packaging#cowos#ucieAI 인터커넥트 — NVLink, NVSwitch, UALink, 그리고 스케일업의 기술
대규모 AI 학습과 추론의 진짜 병목은 연산이 아니라 통신입니다. NVLink와 NVSwitch가 만드는 스케일업 도메인, GB200 NVL72 같은 랙 스케일 시스템, 그리고 UALink와 Ultra Ethernet 같은 개방형 대안까지, AI 인터커넥트의 원리와 실무를 정리합니다.
2026-06-16 · 54 분 읽기 #gpu-cuda#nvlink#nvswitch#ualink#interconnectAI를 위한 GPU 하드웨어 완전 가이드: 아키텍처부터 선택 기준까지
AI 연구와 학습을 위한 GPU 하드웨어 완전 가이드. NVIDIA GPU 아키텍처(Hopper, Blackwell), Tensor Core, NVLink, HBM 메모리, A100/H100/H200/B200 비교, 클라우드 GPU 옵션까지 상세히 다룹니다.
2026-03-17 · 39 분 읽기 #gpu#hardware#nvidia#cuda#gpu-cudaCUDA 프로그래밍 완전 정복: GPU 병렬 컴퓨팅 Zero to Hero
CUDA 프로그래밍의 기초부터 고급 최적화까지 완전히 마스터하는 가이드. GPU 아키텍처 이해, 커널 작성, 메모리 최적화, 혼합 정밀도 학습, cuDNN/cuBLAS 활용까지 실전 예제와 함께 배웁니다.
2026-03-17 · 44 분 읽기 #cuda#gpu#gpu-cuda#parallel-computing#nvidia