태그: #tpu
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 5 편
Systolic Array와 Dataflow 아키텍처 — TPU의 심장 원리
AI 가속기의 핵심 연산인 행렬곱을 효율적으로 처리하는 systolic array의 동작 원리를 ASCII 다이어그램과 함께 깊이 파헤칩니다. weight-stationary와 output-stationary 같은 dataflow 전략, 데이터 재사용과 에너지, 텐서코어와의 비교, 컴파일러 매핑까지 TPU의 심장 원리를 정리합니다.
2026-06-16 · 38 분 읽기 #gpu-cuda#systolic-array#dataflow#tpu#ai-hardwareGPU vs TPU vs ASIC — 2026 추론 전쟁
2026년 추론 워크로드를 두고 벌어지는 GPU·TPU·ASIC의 경쟁을 비교합니다. Google TPU v6 Trillium과 Ironwood, 급성장하는 클라우드 자체 추론 ASIC, 처리량·지연·비용·전력 트레이드오프, 그리고 CUDA와 XLA로 갈라지는 컴파일러 스택까지 다룹니다.
2026-06-16 · 43 분 읽기 #gpu#tpu#asic#inference#ai-hardware분산 학습 & GPU 인프라 2026 딥다이브 — DeepSpeed, FSDP2, Megatron-LM, Ray Train, JAX, TorchTitan, Blackwell GB200, MI325X, TPU v5p 총정리
DeepSpeed/FSDP2/Megatron-LM/Ray Train/JAX/TorchTitan/Composer를 비교하고, NVIDIA Blackwell GB200 NVL72, AMD MI325X, Intel Gaudi 3, AWS Trainium 2, Google TPU v5p/v6e Trillium까지. 3D 병렬화, ZeRO-FSDP 등가성, MoE All-to-All, fp8/mxfp
2026-05-16 · 23 분 읽기 #distributed-training#deepspeed#fsdp#megatron-lm#rayGoogle TPU 완전 해부: Systolic Array가 행렬 곱셈을 어떻게 완벽히 해결하는가
Google TPU의 핵심 혁신인 Systolic Array가 행렬 곱셈을 어떻게 극한까지 최적화하는지 완전 해부합니다. INT8 추론부터 bfloat16, XLA 컴파일러, TPU Pod까지 실제 숫자와 코드로 깊이 파헤칩니다.
2026-03-18 · 21 분 읽기 #tpu#google#systolic-array#LLM서빙#jaxAI 하드웨어 가속기 완전 정복: H100, TPU, Cerebras, 엣지 AI 칩 비교
NVIDIA H100 Tensor Core, Google TPU v5 systolic array, Cerebras WSE-3, AWS Inferentia 2, Apple Neural Engine까지 AI 하드웨어 가속기 완전 비교 가이드입니다.
2026-03-17 · 27 분 읽기 #ai-hardware#h100#tpu#cerebras#edge-ai