태그: #shuffle
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 2 편
Apache Spark 내부 완전 가이드 2025: RDD, Catalyst Optimizer, Tungsten, Whole-Stage Codegen, Shuffle 심층 분석
Spark가 같은 쿼리를 MapReduce보다 100배 빠르게 처리하는 비결. RDD부터 DataFrame/Dataset, Catalyst optimizer, Tungsten project, whole-stage code generation, shuffle 최적화까지 720줄로 완전 분석한다.
2026-04-15 · 57 분 읽기 #spark#catalyst#tungsten#rdd#whole-stage-codegenApache Spark 실전 운영 가이드: 성능 튜닝, 셔플, 스큐, AQE, 스트리밍 운영
Apache Spark를 프로덕션에서 안정적으로 운영하기 위해 꼭 알아야 할 실행 모델, 셔플과 데이터 스큐, AQE, 캐시 전략, Structured Streaming 운영 체크리스트를 정리합니다.
2026-03-17 · 11 분 읽기 #spark#spark-tuning#data-engineering#shuffle#adaptive-query-execution