タグ: #shuffle
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 2 件
Apache Spark 内部完全ガイド 2025: RDD, Catalyst Optimizer, Tungsten, Whole-Stage Codegen, Shuffle 深層解析
Spark が同じクエリを MapReduce より 100 倍速く処理する秘訣。RDD から DataFrame/Dataset、Catalyst optimizer、Tungsten project、whole-stage code generation、shuffle 最適化まで完全解析する。
2026-04-15 · 17 分で読めます #spark#catalyst#tungsten#rdd#whole-stage-codegenApache Spark 実運用ガイド: 性能チューニング、シャッフル、スキュー、AQE、ストリーミング運用
Apache Sparkを本番環境で安定して運用するために重要な実行モデル、シャッフルとデータスキュー、AQE、キャッシュ戦略、Structured Streaming運用チェックリストを整理します。
2026-03-17 · 10 分で読めます #spark#spark-tuning#data-engineering#shuffle#adaptive-query-execution