LabHub
배우기 러닝패스 코스

Apache Spark — 遅いジョブの答えは実行計画とイベントログにある

クイズ: シャッフルとパーティション数

LabHub 에서 이어서 보기

한국어 원문으로 표시합니다.

AQE 를 끄고 30만 줄을 groupBy 한 뒤 바로 파일로 썼더니 결과 쪽 태스크가 200 개였다. 200 은 어디서 왔나?

AQE 와 파티션 합치기를 기본값으로 켰다. 셔플 파티션을 합치는 기준에 대한 설명으로 옳은 것은?

100 개 파티션인 DataFrame 을 파일 10 개로 쓰고 싶다. 셔플 없이 파티션을 줄이는 방법은?

큰 자료를 무거운 변환 뒤 coalesce(1) 로 파일 하나로 썼더니 변환까지 느려졌다. 문서가 설명하는 원인은?

RDD 가이드가 셔플 비용이 큰 이유로 드는 세 가지 조합은?

CSV 를 읽어 filter 와 withColumn 만 한 뒤 Parquet 으로 쓴 잡의 이벤트 로그를 보았다. 완료 스테이지 수로 가장 알맞은 것은?