LabHub
배우기 러닝패스 코스

Apache Spark — 遅いジョブの答えは実行計画とイベントログにある

クイズ: キャッシュと再計算

LabHub 에서 이어서 보기

한국어 원문으로 표시합니다.

캐시 없이 같은 DataFrame 으로 count() 를 부르고 이어서 파일로 썼다. 원본 CSV 는 몇 번 읽히는가?

PySpark 에서 DataFrame.cache() 가 쓰는 기본 저장 수준은?

df.cache() 를 부른 직후, 아직 행동은 부르지 않았다. 이 상태를 바르게 말한 것은?

튜닝 가이드가 설명하는 통합 메모리에서 spark.memory.fraction(기본 0.6)은 무엇에 대한 비율인가?

반복 알고리즘에서 같은 DataFrame 에 변환을 수십 번 덧대 계획이 비대해졌다. 캐시 대신 체크포인트를 쓰는 이유로 맞는 것은?

SQL 의 CACHE TABLE 과 DataFrame 의 cache() 의 차이로 맞는 것은?