LabHub
배우기 러닝패스 코스

Apache Spark — 遅いジョブの答えは実行計画とイベントログにある

クイズ: DataFrame と SQL

LabHub 에서 이어서 보기

한국어 원문으로 표시합니다.

같은 월별 매출 질의를 spark.sql 문자열과 DataFrame API 로 각각 썼다. 성능 차이에 대해 옳은 것은?

합계를 내는 groupBy 의 물리 계획을 아래에서 위로 읽을 때 나타나는 순서는?

날짜로 정렬한 윈도에서 프레임을 적지 않고 sum 으로 누적합을 냈더니 같은 날짜의 행들이 모두 같은 누적값을 받았다. 이유는?

판매액이 [100, 90, 90, 90, 80] 인 분류에서 rank() 로 매긴 순위로 rank <= 3 을 걸렀다. 남는 행 수는?

createOrReplaceTempView 로 등록한 뷰를 다른 spark-submit 앱에서 같은 이름으로 조회했더니 테이블을 찾지 못했다. 이유는?

정산용 월간 고유 고객 수에 approx_count_distinct 를 기본값으로 쓰려 한다. 문서에 근거한 판단은?