Associate-Developer-Apache-Spark 문제 6

다음 중 parquet 파일의 모든 열이 정수만 포함하고 이러한 종류의 데이터에 가장 적합한 형식으로 저장되어 있는 경우 filePath 위치에 저장된 parquet 파일에서 읽는 코드 블록은 무엇입니까?

Associate-Developer-Apache-Spark 문제 7

다음 코드 블록 중 filePath에 저장된 두 개의 파티션으로 구성된 쪽모이 세공 파일을 읽고 각 파티션의 스키마가 다른 경우에도 모든 열이 정확히 한 번 포함되도록 하는 것은 무엇입니까?
첫 번째 파티션의 스키마:
1.루트
2. |-- transactionId: 정수(nullable = true)
3. |-- predError: 정수(nullable = true)
4. |-- 값: 정수(nullable = true)
5. |-- storeId: 정수(nullable = true)
6. |-- productId: 정수(nullable = true)
7. |-- f: 정수(nullable = true)
두 번째 파티션의 스키마:
1.루트
2. |-- transactionId: 정수(nullable = true)
3. |-- predError: 정수(nullable = true)
4. |-- 값: 정수(nullable = true)
5. |-- storeId: 정수(nullable = true)
6. |-- rollId: 정수(nullable = true)
7. |-- f: 정수(nullable = true)
8. |-- tax_id: 정수(nullable = false)

Associate-Developer-Apache-Spark 문제 8

다음 코드 블록 중 DataFrame itemsDf의 문자열 유형 열 공급자에 Inc. 표현식이 몇 행으로 표시되는지 출력하는 것은 무엇입니까?

Associate-Developer-Apache-Spark 문제 9

아래에 표시된 코드 블록에는 여러 오류가 있습니다. 코드 블록은 DataFrame transactionDf에서 transactionDate 열을 제거하고 DataFrame transactionDf의 transactionDate 열에서 문자열로 표현된 날짜가 유닉스 타임스탬프로 변환되는 transactionTimestamp 열을 추가해야 합니다. 오류를 찾으십시오.
DataFrame 트랜잭션의 샘플Df:
1.+-------------+---------+-----+------+--------- +----+----------------+
2.|transactionId|predError|value|storeId|productId| f| 거래날짜|
3.+-------------+---------+-----+------+--------- +----+----------------+
4.| 1| 3| 4| 25| 1|null|2020-04-26 15:35|
5.| 2| 6| 7| 2| 2|null|2020-04-13 22:01|
6.| 3| 3| 널| 25| 3|null|2020-04-02 10:53|
7.+-------------+---------+-----+------+--------- +----+----------------+ 코드 블록:
1.transactionsDf = transactionDf.drop("transactionDate")
2.transactionsDf["transactionTimestamp"] = unix_timestamp("transactionDate", "yyyy-MM-dd")

Associate-Developer-Apache-Spark 문제 10

아래에 표시된 코드 블록에는 하나 이상의 오류가 있습니다. 코드 블록은 filePath 위치에 있는 쪽모이 세공 파일을 DataFrame으로 로드해야 하며 이전에 수정된 파일만 로드해야 합니다.
2029-03-20 05:44:46. Spark는 아래 표시된 스키마에 따라 스키마를 적용해야 합니다. 오류를 찾으십시오.
개요:
1.루트
2. |-- itemId: 정수(nullable = true)
3. |-- 속성: 배열(nullable = true)
4. | |-- 요소: 문자열(containsNull = true)
5. |-- 공급자: 문자열(nullable = true)
코드 블록:
1.스키마 = StructType([
2. StructType("itemId", IntegerType(), True),
3. StructType("속성", ArrayType(StringType(), True), True),
4. StructType("공급자", StringType(), True)
5.])
6.
7.spark.read.options("modifiedBefore", "2029-03-20T05:44:46").schema(스키마).load(filePath)