Databricks-Certified-Professional-Data-Engineer-KR 문제 91

데이터 엔지니어는 Databricks의 Delta 테이블이 삭제된 파일을 지속적으로 보존하도록 하는 임무를 맡았습니다.
조직의 데이터 보존 정책을 영구적으로 준수하기 위해 기본값인 7일 대신 15일 동안 데이터를 보관합니다.
삭제된 파일의 보존 기간을 올바르게 설정하는 코드 조각은 무엇입니까?

Databricks-Certified-Professional-Data-Engineer-KR 문제 92

데이터 과학 팀은 MLFlow를 사용하여 프로덕션 환경을 구축하고 로그를 남겼습니다. 이 모델은 열 이름 목록을 입력받아 DOUBLE 형식의 새 열을 반환합니다.
다음 코드는 프로덕션 모델을 올바르게 가져오고, customer_id 키 열을 포함하는 고객 테이블을 데이터프레임으로 로드하고, 모델에 필요한 기능 열을 정의합니다.

어떤 코드 블록이 ' ' customer_id LONG, predictions DOUBLE ' ' 스키마를 가진 DataFrame을 출력합니까?

Databricks-Certified-Professional-Data-Engineer-KR 문제 93

Delta Lake 테이블은 사용자 콘텐츠 게시물에 대한 메타데이터를 나타내며 다음과 같은 스키마를 가집니다.
user_id LONG, post_text STRING, post_id STRING, longitude FLOAT, latitude FLOAT, post_time TIMESTAMP, date DATE 이 테이블은 날짜 열을 기준으로 파티션되어 있습니다. 다음 필터를 사용하여 쿼리를 실행합니다.
경도 < 20 및 경도 > -20
데이터 필터링 방법을 설명하는 문장은 무엇입니까?

Databricks-Certified-Professional-Data-Engineer-KR 문제 94

데이터 엔지니어가 다음 PySpark 코드를 실행하려고 시도하고 있습니다.
df = spark.read.table("sales")
result = df.groupBy("region").agg(sum("revenue"))
하지만 실행 계획을 검토하고 Spark 작업을 프로파일링한 결과, 집계 단계에서 과도한 데이터 셔플링이 발생하는 것을 발견했습니다.
groupBy 집계 연산 중 셔플링을 줄이기 위해 어떤 기법을 적용해야 할까요?

Databricks-Certified-Professional-Data-Engineer-KR 문제 95

데이터 아키텍트는 두 개의 구조화된 스트리밍 작업이 하나의 브론즈 델타 테이블에 동시에 데이터를 기록하는 시스템을 설계했습니다. 각 작업은 Apache Kafka 소스의 서로 다른 토픽을 구독하지만, 동일한 스키마를 사용하여 데이터를 기록합니다. 디렉터리 구조를 단순하게 유지하기 위해 데이터 엔지니어는 두 스트림이 공유하는 체크포인트 디렉터리를 중첩하기로 결정했습니다.
제안된 디렉토리 구조는 아래와 같습니다.

주어진 시나리오에서 이 체크포인트 디렉터리 구조가 유효한지 여부를 설명하는 문장은 무엇이며, 그 이유는 무엇입니까?