Databricks-Certified-Professional-Data-Engineer 문제 51

시간별 배치 작업은 클라우드 객체 스토리지 컨테이너에서 데이터 파일을 수집하도록 구성되며, 각 배치는 특정 시간 동안 소스 시스템에서 생성된 모든 레코드를 나타냅니다. 이러한 레코드를 Lakehouse로 처리하는 배치 작업은 지연된 데이터가 누락되지 않도록 충분히 지연됩니다. user_id 필드는 데이터의 고유 키를 나타내며, 다음 스키마를 갖습니다.
user_id BIGINT, username STRING, user_utc STRING, user_region STRING, last_login BIGINT, auto_pay BOOLEAN, last_updated BIGINT. 새 레코드는 모두 account_history라는 테이블에 수집되며, 이 테이블은 원본과 동일한 스키마에 있는 모든 데이터의 전체 레코드를 유지합니다. 시스템의 다음 테이블은 account_current라는 이름으로 각 uniqueuser_id의 최신 값을 나타내는 유형 1 테이블로 구현됩니다.
매시간 수백만 개의 사용자 계정과 수만 개의 레코드가 처리된다고 가정할 때, 각 매시간 일괄 작업의 일부로 describedaccount_currenttable을 효율적으로 업데이트하는 데 사용할 수 있는 구현은 무엇입니까?

Databricks-Certified-Professional-Data-Engineer 문제 52

COPY INTO 명령을 활용하여 외부 CSV 파일을 델타 테이블에 로드하는 프로세스를 진행 중이지만, 두 번째로 명령을 실행한 후에는 테이블 이름에 데이터가 로드되지 않습니다. 이유가 무엇일까요?
1. table_name에 복사
2. 'dbfs:/mnt/raw/*.csv'에서
3.파일 형식 = CSV

Databricks-Certified-Professional-Data-Engineer 문제 53

Databricks 작업에서 두 ​​가지 작업을 설정하라는 요청을 받았습니다. 첫 번째 작업은 원격 시스템에서 데이터를 다운로드하기 위한 노트북을 실행하고 두 번째 작업은 이 데이터를 처리할 수 있는 DLT 파이프라인입니다. 작업 UI에서 이를 어떻게 구성할 계획입니까?

Databricks-Certified-Professional-Data-Engineer 문제 54

아래의 각 구성은 각 클러스터에 총 400GB의 RAM, 총 160개의 코어, VM당 하나의 Executor만 있다는 점에서 동일합니다.
최소한 하나의 광범위한 변환이 있는 작업이 주어졌을 때, 다음 중 어떤 클러스터 구성이 최대 성능을 낼까요?

Databricks-Certified-Professional-Data-Engineer 문제 55

주니어 데이터 엔지니어가 DataFrame df를 사용하여 그룹화된 집계를 포함하는 스트리밍 데이터 파이프라인을 개발해 달라는 요청을 받았습니다. 이 파이프라인은 겹치지 않는 5분 간격의 평균 습도와 평균 온도를 계산해야 합니다. 늦게 도착하는 데이터의 경우 증분 상태 정보는 10분 동안 유지되어야 합니다.
스트리밍 DataFrame df에는 다음과 같은 스키마가 있습니다.
"장치 ID INT, 이벤트 시간 타임스탬프, 온도 FLOAT, 습도 FLOAT"
코드 블록:

이 작업을 완료하려면 코드 블록 내의 빈칸에 올바르게 들어갈 응답을 선택하세요.