Databricks-Certified-Professional-Data-Engineer 문제 71

데이터 엔지니어가 Lakeflow Declarative Pipelines의 Expectations 기능을 사용하여 수신되는 센서 데이터의 품질을 추적하고 있습니다. 센서에서 주기적으로 범위를 벗어난 잘못된 측정값이 전송되는데, 현재는 해당 행에 경고 플래그를 지정하고 정상 데이터와 함께 실버 테이블에 기록하고 있습니다. 그런데 새로운 요구 사항이 생겼습니다. 잘못된 행을 별도의 격리 테이블에 저장하고 더 이상 실버 테이블에 포함시키지 않아야 한다는 것입니다.
이것은 그들의 은색 테이블에 대한 기존 코드입니다:
@dlt.table
@dlt.expect("valid_sensor_reading", "reading < 120")
def silver_sensor_readings():
spark.readStream.table("bronze_sensor_readings")를 반환합니다.
어떤 코드가 요구 사항을 충족할까요?

Databricks-Certified-Professional-Data-Engineer 문제 72

DLT 파이프라인을 구축할 때 라이브 테이블을 생성하는 두 가지 옵션이 있는데, `CREATE STREAMING LIVE TABLE`과 `CREATE LIVE TABLE`의 주요 차이점은 무엇인가요?

Databricks-Certified-Professional-Data-Engineer 문제 73

데이터 과학 팀은 MLFlow를 사용하여 프로덕션 환경을 구축하고 로그를 남겼습니다. 이 모델은 열 이름 목록을 입력받아 DOUBLE 형식의 새 열을 반환합니다.
다음 코드는 프로덕션 모델을 올바르게 가져오고, customer_id 키 열을 포함하는 고객 테이블을 데이터프레임으로 로드하고, 모델에 필요한 기능 열을 정의합니다.

어떤 코드 블록이 'customer_id LONG, predictions DOUBLE' 스키마를 가진 DataFrame을 출력합니까?

Databricks-Certified-Professional-Data-Engineer 문제 74

Spark UI에서 조건자 푸시다운을 활용하지 않아 발생하는 성능 문제를 진단할 수 있는 곳은 어디인가요?

Databricks-Certified-Professional-Data-Engineer 문제 75

데이터 아키텍트는 두 개의 구조화된 스트리밍 작업이 하나의 브론즈 델타 테이블에 동시에 데이터를 기록하는 시스템을 설계했습니다. 각 작업은 Apache Kafka 소스의 서로 다른 토픽을 구독하지만, 동일한 스키마를 사용하여 데이터를 기록합니다. 디렉터리 구조를 단순하게 유지하기 위해 데이터 엔지니어는 두 스트림이 공유하는 체크포인트 디렉터리를 중첩하기로 결정했습니다.
제안된 디렉토리 구조는 아래와 같습니다.
주어진 시나리오에서 이 체크포인트 디렉터리 구조가 유효한지 여부를 설명하는 문장은 무엇이며, 그 이유는 무엇입니까?