Databricks-Certified-Professional-Data-Engineer-KR 문제 66

데이터 엔지니어가 Lakeflow Spark Declarative Pipelines Expectations를 사용하여 수신되는 센서 데이터의 품질을 추적하고 있습니다. 센서에서 주기적으로 범위를 벗어난 잘못된 측정값이 전송되는데, 현재 팀은 이러한 행에 경고 표시를 하고 정상 데이터와 함께 실버 테이블에 기록하고 있습니다. 그런데 새로운 요구 사항이 생겼습니다. 잘못된 행을 별도의 격리 테이블에 저장하고 더 이상 실버 테이블에 포함시키지 않아야 한다는 것입니다.
이것은 실버 테이블에 대한 기존 코드입니다.
@dlt.table
@dlt.expect( " valid_sensor_reading " , " reading < 120 " )
def silver_sensor_readings():
spark.readStream.table(" bronze_sensor_readings " )를 반환합니다.
어떤 코드가 요구 사항을 충족할까요?

Databricks-Certified-Professional-Data-Engineer-KR 문제 67

한 회사는 작업의 최신 상태를 추적하는 작업 관리 시스템을 보유하고 있습니다. 이 시스템은 작업 이벤트를 입력으로 받아 Lakeflow Declarative Pipelines를 사용하여 거의 실시간으로 처리합니다. 새로운 작업 이벤트는 작업이 생성되거나 작업 상태가 변경될 때 시스템에 입력됩니다. Lakeflow Declarative Pipelines는 BI 사용자가 쿼리할 수 있는 스트리밍 테이블(tasks_status)을 제공합니다.
이 표는 모든 작업의 ​​최신 상태를 나타내며 5개의 열로 구성되어 있습니다.
* task_id (각 작업마다 고유함)
* 작업 이름
* 작업 소유자
* 작업 상태
* 작업 이벤트 시간
이 테이블은 삭제 벡터, 행 추적 및 변경 데이터 피드(CDF)라는 세 가지 속성을 지원합니다.
데이터 엔지니어에게 Lakeflow 선언적 파이프라인을 새로 생성하여 tasks_status 테이블에 작업 소유자의 부서를 나타내는 열을 추가하고, 이 열을 정적 차원 테이블(employee)에서 조회할 수 있도록 거의 실시간으로 데이터를 보강하라는 요청이 주어졌습니다.
이러한 심화 학습은 어떻게 구현되어야 할까요?

Databricks-Certified-Professional-Data-Engineer-KR 문제 68

데이터 엔지니어가 사용자 ID별로 그룹화된 대규모 사용자 활동 로그에 대해 groupBy 집계를 실행하고 있습니다. 일부 사용자는 수백만 건의 기록을 보유하고 있어 작업 불균형과 긴 실행 시간을 초래하고 있습니다.
이 집계의 불균형을 바로잡을 수 있는 기술은 무엇일까요?

Databricks-Certified-Professional-Data-Engineer-KR 문제 69

분산된 데이터 분석가 팀이 자동 확장이 구성된 대화형 클러스터에서 컴퓨팅 리소스를 공유합니다. 워크스페이스 관리자는 비용과 쿼리 처리량을 더 효율적으로 관리하기 위해 클러스터 확장이 동시 사용자 수 증가 때문인지 아니면 리소스 집약적인 쿼리 때문인지 평가하고자 합니다.
클러스터 크기 조정 이벤트의 타임라인은 어디에서 확인할 수 있나요?

Databricks-Certified-Professional-Data-Engineer-KR 문제 70

야간 작업은 다음 코드를 사용하여 Delta Lake 테이블에 데이터를 수집합니다.

파이프라인의 다음 단계에서는 파이프라인의 다음 테이블로 아직 처리되지 않은 새 레코드를 조작하는 데 사용할 수 있는 객체를 반환하는 함수가 필요합니다.
다음 코드 조각 중 어떤 것이 이 함수 정의를 완성합니까?
def new_records():