Databricks-Certified-Professional-Data-Engineer-KR 문제 81

쿼리 실행에 소요된 총 실제 시간을 측정하는 데 사용할 수 있는 방법은 무엇입니까?

Databricks-Certified-Professional-Data-Engineer-KR 문제 82

시설 모니터링 팀이 Delta 테이블의 device_readings 데이터를 기반으로 거의 실시간에 가까운 PowerBI 대시보드를 구축하고 있습니다.
열:
* device_id (문자열, 고유 센서 ID)
* event_ts (TIMESTAMP, 수집 타임스탬프 UTC)
* temperature_c (DOUBLE, °C 단위의 온도)
요구 사항:
* 각 센서에 대해 겹치지 않는 5분 간격으로 한 행씩 생성하되, 2분씩 오프셋합니다(예:
00:02-00:07, 00:07-00:12, ...).
* 각 행에는 구간 시작 시간, 구간 종료 시간 및 해당 구간의 평균 온도가 포함되어야 합니다.
* 하위 BI 도구(예: Power BI)는 시계열 막대를 표시하기 위해 간격 타임스탬프를 사용해야 합니다.
옵션:

Databricks-Certified-Professional-Data-Engineer-KR 문제 83

데이터 엔지니어는 각 주식 그룹 내 행 간 상태를 유지해야 하는 복잡한 계산을 포함하는 금융 시계열 데이터를 처리하는 Pandas 사용자 정의 함수(UDF)를 설계할 때, 해당 함수가 효율적이고 확장 가능한지 확인해야 합니다.
데이터 무결성을 유지하면서 최소한의 오버헤드로 문제를 해결할 수 있는 접근 방식은 무엇일까요?

Databricks-Certified-Professional-Data-Engineer-KR 문제 84

거래 테이블이 product_id, user_id 및 event_date 열을 기준으로 Liquid 클러스터링되었습니다.
쓰기 시 클러스터링을 지원하지 않는 작업은 무엇입니까?

Databricks-Certified-Professional-Data-Engineer-KR 문제 85

데이터 엔지니어가 기본 설정을 사용하여 공유 액세스 모드로 새 클러스터를 생성했습니다. 데이터 엔지니어는 개발팀이 필요에 따라 드라이버 로그를 볼 수 있도록 액세스 권한을 부여해야 합니다.
개발팀이 이를 수행하는 데 필요한 최소 클러스터 권한은 무엇입니까?