Databricks-Certified-Professional-Data-Engineer-KR 문제 21
시설 모니터링 팀이 Delta 테이블의 device_readings 데이터를 기반으로 거의 실시간에 가까운 Power BI 대시보드를 구축하고 있습니다.
* device_id 문자열 - 고유 센서 ID
* event_ts TIMESTAMP - 데이터 수집 타임스탬프(UTC)
* temperature_c DOUBLE - 섭씨 온도
* 참고 사항 STRING
각 센서에 대해, 팀은 2분 간격으로 겹치지 않는 5분 간격(예: 00:02-00:07, 00:07-00:12 등)으로 한 행씩을 생성하여 해당 구간의 평균 온도를 표시해야 합니다.
결과에는 각 구간의 시작 및 종료 타임스탬프가 포함되어야 하위 도구에서 시계열 막대를 정확하게 그릴 수 있습니다. 다음 쿼리 중 이 요구 사항을 충족하는 쿼리는 무엇입니까?
* device_id 문자열 - 고유 센서 ID
* event_ts TIMESTAMP - 데이터 수집 타임스탬프(UTC)
* temperature_c DOUBLE - 섭씨 온도
* 참고 사항 STRING
각 센서에 대해, 팀은 2분 간격으로 겹치지 않는 5분 간격(예: 00:02-00:07, 00:07-00:12 등)으로 한 행씩을 생성하여 해당 구간의 평균 온도를 표시해야 합니다.
결과에는 각 구간의 시작 및 종료 타임스탬프가 포함되어야 하위 도구에서 시계열 막대를 정확하게 그릴 수 있습니다. 다음 쿼리 중 이 요구 사항을 충족하는 쿼리는 무엇입니까?
Databricks-Certified-Professional-Data-Engineer-KR 문제 22
데이터 엔지니어가 국가별로 심하게 편향된 이력 파티션을 가진 Delta 테이블을 물려받았습니다. 쿼리는 종종 카디널리티가 높은 customer_id를 기준으로 필터링하고, 시간 경과에 따라 차원별로 필터링 방식이 달라집니다. 엔지니어는 전체적인 재작성을 피하고, 편향된 파티션에 대한 민감도를 낮추며, 액세스 패턴이 변화하더라도 강력한 쿼리 성능을 유지하는 전략을 원합니다.
데이터 엔지니어는 어떤 두 가지 조치를 취해야 할까요? (두 가지를 선택하세요)
데이터 엔지니어는 어떤 두 가지 조치를 취해야 할까요? (두 가지를 선택하세요)
Databricks-Certified-Professional-Data-Engineer-KR 문제 23
프로덕션 클러스터는 3개의 실행기 노드를 가지며 드라이버와 실행기에 동일한 가상 머신 유형을 사용합니다.
이 클러스터의 Ganglia 메트릭을 평가할 때, 드라이버에서 실행되는 코드로 인해 발생하는 병목 현상을 나타내는 지표는 무엇일까요?
이 클러스터의 Ganglia 메트릭을 평가할 때, 드라이버에서 실행되는 코드로 인해 발생하는 병목 현상을 나타내는 지표는 무엇일까요?
Databricks-Certified-Professional-Data-Engineer-KR 문제 24
아래 쿼리를 사용하여 Delta Lake 테이블이 생성되었습니다.

다음 질문을 고려해 보세요.
DROP TABLE prod.sales_by_store -
워크스페이스 관리자가 이 명령문을 실행하면 어떤 결과가 발생할까요?

다음 질문을 고려해 보세요.
DROP TABLE prod.sales_by_store -
워크스페이스 관리자가 이 명령문을 실행하면 어떤 결과가 발생할까요?
Databricks-Certified-Professional-Data-Engineer-KR 문제 25
마케팅팀은 영업팀과 집계 테이블 형태로 데이터를 공유하려고 하지만, 두 팀에서 사용하는 필드 이름이 일치하지 않고, 마케팅 관련 필드 중 일부는 영업팀의 승인을 받지 못했습니다.
다음 중 간결성을 강조하면서 상황을 해결하는 방법은 무엇입니까?
다음 중 간결성을 강조하면서 상황을 해결하는 방법은 무엇입니까?
