Databricks-Certified-Professional-Data-Engineer 문제 146

상위 소스는 Parquet 데이터를 시간 단위로 현재 날짜로 명명된 디렉터리에 배치 형식으로 저장합니다. 야간 배치 작업은 날짜 변수에 지정된 날짜의 전날 데이터를 모두 가져오기 위해 다음 코드를 실행합니다.

customer_id와 order_id 필드가 각 주문을 고유하게 식별하는 복합 키 역할을 한다고 가정합니다.
상위 시스템에서 단일 주문에 대해 몇 시간 간격으로 중복 항목이 생성되는 경우가 있는 것으로 알려져 있다면, 다음 중 어떤 설명이 맞습니까?

Databricks-Certified-Professional-Data-Engineer 문제 147

프로덕션 환경에 구조화된 스트리밍 작업을 예약할 때, 쿼리 실패 시 자동으로 복구되고 비용을 낮게 유지하는 구성은 무엇입니까?

Databricks-Certified-Professional-Data-Engineer 문제 148

데이터 분석팀은 주문 및 재고 보충 정보를 기반으로 품절된 품목을 식별하는 쿼리를 작성했지만, 최종 결과를 얻기 위해 모든 쿼리를 한꺼번에 실행했을 때 시간이 매우 오래 걸린다는 것을 발견했습니다. 당신은 쿼리 실행 속도가 느린 이유를 파악하고 성능 개선 방안을 모색하도록 요청받았고, 조사 결과 모든 코드 쿼리가 순차적으로 실행되며 SQL 엔드포인트 클러스터를 사용하고 있음을 확인했습니다. 다음 중 이 문제를 해결하기 위해 취할 수 있는 조치는 무엇입니까?
다음은 예시 쿼리입니다.
1. 주문 요약 보기
2. orders_summary 테이블을 생성 또는 교체합니다.
3.as
4. 제품 ID를 선택하고 주문 수를 합산합니다.
5.부터
6. (
7. orders_instore 테이블에서 product_id와 order_count를 선택합니다.
8. 모두의 조합
9. orders_online 테이블에서 product_id와 order_count를 선택합니다.
10.)
11. product_id로 그룹화
12.-- 공급 요약 보기
13. supply_summary 테이블을 생성하거나 교체합니다.
14.as
15.select product_id, sum(supply_count) supply_count
16.공급으로부터
17. product_id로 그룹화
18.
19. 주문 요약 및 공급 요약을 기반으로 재고를 확보하십시오.
20.
21.stock_cte와 함께
22.as (
23.select nvl(s.product_id,o.product_id) as product_id,
24. nvl(supply_count,0) - nvl(order_count,0) as on_hand
25. 공급 요약에서
26. 전체 외부 조인 orders_summary o
27. s.product_id = o.product_id
28.)
29.선택 *
30.부터
31.stock_cte
32.손익계산서가 0인 경우

Databricks-Certified-Professional-Data-Engineer 문제 149

데이터 엔지니어링 팀은 다음 코드를 유지 관리합니다.

이 코드가 논리적으로 올바른 결과를 생성하고 원본 테이블의 데이터가 중복 제거 및 유효성 검사를 거쳤다고 가정할 때, 이 코드가 실행될 때 발생하는 상황을 설명하는 문장은 무엇입니까?

Databricks-Certified-Professional-Data-Engineer 문제 150

비즈니스 인텔리전스 팀은 소매 관련 다양한 요약 지표를 추적하도록 구성된 대시보드를 보유하고 있습니다. 여기에는 전날 총 매출액과 다양한 기간별 총액 및 평균이 포함됩니다. 이 대시보드를 채우는 데 필요한 필드는 다음과 같은 스키마를 따릅니다.

수요 예측을 위해 레이크하우스는 모든 품목별 판매 내역이 포함된 검증된 테이블을 보유하고 있으며, 이 테이블은 거의 실시간으로 점진적으로 업데이트됩니다. products_per_order라는 이름의 이 테이블에는 다음과 같은 필드가 포함되어 있습니다.

장기 판매 추세 보고는 변동성이 적기 때문에 새로운 대시보드를 사용하는 분석가는 하루에 한 번만 데이터를 새로 고치면 됩니다. 또한, 일반적인 업무 시간 동안 많은 사용자가 대시보드를 대화형으로 조회하므로 결과가 빠르게 표시되고 각 데이터 생성에 필요한 총 컴퓨팅 리소스가 줄어듭니다.
어떤 솔루션이 최종 사용자의 기대를 충족시키면서 동시에 발생 가능한 비용을 통제하고 제한할 수 있을까요?