Databricks-Certified-Professional-Data-Engineer 문제 171

상위 소스는 Parquet 데이터를 시간 단위로 현재 날짜로 명명된 디렉터리에 배치 형식으로 저장합니다. 야간 배치 작업은 날짜 변수에 지정된 날짜의 전날 데이터를 모두 가져오기 위해 다음 코드를 실행합니다.

customer_id와 order_id 필드가 각 주문을 고유하게 식별하는 복합 키 역할을 한다고 가정합니다.
상위 시스템에서 단일 주문에 대해 몇 시간 간격으로 중복 항목이 생성되는 경우가 있는 것으로 알려져 있다면, 다음 중 어떤 설명이 맞습니까?

Databricks-Certified-Professional-Data-Engineer 문제 172

현재 데이터 파이프라인 구축 작업을 진행 중인데, 매우 큰 규모의 ETL 작업으로 인해 데이터 종속성이 매우 높다는 것을 알게 되었습니다. 이러한 문제를 해결하기 위해 다음 도구 중 어떤 것을 사용할 수 있을까요?

Databricks-Certified-Professional-Data-Engineer 문제 173

필요한 모듈을 찾을 때 검색할 디렉터리 목록을 담고 있는 파이썬 변수는 무엇입니까?

Databricks-Certified-Professional-Data-Engineer 문제 174

데이터 분석팀과 협력하여 골드 레이어의 데이터를 쉽게 쿼리하고 분석할 수 있도록 SQL 엔드포인트(SQL 웨어하우스)를 설정했습니다. 하지만 데이터 분석팀이 SQL 엔드포인트(SQL 웨어하우스)를 사용하기 시작하면서 사용자 수가 증가하는 피크 시간대에 쿼리 완료 시간이 더 오래 걸리는 것을 발견했습니다. 이 문제를 해결하기 위해 다음 중 어떤 조치를 취할 수 있을까요?
*참고로 Databricks는 최근 SQL 엔드포인트의 이름을 SQL 웨어하우스로 변경했습니다.

Databricks-Certified-Professional-Data-Engineer 문제 175

데이터 과학 팀은 사용자 리뷰의 자유 형식 텍스트에 대한 쿼리 속도를 높이는 데 도움을 요청했습니다.
현재 데이터는 아래와 같은 스키마를 가진 Parquet 형식으로 저장되어 있습니다.
item_id INT, user_id INT, review_id INT, rating FLOAT, review STRING
리뷰 열에는 사용자가 남긴 리뷰 전문이 포함되어 있습니다. 데이터 과학 팀은 특히 이 필드에 30개의 핵심 단어가 있는지 여부를 확인하고자 합니다.
신입 데이터 엔지니어가 이 데이터를 Delta Lake로 변환하면 쿼리 성능이 향상될 것이라고 제안했습니다.
주니어 데이터 엔지니어의 제안에 대한 다음 답변 중 올바른 것은 무엇입니까?