Databricks-Certified-Professional-Data-Engineer 문제 91

데이터 엔지니어는 늦게 도착하는 중복 레코드가 발생할 가능성이 있는 파이프라인을 구성하고 있습니다.
배치 내에서 레코드 중복을 제거하는 것 외에도, 다음 중 어떤 접근 방식을 사용하면 데이터 엔지니어가 델타 테이블에 삽입할 때 이전에 처리된 레코드에서 데이터 중복을 제거할 수 있습니까?

Databricks-Certified-Professional-Data-Engineer 문제 92

시간별 배치 작업은 클라우드 객체 스토리지 컨테이너에서 데이터 파일을 수집하도록 구성되며, 각 배치는 특정 시간 동안 소스 시스템에서 생성된 모든 레코드를 나타냅니다. 이러한 레코드를 Lakehouse로 처리하는 배치 작업은 지연된 데이터가 누락되지 않도록 충분히 지연됩니다. user_id 필드는 데이터의 고유 키를 나타내며, 다음 스키마를 갖습니다.
user_id BIGINT, username STRING, user_utc STRING, user_region STRING, last_login BIGINT, auto_pay BOOLEAN, last_updated BIGINT: 새 레코드는 모두 account_history라는 테이블에 수집되며, 이 테이블은 원본과 동일한 스키마에 있는 모든 데이터의 전체 레코드를 유지합니다. 시스템의 다음 테이블은 account_current라는 이름으로 각 고유 user_id의 최신 값을 나타내는 유형 1 테이블로 구현됩니다.
매시간 수백만 개의 사용자 계정과 수만 개의 레코드가 처리된다고 가정할 때, 각 매시간 일괄 작업의 일부로 설명된 account_current 테이블을 효율적으로 업데이트하는 데 사용할 수 있는 구현은 무엇입니까?

Databricks-Certified-Professional-Data-Engineer 문제 93

현재 아래 쿼리를 사용하여 customer_sales 테이블을 다시 로드하는 작업을 진행 중입니다.
1. customer_sales를 덮어쓰기 삽입
2. 고객 c에서 *를 선택하세요
3. INNER JOIN sales_monthly s on s.customer_id = c.customer_id
위 명령을 실행한 후, 마케팅팀은 테이블에 있던 이전 데이터를 재빨리 검토하고 싶어했습니다. 위 명령문을 실행하기 전에 이전 버전의 데이터를 보고 싶은 경우, INSERT OVERWRITE 명령은 customer_sales 테이블의 데이터에 어떤 영향을 미칠까요?

Databricks-Certified-Professional-Data-Engineer 문제 94

레이크하우스와 데이터웨어하우스 중 하나를 선택할 때, 어떤 진술이 맞습니까?

Databricks-Certified-Professional-Data-Engineer 문제 95

다음 중 JSON 문자열을 구조체 데이터 유형으로 변환하는 데 사용할 수 있는 함수는 무엇입니까?