Databricks-Certified-Professional-Data-Engineer-KR 문제 36

아래의 각 구성은 클러스터당 총 400GB의 RAM, 총 160개의 코어, 그리고 VM당 하나의 Executor만 갖는다는 점에서 동일합니다.
하나 이상의 광범위한 변환이 포함된 작업이 주어졌을 때, 다음 클러스터 구성 중 어떤 구성이 최대 성능을 가져올까요?

Databricks-Certified-Professional-Data-Engineer-KR 문제 37

프로덕션 환경에 구조화된 스트리밍 작업을 예약할 때, 쿼리 실패 시 자동으로 복구되고 비용을 낮게 유지하는 구성은 무엇입니까?

Databricks-Certified-Professional-Data-Engineer-KR 문제 38

스트리밍 비디오 분석 팀은 매일 수십억 개의 이벤트를 Unity Catalog에서 관리하는 Delta 테이블인 video_events에 수집합니다. 분석가들은 user_id, campaign_id, region과 같은 열을 대상으로 임시 조회 쿼리를 실행합니다.
팀은 수동으로 `OPTIMIZE video_events ZORDER BY (user_id, campaign_id, region)` 쿼리를 실행하지만, 최근 데이터에서 여전히 성능이 저조하고 이러한 운영 부담이 부담스럽습니다. 팀은 쿼리 패턴이 변화함에 따라 자주 사용되는 열들을 항상 같은 위치에 유지할 수 있는 자동화된 방법을 원합니다.

Databricks-Certified-Professional-Data-Engineer-KR 문제 39

신입 데이터 엔지니어에게 DataFrame df를 사용하여 그룹화된 집계를 수행하는 스트리밍 데이터 파이프라인을 개발하라는 요청이 있었습니다. 이 파이프라인은 겹치지 않는 5분 간격으로 평균 습도와 평균 온도를 계산해야 합니다. 또한, 늦게 도착하는 데이터에 대해서는 10분 동안 증분 상태 정보를 유지해야 합니다.
스트리밍 데이터프레임 df는 다음과 같은 스키마를 가지고 있습니다.
" device_id INT, event_time TIMESTAMP, temp FLOAT, humidity FLOAT "
코드 블록:

이 과제를 완료하려면 코드 블록 안의 빈칸을 올바르게 채우는 답을 선택하세요.

Databricks-Certified-Professional-Data-Engineer-KR 문제 40

한 조직이 웹 및 모바일 애플리케이션에서 고객 데이터를 처리합니다. 데이터에는 이름, 이메일, 전화번호 및 위치 기록이 포함됩니다. 데이터는 배치 파일(SFTP를 통해 매일 전송)과 스트리밍 JSON 이벤트(Kafka를 통해 실시간으로 전송) 형태로 수신됩니다.
데이터 개인정보 보호 정책을 준수하려면 다음 요건을 충족해야 합니다.
* 이메일, 전화번호, IP 주소와 같은 개인 식별 정보(PII)는 저장하기 전에 마스킹 또는 익명화해야 합니다.
* 배치 파이프라인과 스트리밍 파이프라인 모두 개인정보 처리 방식에 일관성을 적용해야 합니다.
* 마스킹 로직은 감사 가능하고 재현 가능해야 합니다.
* 마스킹된 데이터는 후속 분석에 계속 사용할 수 있어야 합니다.
데이터 엔지니어는 배치 모드와 스트리밍 모드를 모두 지원하고, 개인 식별 정보(PII)에 데이터 마스킹을 적용하며, 감사 추적성을 유지하는 Databricks 기반의 규정 준수 데이터 파이프라인을 어떻게 설계해야 할까요?