Databricks-Certified-Professional-Data-Engineer 문제 41
Apache Kafka 프로듀서의 모든 레코드는 다음 스키마를 사용하여 단일 Delta Lake 테이블에 수집됩니다.
키 BINARY, 값 BINARY, 토픽 STRING, 파티션 LONG, 오프셋 LONG, 타임스탬프 LONG 5개의 고유 토픽이 수집되고 있습니다. "등록" 토픽에만 개인 식별 정보(PII)가 포함되어 있습니다. 회사는 PII에 대한 접근을 제한하고자 합니다. 또한 이 테이블에 PII가 포함된 레코드는 최초 수집 후 14일 동안만 보관하고자 합니다. 단, PII가 아닌 정보는 무기한 보관하고자 합니다.
다음 솔루션 중 요구 사항을 충족하는 것은 무엇입니까?
키 BINARY, 값 BINARY, 토픽 STRING, 파티션 LONG, 오프셋 LONG, 타임스탬프 LONG 5개의 고유 토픽이 수집되고 있습니다. "등록" 토픽에만 개인 식별 정보(PII)가 포함되어 있습니다. 회사는 PII에 대한 접근을 제한하고자 합니다. 또한 이 테이블에 PII가 포함된 레코드는 최초 수집 후 14일 동안만 보관하고자 합니다. 단, PII가 아닌 정보는 무기한 보관하고자 합니다.
다음 솔루션 중 요구 사항을 충족하는 것은 무엇입니까?
Databricks-Certified-Professional-Data-Engineer 문제 42
거의 실시간에 가까운 워크로드를 처리하기 위해 데이터 엔지니어는 Databricks Auto Loader의 스키마 감지 및 진화 기능을 활용하는 도우미 함수를 만들고 있습니다. 이 함수는 소스의 스키마를 직접 자동으로 감지하고, JSON 파일이 소스 디렉터리에 도착하는 대로 점진적으로 처리하며, 새 필드가 감지되면 테이블의 스키마를 자동으로 진화시킵니다.
해당 기능은 아래와 같이 빈칸으로 표시됩니다.

지정된 요구 사항을 충족시키기 위해 빈칸에 올바르게 들어갈 답은 무엇입니까?

해당 기능은 아래와 같이 빈칸으로 표시됩니다.

지정된 요구 사항을 충족시키기 위해 빈칸에 올바르게 들어갈 답은 무엇입니까?

Databricks-Certified-Professional-Data-Engineer 문제 43
Delta Lake 테이블의 하위 소비자들은 애플리케이션 성능에 영향을 미치는 데이터 품질 문제에 대해 불만을 제기해 왔습니다. 특히, activity_details 테이블의 잘못된 위도 및 경도 값으로 인해 다른 지리적 위치 프로세스를 사용할 수 없게 되었다고 불평했습니다.
주니어 엔지니어가 Delta Lake 테이블에 CHECKconstraints를 추가하기 위해 다음 코드를 작성했습니다.

선임 엔지니어는 위의 논리가 올바르고 위도와 경도에 대한 유효한 범위가 제공되지만, 코드를 실행하면 실패한다는 것을 확인했습니다.
이 실패의 원인을 설명하는 진술은 무엇입니까?
주니어 엔지니어가 Delta Lake 테이블에 CHECKconstraints를 추가하기 위해 다음 코드를 작성했습니다.

선임 엔지니어는 위의 논리가 올바르고 위도와 경도에 대한 유효한 범위가 제공되지만, 코드를 실행하면 실패한다는 것을 확인했습니다.
이 실패의 원인을 설명하는 진술은 무엇입니까?
Databricks-Certified-Professional-Data-Engineer 문제 44
현재 마케팅팀과 협력하여 광고 캠페인 분석을 위한 대시보드를 설정하고 있습니다. 마케팅팀은 대시보드를 얼마나 자주 새로 고쳐야 할지 확신하지 못하고 필요에 따라 수동으로 새로 고치기로 했습니다. 팀이 컴퓨팅을 사용하지 않을 때 전체 컴퓨팅 비용을 줄이기 위해 다음 중 어떤 조치를 취할 수 있을까요?
*Databricks는 최근 SQL Endpoint의 이름을 SQL Warehouses로 변경했습니다.
*Databricks는 최근 SQL Endpoint의 이름을 SQL Warehouses로 변경했습니다.
Databricks-Certified-Professional-Data-Engineer 문제 45
데이터 과학팀은 사용자 리뷰의 자유 형식 텍스트에 대한 쿼리를 가속화하는 데 도움을 요청했습니다.
현재 데이터는 아래 스키마를 사용하여 Parquet에 저장되어 있습니다.
item_id INT, user_id INT, review_id INT, rating FLOAT, review STRING
리뷰 칼럼에는 사용자가 남긴 리뷰 전문이 포함되어 있습니다. 구체적으로, 데이터 과학 팀은 이 분야에 30개의 키워드가 존재하는지 확인하고자 합니다.
한 주니어 데이터 엔지니어는 이 데이터를 Delta Lake로 변환하면 쿼리 성능이 향상될 것이라고 제안했습니다.
주니어 데이터 엔지니어의 제안에 대한 올바른 답변은 무엇입니까?
현재 데이터는 아래 스키마를 사용하여 Parquet에 저장되어 있습니다.
item_id INT, user_id INT, review_id INT, rating FLOAT, review STRING
리뷰 칼럼에는 사용자가 남긴 리뷰 전문이 포함되어 있습니다. 구체적으로, 데이터 과학 팀은 이 분야에 30개의 키워드가 존재하는지 확인하고자 합니다.
한 주니어 데이터 엔지니어는 이 데이터를 Delta Lake로 변환하면 쿼리 성능이 향상될 것이라고 제안했습니다.
주니어 데이터 엔지니어의 제안에 대한 올바른 답변은 무엇입니까?
