Databricks-Certified-Professional-Data-Engineer-KR 문제 26

데이터 엔지니어가 데이터브릭스에서 파이프라인을 설계하고 있는데, 이 파이프라인은 데이터 도착이 지연되는 경우가 흔한 카프카 스트림의 레코드를 처리합니다.
데이터 엔지니어는 어떤 접근 방식을 사용해야 할까요?

Databricks-Certified-Professional-Data-Engineer-KR 문제 27

데이터 조직에서 Unity Catalog 기반 워크스페이스에서 선별된 데이터 세트를 안전하게 배포하기 위해 Delta Sharing을 도입했습니다. 데이터 엔지니어링 팀은 대규모 Delta 테이블을 Databricks 간 내부 공유와 Open Sharing을 통해 외부로 공유하여 집계 보고서를 생성합니다. 테스트 과정에서 접근 제어, 데이터 업데이트 가시성, 공유 가능한 객체 유형과 관련된 문제에 직면했습니다.
Databricks 간 공유 또는 오픈 공유와 함께 Delta Sharing 프로토콜 또는 구현을 사용할 때의 한계점은 무엇입니까?

Databricks-Certified-Professional-Data-Engineer-KR 문제 28

데이터 엔지니어 팀은 Databricks에서 기본적으로 지원하지 않는 외부 데이터베이스에 대한 연결을 구성하는 작업을 맡았습니다. 해당 외부 데이터베이스는 이미 그룹 멤버십을 기반으로 데이터 보안이 구성되어 있습니다. 이러한 그룹은 회사 내 다양한 ​​팀을 대표하는 Databricks에 이미 생성된 사용자 그룹에 직접 매핑됩니다.
외부 데이터베이스의 각 그룹에 대해 새 로그인 자격 증명이 생성되었습니다. Databricks 유틸리티 비밀 모듈을 사용하여 이러한 자격 증명을 Databricks 사용자에게 제공할 수 있습니다.
외부 데이터베이스에 모든 자격 증명이 올바르게 구성되어 있고 Databricks에 그룹 멤버십이 제대로 구성되어 있다고 가정할 때, 팀에게 이러한 자격 증명을 사용하는 데 필요한 최소한의 액세스 권한을 부여하는 방법을 설명하는 문장은 무엇입니까?

Databricks-Certified-Professional-Data-Engineer-KR 문제 29

데이터 엔지니어가 의료비 청구 데이터를 처리하기 위해 Lakeflow Declarative Pipelines 파이프라인을 구축하고 있습니다. 메타데이터 JSON 파일에는 다음을 포함한 여러 테이블에 대한 데이터 품질 규칙이 정의되어 있습니다.
{
" claims " : [
{ " name " : " valid_patient_id " , " constraint " : " patient_id IS NOT NULL " },
{ " name " : " non_negative_amount " , " constraint " : " claim_amount > = 0 " }
]
}
파이프라인은 규칙을 하드코딩하지 않고 이러한 규칙을 클레임 테이블에 동적으로 적용해야 합니다.
데이터 엔지니어는 어떻게 이를 달성해야 할까요?

Databricks-Certified-Professional-Data-Engineer-KR 문제 30

프로덕션 환경에 배포된 구조화된 스트리밍 작업이 하루 중 사용량이 많은 시간대에 지연 현상을 보이고 있습니다. 현재 정상적인 실행 시에는 각 마이크로배치 데이터 처리 시간이 3초 미만입니다. 하지만 사용량이 많은 시간대에는 각 마이크로배치의 처리 시간이 매우 불규칙해지며, 때로는 3초를 초과하기도 합니다.
30초. 스트리밍 쓰기는 현재 10초의 트리거 간격으로 구성되어 있습니다.
다른 모든 변수를 일정하게 유지하고 레코드를 10초 이내에 처리해야 한다고 가정할 때, 어떤 조정이 요구 사항을 충족할까요?