Databricks-Certified-Professional-Data-Engineer-KR 문제 56
시간 단위 배치 작업이 구성되어 클라우드 객체 스토리지 컨테이너에서 데이터 파일을 수집합니다. 각 배치는 해당 시간 동안 소스 시스템에서 생성된 모든 레코드를 나타냅니다. 이러한 레코드를 레이크하우스에 처리하는 배치 작업은 지연된 데이터가 누락되지 않도록 충분한 시간 간격을 두고 실행됩니다. user_id 필드는 데이터의 고유 키이며, 다음과 같은 스키마를 갖습니다.
user_id는 BIGINT, username은 STRING, user_utc는 STRING, user_region은 STRING, last_login은 BIGINT, auto_pay는 BOOLEAN, last_updated는 BIGINT입니다. 모든 새 레코드는 account_history라는 테이블에 입력되며, 이 테이블은 소스와 동일한 스키마에 모든 데이터의 전체 기록을 유지합니다. 시스템의 다음 테이블은 account_current이며, 각 고유 user_id에 대한 최신 값을 나타내는 Type 1 테이블로 구현됩니다.
수백만 개의 사용자 계정과 시간당 수만 건의 레코드가 처리된다고 가정할 때, 매시간 배치 작업의 일부로 설명된 account_current 테이블을 효율적으로 업데이트하는 데 사용할 수 있는 구현 방법은 무엇입니까?
user_id는 BIGINT, username은 STRING, user_utc는 STRING, user_region은 STRING, last_login은 BIGINT, auto_pay는 BOOLEAN, last_updated는 BIGINT입니다. 모든 새 레코드는 account_history라는 테이블에 입력되며, 이 테이블은 소스와 동일한 스키마에 모든 데이터의 전체 기록을 유지합니다. 시스템의 다음 테이블은 account_current이며, 각 고유 user_id에 대한 최신 값을 나타내는 Type 1 테이블로 구현됩니다.
수백만 개의 사용자 계정과 시간당 수만 건의 레코드가 처리된다고 가정할 때, 매시간 배치 작업의 일부로 설명된 account_current 테이블을 효율적으로 업데이트하는 데 사용할 수 있는 구현 방법은 무엇입니까?
Databricks-Certified-Professional-Data-Engineer-KR 문제 57
저장 및 컴퓨팅 비용을 줄이기 위해 데이터 엔지니어링 팀은 비즈니스 인텔리전스 대시보드, 고객 대면 애플리케이션, 프로덕션 머신 러닝 모델 및 임시 분석 쿼리에서 활용되는 일련의 집계 테이블을 관리하는 임무를 맡았습니다.
데이터 엔지니어링 팀은 고객 대면 애플리케이션에서 새로운 요구 사항이 발생했음을 알게 되었습니다. 이 애플리케이션은 해당 팀이 전적으로 관리하는 유일한 하위 워크로드입니다. 따라서 조직 전체의 여러 팀에서 사용하는 집계 테이블의 필드 이름을 변경하고 새 필드를 추가해야 합니다.
관리해야 할 테이블 수를 늘리지 않으면서 조직 내 다른 팀에 미치는 영향을 최소화하는 해결책은 무엇입니까?
데이터 엔지니어링 팀은 고객 대면 애플리케이션에서 새로운 요구 사항이 발생했음을 알게 되었습니다. 이 애플리케이션은 해당 팀이 전적으로 관리하는 유일한 하위 워크로드입니다. 따라서 조직 전체의 여러 팀에서 사용하는 집계 테이블의 필드 이름을 변경하고 새 필드를 추가해야 합니다.
관리해야 할 테이블 수를 늘리지 않으면서 조직 내 다른 팀에 미치는 영향을 최소화하는 해결책은 무엇입니까?
Databricks-Certified-Professional-Data-Engineer-KR 문제 58
DevOps 팀은 Jobs UI를 사용하여 매일 실행되도록 예약된 노트북 모음으로 프로덕션 워크로드를 구성했습니다. 새로 합류한 데이터 엔지니어가 프로덕션 로직을 검토하기 위해 이러한 노트북 중 하나에 대한 액세스 권한을 요청했습니다.
운영 중인 코드나 데이터가 실수로 변경되는 것을 방지하면서 사용자에게 부여할 수 있는 최대 노트북 권한은 얼마입니까?
운영 중인 코드나 데이터가 실수로 변경되는 것을 방지하면서 사용자에게 부여할 수 있는 최대 노트북 권한은 얼마입니까?
Databricks-Certified-Professional-Data-Engineer-KR 문제 59
Databricks Utilities Secrets 모듈은 민감한 자격 증명을 저장하고 실수로 평문으로 표시되지 않도록 방지하는 도구를 제공하지만, 사용자는 여기에 어떤 자격 증명을 저장하는지, 그리고 어떤 사용자가 이러한 비밀 정보를 사용할 수 있는 권한을 가지고 있는지에 대해 여전히 주의해야 합니다.
다음 중 Databricks Secrets의 한계를 설명하는 문장은 무엇입니까?
다음 중 Databricks Secrets의 한계를 설명하는 문장은 무엇입니까?
Databricks-Certified-Professional-Data-Engineer-KR 문제 60
데이터 엔지니어가 Databricks 간 데이터 전송 시나리오에서 읽기 성능을 최적화하기 위해 델타 공유(Delta Sharing)를 구성하고 있습니다. 수신 측에서는 공유된 판매 데이터에 대해 시간 경과에 따른 쿼리와 스트리밍 읽기를 수행해야 합니다.
어떤 구성이 이러한 기능들을 활성화하면서 최적의 성능을 제공할까요?
어떤 구성이 이러한 기능들을 활성화하면서 최적의 성능을 제공할까요?
