Databricks-Certified-Professional-Data-Engineer 문제 191
Databricks에서 가장 일반적인 데이터 위치 두 가지는 DBFS 루트 스토리지와 dbutils.fs.mount()를 사용하여 마운트된 외부 객체 스토리지입니다.
다음 중 옳은 설명은 무엇입니까?
다음 중 옳은 설명은 무엇입니까?
Databricks-Certified-Professional-Data-Engineer 문제 192
데이터 엔지니어가 쿼리의 일부로 두 테이블을 수평적으로 결합하려고 합니다. 공유 테이블을 사용하려고 합니다.
해당 열을 키 열로 지정하고, 키 열의 값이 특정 값인 행만 쿼리 결과에 포함되도록 하려는 것입니다.
두 표 모두에 존재합니다.
다음 SQL 명령 중 어떤 명령을 사용하여 이 작업을 수행할 수 있습니까?
해당 열을 키 열로 지정하고, 키 열의 값이 특정 값인 행만 쿼리 결과에 포함되도록 하려는 것입니다.
두 표 모두에 존재합니다.
다음 SQL 명령 중 어떤 명령을 사용하여 이 작업을 수행할 수 있습니까?
Databricks-Certified-Professional-Data-Engineer 문제 193
데이터 파이프라인은 구조화된 스트리밍 방식을 사용하여 Kafka에서 Delta Lake로 데이터를 수집합니다. 데이터는 Bronze 테이블에 저장되며, Kafka에서 생성된 타임스탬프, 키, 값이 포함됩니다. 파이프라인 배포 후 3개월이 지난 시점에서 데이터 엔지니어링 팀은 특정 시간대에 지연 현상이 발생하는 것을 발견했습니다.
선임 데이터 엔지니어가 Delta 테이블의 스키마와 데이터 수집 로직을 업데이트하여 Apache Spark에서 기록한 현재 타임스탬프와 Kafka 토픽 및 파티션 정보를 포함시켰습니다. 팀은 추가된 메타데이터 필드를 활용하여 일시적인 처리 지연 현상을 진단할 계획입니다.
이 문제를 진단하는 과정에서 팀은 어떤 제약에 직면하게 될까요?
선임 데이터 엔지니어가 Delta 테이블의 스키마와 데이터 수집 로직을 업데이트하여 Apache Spark에서 기록한 현재 타임스탬프와 Kafka 토픽 및 파티션 정보를 포함시켰습니다. 팀은 추가된 메타데이터 필드를 활용하여 일시적인 처리 지연 현상을 진단할 계획입니다.
이 문제를 진단하는 과정에서 팀은 어떤 제약에 직면하게 될까요?
Databricks-Certified-Professional-Data-Engineer 문제 194
Delta Live Table 파이프라인에는 STREAMING LIVE TABLE을 사용하여 정의된 두 개의 데이터 세트가 포함됩니다.
LIVE TABLE을 사용하여 Delta Lake 테이블 소스에 대해 세 개의 데이터 세트가 정의됩니다. 테이블은 다음과 같이 구성됩니다.
트리거 파이프라인 모드를 사용하여 개발 모드에서 실행합니다.
이전에 처리되지 않은 데이터가 존재하고 모든 정의가 유효하다고 가정할 때, 처리 후 예상되는 결과는 무엇입니까?
파이프라인을 업데이트하려면 '시작'을 클릭하시겠습니까?
LIVE TABLE을 사용하여 Delta Lake 테이블 소스에 대해 세 개의 데이터 세트가 정의됩니다. 테이블은 다음과 같이 구성됩니다.
트리거 파이프라인 모드를 사용하여 개발 모드에서 실행합니다.
이전에 처리되지 않은 데이터가 존재하고 모든 정의가 유효하다고 가정할 때, 처리 후 예상되는 결과는 무엇입니까?
파이프라인을 업데이트하려면 '시작'을 클릭하시겠습니까?
Databricks-Certified-Professional-Data-Engineer 문제 195
스트림 데이터를 쓸 때 전체 모드를 사용하면 대상 테이블에 어떤 영향을 미칩니까?
