Databricks-Certified-Professional-Data-Engineer 문제 106
머신러닝 팀은 Lakehouse의 Delta Lake 테이블인 customer_parsams를 사용하여 이탈 예측을 수행합니다. 이 테이블에는 여러 상위 소스에서 추출한 고객 정보가 포함되어 있습니다.
현재 데이터 엔지니어링 팀은 상류 데이터 소스에서 파생된 현재 유효한 값으로 테이블을 덮어쓰는 방식으로 매일 밤 이 테이블을 채웁니다.
각 업데이트가 성공한 직후, 데이터 엔지니어 팀은 테이블의 새 버전과 이전 버전 간의 차이점을 확인하고 싶어합니다.
현재 구현 방식을 고려할 때 어떤 방법을 사용할 수 있나요?
현재 데이터 엔지니어링 팀은 상류 데이터 소스에서 파생된 현재 유효한 값으로 테이블을 덮어쓰는 방식으로 매일 밤 이 테이블을 채웁니다.
각 업데이트가 성공한 직후, 데이터 엔지니어 팀은 테이블의 새 버전과 이전 버전 간의 차이점을 확인하고 싶어합니다.
현재 구현 방식을 고려할 때 어떤 방법을 사용할 수 있나요?
Databricks-Certified-Professional-Data-Engineer 문제 107
프로덕션 워크로드는 외부 변경 데이터 캡처(CDC) 피드의 업데이트를 Delta Lake 테이블에 상시 활성화된 구조화된 스트림 작업으로 증분적으로 적용합니다. 이 테이블의 데이터가 처음 마이그레이션될 때 OPTIMIZE가 실행되었고 대부분의 데이터 파일 크기가 1GB로 조정되었습니다. 스트리밍 프로덕션 작업에는 자동 최적화와 자동 압축이 모두 활성화되었습니다. 최근 데이터 파일 검토 결과, 테이블의 각 파티션에 최소 1GB의 데이터가 포함되어 있고 전체 테이블 크기가 10TB를 초과하지만 대부분의 데이터 파일은 64MB 미만인 것으로 나타났습니다.
다음 중 어떤 이유가 파일 크기가 작아지는 이유를 설명할 수 있을까요?
다음 중 어떤 이유가 파일 크기가 작아지는 이유를 설명할 수 있을까요?
