Professional-Data-Engineer 문제 16
You architect a system to analyze seismic data. Your extract, transform, and load (ETL) process runs as a series of MapReduce jobs on an Apache Hadoop cluster. The ETL process takes days to process a data set because some steps are computationally expensive. Then you discover that a sensor calibration step has been omitted. How should you change your ETL process to carry out sensor calibration systematically in the future?
Professional-Data-Engineer 문제 17
전 세계 수백만 대의 IoT 센서 기기에서 데이터를 수집하여 BigQuery에 저장하고 있습니다. 데이터 접근 패턴은 location_id와 device_version별로 분류된 최근 데이터에 기반하며, 다음 쿼리를 사용합니다.

비용과 성능을 최적화하기 위해 쿼리를 어떻게 구성해야 할까요?

비용과 성능을 최적화하기 위해 쿼리를 어떻게 구성해야 할까요?
Professional-Data-Engineer 문제 18
Dataflow는 기본적으로 무제한 데이터 세트에 대해 다음 중 어떤 윈도우링 동작을 적용합니까?
Professional-Data-Engineer 문제 19
모바일 미디어 스트리밍 서비스에 사용할 새로운 스토리지 시스템을 구축하고 있습니다. Google Cloud Datastore가 가장 적합하다고 판단했습니다. 여러 속성을 가진 엔티티가 있는데, 일부 속성은 여러 값을 가질 수 있습니다. 예를 들어, '영화' 엔티티에서 '배우'와 '태그' 속성은 여러 값을 가질 수 있지만 '개봉일' 속성은 단일 값을 가집니다. 일반적인 쿼리는 '배우=<배우 이름>'인 모든 영화를 개봉일 순으로 정렬하거나, '태그=코미디'인 모든 영화를 개봉일 순으로 정렬하는 것입니다. 이러한 쿼리에서 인덱스 개수가 기하급수적으로 증가하는 것을 어떻게 방지할 수 있을까요?
Professional-Data-Engineer 문제 20
다음 중 파티션된 테이블에 데이터를 넣는 데 지원되지 않는 방법은 무엇입니까?
