Professional-Data-Engineer 문제 186

모바일 미디어 스트리밍 서비스에 사용할 새로운 스토리지 시스템을 구축하고 있습니다. Google Cloud Datastore가 가장 적합하다고 판단했습니다. 여러 속성을 가진 엔티티가 있는데, 일부 속성은 여러 값을 가질 수 있습니다. 예를 들어, '영화' 엔티티에서 '배우'와 '태그' 속성은 여러 값을 가질 수 있지만 '개봉일' 속성은 단일 값을 가집니다. 일반적인 쿼리는 '배우=<배우 이름>'인 모든 영화를 개봉일 순으로 정렬하거나 '코미디' 태그가 있는 모든 영화를 개봉일 순으로 정렬하는 것입니다. 이러한 상황에서 인덱스 수가 기하급수적으로 증가하는 것을 어떻게 방지할 수 있을까요?

Professional-Data-Engineer 문제 187

BigQuery를 사용하여 일별 판매량 데이터가 포함된 지역별 데이터셋을 사용하고 있습니다. 이 테이블은 하루에 여러 번 업데이트됩니다. 지역 장애 발생 시에도 24시간 이내의 복구 시점 목표(RPO)로 판매량 테이블을 보호해야 하며, 동시에 비용은 최소화해야 합니다. 어떻게 해야 할까요?

Professional-Data-Engineer 문제 188

Cloud Bigtable용 _________을 사용하면 Cloud Dataflow 파이프라인에서 Cloud Bigtable을 사용할 수 있습니다.

Professional-Data-Engineer 문제 189

귀사는 새로운 실시간 데이터 웨어하우스를 구축 중이며 Google BigQuery 스트리밍 삽입 기능을 사용할 예정입니다. 데이터가 한 번만 전송된다는 보장은 없지만, 각 행에는 고유 ID와 이벤트 타임스탬프가 있습니다. 대화형 쿼리를 통해 데이터를 조회할 때 중복 데이터가 포함되지 않도록 하려면 어떤 쿼리 유형을 사용해야 할까요?

Professional-Data-Engineer 문제 190

Bigtable을 실시간 애플리케이션에 사용하고 있으며, 읽기 및 쓰기 작업이 혼합된 높은 부하를 처리하고 있습니다. 최근 추가적인 사용 사례를 파악하여 전체 데이터베이스에 걸쳐 특정 통계를 계산하는 분석 작업을 시간 단위로 수행해야 합니다. 운영 애플리케이션의 안정성과 분석 작업 부하 모두를 보장해야 합니다.
어떻게 해야 할까요?