Professional-Data-Engineer 문제 106
회사의 온프레미스 Apache Hadoop 서버 수명이 거의 다 되었고 IT 부서에서 클러스터를 Google Cloud Dataproc으로 마이그레이션하기로 결정했습니다. 클러스터의 유사 마이그레이션에는 노드당 50TB의 Google 영구 디스크가 필요합니다. CIO는 많은 블록 스토리지를 사용하는 데 드는 비용을 걱정하고 있습니다. 마이그레이션의 스토리지 비용을 최소화하려고 합니다. 당신은 무엇을해야합니까?
Professional-Data-Engineer 문제 107
Google Cloud에서 데이터 파이프라인을 구축 중입니다. 기계 학습 프로세스를 위해 캐주얼한 방법을 사용하여 데이터를 준비해야 합니다. 로지스틱 회귀 모델을 지원하려고 합니다. 또한 실제 값으로 유지되어야 하고 제거할 수 없는 null 값을 모니터링하고 조정해야 합니다. 당신은 무엇을해야합니까?
Professional-Data-Engineer 문제 108
미디어 스트리밍 서비스인 모바일 애플리케이션을 위한 새 스토리지 시스템을 배포하고 있습니다.
Google Cloud Datastore가 가장 적합하다고 결정했습니다. 여러 속성을 가진 엔터티가 있으며 일부는
여러 값을 가질 수 있습니다. 예를 들어, 엔티티 'Movie'에서 'actors' 속성과
속성 '태그'에는 여러 값이 있지만 속성 '출시 날짜'에는 없습니다. 일반적인 쿼리
Actor=<actorname>이(가) 있는 모든 영화를 요청합니다. date_released 또는 다음이 포함된 모든 영화
tag=코미디는 date_released 기준으로 주문했습니다. 조합 폭발을 피하려면 어떻게 해야 합니까?
인덱스의 수?
Google Cloud Datastore가 가장 적합하다고 결정했습니다. 여러 속성을 가진 엔터티가 있으며 일부는
여러 값을 가질 수 있습니다. 예를 들어, 엔티티 'Movie'에서 'actors' 속성과
속성 '태그'에는 여러 값이 있지만 속성 '출시 날짜'에는 없습니다. 일반적인 쿼리
Actor=<actorname>이(가) 있는 모든 영화를 요청합니다. date_released 또는 다음이 포함된 모든 영화
tag=코미디는 date_released 기준으로 주문했습니다. 조합 폭발을 피하려면 어떻게 해야 합니까?
인덱스의 수?
Professional-Data-Engineer 문제 109
Google Cloud Pub/Sub 구독을 소스로 사용하여 실행 중인 Google Cloud Dataflow 스트리밍 파이프라인이 있습니다. 새 Cloud Dataflow 파이프라인을 현재 버전과 호환되지 않도록 하는 코드를 업데이트해야 합니다. 이 업데이트를 수행할 때 데이터가 손실되는 것을 원하지 않습니다. 당신은 무엇을해야합니까?
Professional-Data-Engineer 문제 110
수백만 개의 사물 인터넷(IoT) 장치에서 제출된 원격 측정 데이터를 처리하기 위해 NoSQL 데이터베이스를 선택하고 있습니다. 데이터의 양은 매년 100TB로 증가하고 있으며 각 데이터 항목은 약
100 속성. 데이터 처리 파이프라인에는 원자성, 일관성, 격리 및 내구성(ACID)이 필요하지 않습니다. 그러나 고가용성과 짧은 대기 시간이 필요합니다.
개별 필드에 대해 쿼리하여 데이터를 분석해야 합니다. 어떤 세 가지 데이터베이스가 귀하의 요구 사항을 충족합니까? (3개를 선택하세요.)
100 속성. 데이터 처리 파이프라인에는 원자성, 일관성, 격리 및 내구성(ACID)이 필요하지 않습니다. 그러나 고가용성과 짧은 대기 시간이 필요합니다.
개별 필드에 대해 쿼리하여 데이터를 분석해야 합니다. 어떤 세 가지 데이터베이스가 귀하의 요구 사항을 충족합니까? (3개를 선택하세요.)
