Professional-Data-Engineer 문제 56

분석을 위해 10PB 규모의 과거 제품 데이터를 제공하는 애플리케이션의 데이터 백엔드를 마이그레이션했습니다.
제품의 최종 상태 정보(약 10GB)만 API를 통해 다른 애플리케이션에 제공하면 됩니다. 분석 요구 사항과 초당 최대 1,000건의 쿼리(QPS) 처리, 1초 미만의 지연 시간을 지원하는 API 성능을 갖춘 비용 효율적인 영구 스토리지 솔루션을 선택해야 합니다. 어떤 솔루션을 선택해야 할까요?

Professional-Data-Engineer 문제 57

기존 초기화 작업을 사용하여 시작 시 Cloud Dataproc 클러스터 전체에 추가 종속성을 배포해야 합니다. 회사 보안 정책에 따라 Cloud Dataproc 노드는 인터넷에 액세스할 수 없으므로 공용 초기화 작업으로 리소스를 가져올 수 없습니다. 어떻게 해야 할까요?

Professional-Data-Engineer 문제 58

You work for an advertising company, and you've developed a Spark ML model to predict click-through rates at advertisement blocks. You've been developing everything at your on-premises data center, and now your company is migrating to Google Cloud. Your data center will be closing soon, so a rapid lift-and-shift migration is necessary. However, the data you've been using will be migrated to migrated to BigQuery. You periodically retrain your Spark ML models, so you need to migrate existing training pipelines to Google Cloud. What should you do?

Professional-Data-Engineer 문제 59

온프레미스에 있는 기존 데이터를 Google Cloud의 BigQuery로 로드하려고 합니다. 사용 사례에 따라 스트리밍 또는 배치 로드 방식을 선택할 수 있습니다. 또한 BigQuery에 로드하기 전에 일부 민감한 데이터를 마스킹해야 합니다. 이러한 작업을 프로그래밍 방식으로 수행하면서 비용을 최소화해야 합니다. 어떻게 해야 할까요?

Professional-Data-Engineer 문제 60

귀사의 분석팀은 몇 가지 지표를 기반으로 귀사와 재거래할 가능성이 가장 높은 고객을 예측하는 간단한 통계 모델을 구축하고자 합니다. 이 모델은 Apache Spark에서 실행하고 Google Cloud Storage에 저장된 데이터를 사용하며, 귀사에서는 Google Cloud Dataproc을 사용하여 작업을 실행할 것을 권장했습니다. 테스트 결과, 이 워크로드는 15개 노드로 구성된 클러스터에서 약 30분 정도 소요되며, 결과는 Google BigQuery에 출력됩니다. 이 워크로드는 매주 실행할 예정입니다. 비용 측면에서 클러스터를 최적화하려면 어떻게 해야 할까요?