Professional-Data-Engineer 문제 6

Dataflow는 기본적으로 무제한 데이터 세트에 대해 다음 중 어떤 윈도우링 동작을 적용합니까?

Professional-Data-Engineer 문제 7

귀사는 매시간 20,000개의 파일을 생성합니다. 각 데이터 파일은 4KB 미만의 쉼표로 구분된 값(CSV) 형식입니다. 모든 파일은 처리 전에 Google Cloud Platform에 업로드되어야 합니다. 귀사 사이트의 Google Cloud 연결 지연 시간은 200ms이며, 인터넷 연결 대역폭은 50Mbps로 제한되어 있습니다. 현재 데이터 수집 지점으로 Google Compute Engine의 가상 머신에 보안 FTP(SFTP) 서버를 배포하여 사용하고 있습니다. 전용 머신에서 실행되는 로컬 SFTP 클라이언트를 통해 CSV 파일을 그대로 전송합니다. 목표는 전날 데이터를 기반으로 한 보고서를 경영진에게 제공하는 것입니다.
매일 오전 10시. 대역폭 사용량은 상당히 낮지만, 이 디자인은 현재 처리량을 겨우 따라잡고 있는 수준입니다.
회사에서는 계절적 요인으로 인해 향후 3개월 동안 파일 수가 두 배로 증가할 것으로 예상한다고 통보받았습니다. 어떤 조치 두 가지를 취해야 할까요? (두 가지를 선택하세요.)

Professional-Data-Engineer 문제 8

Google Cloud에서 Cloud Pub/Sub을 통해 Cloud Dataflow로 IoT 데이터를 스트리밍하는 새 파이프라인을 생성하고 있습니다. 데이터를 미리 보기하는 동안 데이터의 약 2%가 손상된 것으로 나타났습니다.
손상된 데이터를 걸러내려면 클라우드 데이터플로우 파이프라인을 수정해야 합니다. 어떻게 해야 할까요?

Professional-Data-Engineer 문제 9

MJTelco 사례 연구
회사 개요
MJTelco는 전 세계적으로 빠르게 성장하지만 서비스가 부족한 시장에 네트워크를 구축하려는 스타트업입니다.
이 회사는 혁신적인 광통신 하드웨어에 대한 특허를 보유하고 있습니다. 이러한 특허를 기반으로 저렴한 하드웨어로 안정적이고 고속의 기간망 링크를 다수 구축할 수 있습니다.
회사 개요
통신 업계의 경험 많은 임원들이 설립한 MJTelco는 원래 우주 통신 문제를 해결하기 위해 개발된 기술을 활용합니다. 이들의 운영에 있어 핵심적인 요소는 실시간 분석을 지원하고 머신 러닝을 통합하여 네트워크 토폴로지를 지속적으로 최적화하는 분산 데이터 인프라 구축입니다. 저렴한 하드웨어를 사용하는 덕분에 네트워크를 광범위하게 구축하여 지역 정세 변화가 위치 가용성과 비용에 미치는 영향을 고려할 수 있습니다.
그들의 경영 및 운영팀은 전 세계에 걸쳐 분포되어 있으며, 시스템 내에서 데이터 소비자와 공급자 간의 다대다 관계를 형성하고 있습니다. 신중한 검토 끝에, 그들은 퍼블릭 클라우드가 자신들의 요구 사항을 충족하는 데 가장 적합한 환경이라고 판단했습니다.
솔루션 컨셉
MJTelco는 자사 연구소에서 성공적인 개념 증명(PoC) 프로젝트를 진행하고 있습니다. 그들에게는 두 가지 주요 요구 사항이 있습니다.
* 5만 개 이상의 설치로 확장될 때 생성되는 훨씬 더 많은 데이터 흐름을 지원할 수 있도록 PoC를 확장하고 강화합니다.
* 토폴로지 정의를 제어하는 ​​데 사용하는 동적 모델을 검증하고 개선하기 위해 머신러닝 주기를 정교화합니다.
MJTelco는 실험 실행, 새로운 기능 배포 및 실제 고객 서비스 제공 요구 사항을 충족하기 위해 개발/테스트, 스테이징 및 프로덕션이라는 세 가지 별도의 운영 환경을 사용할 예정입니다.
비즈니스 요구사항
* 예측 불가능하고 분산된 통신 사용자 커뮤니티에서 필요할 때 필요한 곳에 리소스를 인스턴스화하여 최소한의 비용으로 프로덕션 환경을 확장할 수 있습니다.
* 자사 소유 데이터의 보안을 확보하여 최첨단 머신러닝 및 분석 기술을 보호합니다.
* 분산된 연구원들이 분석에 필요한 데이터에 안정적이고 시의적절하게 접근할 수 있도록 지원합니다.
* 고객에게 영향을 주지 않으면서 머신러닝 모델의 빠른 반복 개발을 지원하는 격리된 환경을 유지합니다.
기술 요구사항
원격 측정 데이터의 안전하고 효율적인 전송 및 저장을 보장합니다.
각각 여러 흐름을 지원하는 10,000~100,000개의 데이터 공급자를 수용하도록 인스턴스를 신속하게 확장할 수 있습니다.
최대 2년간의 데이터를 추적하는 데이터 테이블을 기반으로 분석 및 프레젠테이션을 지원하며, 하루 약 1억 건의 레코드를 처리할 수 있습니다. 원격 측정 흐름과 운영 학습 주기 모두에서 데이터 파이프라인 문제를 파악하는 데 중점을 두고 모니터링 인프라를 신속하게 반복적으로 개선할 수 있도록 지원합니다.
CEO 성명
당사의 비즈니스 모델은 특허, 분석 및 동적 머신 러닝에 기반합니다. 저렴한 하드웨어는 높은 신뢰성을 갖도록 구성되어 비용 경쟁력을 제공합니다. 신뢰성 및 용량 관련 약속을 충족하기 위해 대규모 분산 데이터 파이프라인을 신속하게 안정화해야 합니다.
CTO 성명서
퍼블릭 클라우드 서비스는 광고된 대로 작동해야 합니다. 확장성이 뛰어나고 데이터 보안을 유지할 수 있는 리소스가 필요합니다. 또한 데이터 과학자들이 모델을 면밀히 분석하고 신속하게 수정할 수 있는 환경도 필요합니다. 데이터 처리에 자동화 기술을 활용하기 때문에 개발 및 테스트 환경 역시 반복적인 작업 과정에서 원활하게 작동해야 합니다.
최고재무책임자(CFO) 성명서
프로젝트 규모가 너무 커서 데이터 및 분석에 필요한 하드웨어와 소프트웨어를 유지 관리하는 것이 어렵습니다. 또한, 수많은 데이터 피드를 모니터링할 운영팀을 구성할 여력도 없으므로 자동화 및 인프라에 의존해야 합니다. Google Cloud의 머신러닝 기능을 통해 양적 연구원들은 데이터 파이프라인 문제 해결이 아닌, 가치 창출에 더욱 집중할 수 있을 것입니다.
MJTelco는 하루에 기록적인 양의 스트림 데이터를 수집해야 하므로 Google BigQuery 사용 비용이 증가할 것을 우려하고 있습니다. MJTelco는 이러한 상황에 맞는 설계 솔루션을 요청했습니다. 이들은 tracking_table이라는 단일 대형 데이터 테이블을 필요로 하며, 매일 발생하는 이벤트에 대한 세밀한 분석을 수행하면서도 일일 쿼리 비용을 최소화하고자 합니다. 또한 스트리밍 데이터 수집 방식을 사용하고자 합니다. 어떤 솔루션을 설계해야 할까요?

Professional-Data-Engineer 문제 10

데이터 과학 팀은 클라우드 스토리지 버킷에 Apache Parquet 형식으로 저장된 대규모 데이터 세트에 대해 대화형 SQL 쿼리를 실행해야 합니다. 팀은 Apache Hive에 익숙하며 기존 HiveQL 쿼리를 활용하고자 합니다. 팀이 클라우드 스토리지의 데이터에 대해 직접 대화형 HiveQL 쿼리를 실행할 수 있는 환경을 제공해야 하며, 운영 오버헤드는 최소화해야 합니다. 어떻게 해야 할까요?