Professional-Data-Engineer 문제 101

소셜 미디어 게시물을 분당 10,000개씩 거의 실시간으로 Google BigQuery에 저장하고 분석해야 합니다. 처음에는 개별 게시물을 스트리밍 방식으로 삽입하도록 애플리케이션을 설계했습니다. 또한, 스트리밍 삽입 직후 데이터 집계를 수행하도록 했습니다. 그런데 스트리밍 삽입 후 쿼리에서 데이터 일관성이 부족하고, 쿼리 결과 보고서에서 처리 중인 데이터가 누락될 수 있음을 발견했습니다. 애플리케이션 설계를 어떻게 수정해야 할까요?

Professional-Data-Engineer 문제 102

머신러닝 팀이 BigQueryML을 사용하여 모델을 학습시키는 데 사용할 데이터를 준비하고 있습니다. 팀은 부동산의 평방피트당 가격을 예측하고자 합니다. 학습 데이터에는 가격 열과 면적(평방피트) 열이 있습니다. 또한, 또 다른 특징 열이 있습니다.
'feature1'에는 데이터 누락으로 인해 null 값이 포함되어 있습니다. 더 많은 데이터 포인트를 유지하기 위해 null 값을 0으로 바꾸려고 합니다. 어떤 쿼리를 사용해야 할까요?

Professional-Data-Engineer 문제 103

Cloud Pub/Sub의 데이터를 BigQuery의 정적 참조 데이터로 보강하는 Apache Beam 파이프라인을 설계하고 있습니다. 참조 데이터는 단일 워커의 메모리에 들어갈 만큼 크기가 작습니다. 파이프라인은 보강된 결과를 분석을 위해 BigQuery에 기록해야 합니다. 이 파이프라인에 어떤 작업 유형과 변환을 사용해야 할까요?

Professional-Data-Engineer 문제 104

MJTelco 사례 연구
회사 개요
MJTelco는 전 세계적으로 빠르게 성장하지만 통신 서비스가 부족한 시장에 네트워크를 구축하려는 스타트업입니다. 이 회사는 혁신적인 광통신 하드웨어 관련 특허를 보유하고 있으며, 이러한 특허를 기반으로 저렴한 하드웨어로 안정적이고 고속의 기간망 링크를 다수 구축할 수 있습니다.
회사 개요
통신 업계의 경험 많은 임원들이 설립한 MJTelco는 원래 우주 통신 문제를 해결하기 위해 개발된 기술을 활용합니다. 이들의 운영에 있어 핵심적인 요소는 실시간 분석을 지원하고 머신 러닝을 통합하여 네트워크 토폴로지를 지속적으로 최적화하는 분산 데이터 인프라 구축입니다. 저렴한 하드웨어를 사용하는 덕분에 네트워크를 광범위하게 구축하여 지역 정세 변화가 위치 가용성과 비용에 미치는 영향을 고려할 수 있습니다.
그들의 경영 및 운영팀은 전 세계에 걸쳐 분포되어 있으며, 시스템 내에서 데이터 소비자와 공급자 간의 다대다 관계를 형성하고 있습니다. 신중한 검토 끝에, 그들은 퍼블릭 클라우드가 자신들의 요구 사항을 충족하는 데 가장 적합한 환경이라고 판단했습니다.
솔루션 컨셉
MJTelco는 자사 연구소에서 성공적인 개념 증명(PoC) 프로젝트를 진행하고 있습니다. 그들에게는 두 가지 주요 요구 사항이 있습니다.
PoC를 확장하고 강화하여 생산량 증가에 따라 발생하는 훨씬 더 많은 데이터 흐름을 지원하도록 하세요.

5만 건 이상의 설치 건수.
머신러닝 주기를 개선하여 제어에 사용하는 동적 모델을 검증하고 향상시킵니다.

위상 정의.
MJTelco는 개발/테스트, 스테이징, 프로덕션의 세 가지 운영 환경을 사용할 예정입니다.
- 실험 실행, 새로운 기능 배포 및 실제 고객 서비스 제공에 필요한 요구 사항을 충족하기 위해서입니다.
비즈니스 요구사항
최소한의 비용으로 프로덕션 환경을 확장하고, 필요할 때 필요한 곳에서 리소스를 인스턴스화하세요.

예측 불가능하고 분산된 통신 사용자 커뮤니티에 필요합니다.
최첨단 머신러닝 및 분석 기술을 보호하기 위해 고객사의 독점 데이터 보안을 확보하십시오.

분산된 연구원들이 분석에 필요한 데이터에 안정적이고 시의적절하게 접근할 수 있도록 지원합니다.

머신러닝 모델의 빠른 반복을 지원하는 격리된 환경을 유지합니다.

고객에게 영향을 미칩니다.
기술 요구사항
원격 측정 데이터의 안전하고 효율적인 전송 및 저장을 보장합니다.

10,000개에서 100,000개에 이르는 데이터 공급자와 다양한 흐름을 지원하도록 인스턴스를 신속하게 확장합니다.

각.
최대 2년치의 데이터를 저장하는 데이터 테이블을 기반으로 분석 및 프레젠테이션을 허용합니다.

100m 기록/일
데이터 파이프라인 문제 인식을 중심으로 모니터링 인프라의 신속한 반복 구축을 지원합니다.

원격 측정 흐름과 프로덕션 학습 주기 모두에서 그렇습니다.
CEO 성명
당사의 비즈니스 모델은 특허, 분석 및 동적 머신 러닝에 기반합니다. 저렴한 하드웨어는 높은 신뢰성을 갖도록 구성되어 비용 경쟁력을 제공합니다. 신뢰성 및 용량 관련 약속을 충족하기 위해 대규모 분산 데이터 파이프라인을 신속하게 안정화해야 합니다.
CTO 성명서
퍼블릭 클라우드 서비스는 광고된 대로 작동해야 합니다. 확장성이 뛰어나고 데이터 보안을 유지할 수 있는 리소스가 필요합니다. 또한 데이터 과학자들이 모델을 면밀히 분석하고 신속하게 수정할 수 있는 환경도 필요합니다. 데이터 처리에 자동화 기술을 활용하기 때문에 개발 및 테스트 환경 역시 반복적인 작업 과정에서 원활하게 작동해야 합니다.
최고재무책임자(CFO) 성명서
프로젝트 규모가 너무 커서 데이터 및 분석에 필요한 하드웨어와 소프트웨어를 유지 관리하기 어렵습니다.
또한, 수많은 데이터 피드를 모니터링할 운영팀을 구성할 여력이 없으므로 자동화 및 인프라에 의존할 것입니다. Google Cloud의 머신 러닝을 통해 당사의 정량 분석 ​​연구원들은 데이터 파이프라인 문제 해결이 아닌, 가치 창출에 더욱 집중할 수 있을 것입니다.
다음과 같은 요구 사항을 충족하는 운영팀용 시각화 자료를 작성해야 합니다.
보고서에는 최근 6주 동안의 5만 개 설치 장소 전체의 원격 측정 데이터가 포함되어야 합니다.

(1분마다 한 번씩 샘플링).
보고서는 실시간 데이터보다 3시간 이상 지연되어서는 안 됩니다.

실행 가능한 보고서에는 최적화되지 않은 링크만 표시되어야 합니다.

최적화가 덜 된 링크는 대부분 상단으로 정렬되어야 합니다.

최적화되지 않은 링크는 지역별로 그룹화하고 필터링할 수 있습니다.

사용자가 보고서를 불러오는 데 걸리는 응답 시간은 5초 미만이어야 합니다.

어떤 접근 방식이 요구 사항을 충족합니까?

Professional-Data-Engineer 문제 105

Google Stackdriver Logging을 사용하여 Google BigQuery 사용량을 모니터링하려고 합니다. 삽입 작업을 통해 특정 테이블에 새 데이터가 추가될 때 모니터링 도구로 즉시 알림이 전송되도록 설정해야 하지만, 다른 테이블에 대한 알림은 받고 싶지 않습니다. 어떻게 해야 할까요?