Professional-Data-Engineer 문제 181

귀사는 공장 현장의 센서 데이터를 실시간으로 Bigtable에 스트리밍하고 있는데, 성능이 매우 저조한 문제를 겪고 있습니다. 실시간 대시보드를 생성하는 쿼리에서 Bigtable의 성능을 개선하려면 행 키를 어떻게 재설계해야 할까요?

Professional-Data-Engineer 문제 182

MJTelco 사례 연구
회사 개요
MJTelco는 전 세계적으로 빠르게 성장하지만 통신 서비스가 부족한 시장에 네트워크를 구축하려는 스타트업입니다. 이 회사는 혁신적인 광통신 하드웨어 관련 특허를 보유하고 있으며, 이러한 특허를 기반으로 저렴한 하드웨어로 안정적이고 고속의 기간망 링크를 다수 구축할 수 있습니다.
회사 개요
통신 업계의 경험 많은 임원들이 설립한 MJTelco는 원래 우주 통신 문제를 해결하기 위해 개발된 기술을 활용합니다. 이들의 운영에 있어 핵심적인 요소는 실시간 분석을 지원하고 머신 러닝을 통합하여 네트워크 토폴로지를 지속적으로 최적화하는 분산 데이터 인프라 구축입니다. 저렴한 하드웨어를 사용하는 덕분에 네트워크를 광범위하게 구축하여 지역 정세 변화가 위치 가용성과 비용에 미치는 영향을 고려할 수 있습니다.
그들의 경영 및 운영팀은 전 세계에 걸쳐 분포되어 있으며, 시스템 내에서 데이터 소비자와 공급자 간의 다대다 관계를 형성하고 있습니다. 신중한 검토 끝에, 그들은 퍼블릭 클라우드가 자신들의 요구 사항을 충족하는 데 가장 적합한 환경이라고 판단했습니다.
솔루션 컨셉
MJTelco는 자사 연구소에서 성공적인 개념 증명(PoC) 프로젝트를 진행하고 있습니다. 그들에게는 두 가지 주요 요구 사항이 있습니다.
PoC를 확장하고 강화하여 생산량 증가에 따라 발생하는 훨씬 더 많은 데이터 흐름을 지원하도록 하세요.

5만 건 이상의 설치 건수.
머신러닝 주기를 개선하여 제어에 사용하는 동적 모델을 검증하고 향상시킵니다.

위상 정의.
MJTelco는 개발/테스트, 스테이징, 프로덕션의 세 가지 운영 환경을 사용할 예정입니다.
- 실험 실행, 새로운 기능 배포 및 실제 고객 서비스 제공에 필요한 요구 사항을 충족하기 위해서입니다.
비즈니스 요구사항
최소한의 비용으로 프로덕션 환경을 확장하고, 필요할 때 필요한 곳에서 리소스를 인스턴스화하세요.

예측 불가능하고 분산된 통신 사용자 커뮤니티에 필요합니다.
최첨단 머신러닝 및 분석 기술을 보호하기 위해 고객사의 독점 데이터 보안을 확보하십시오.

분산된 연구원들이 분석에 필요한 데이터에 안정적이고 시의적절하게 접근할 수 있도록 지원합니다.

머신러닝 모델의 빠른 반복을 지원하는 격리된 환경을 유지합니다.

고객에게 영향을 미칩니다.
기술 요구사항
원격 측정 데이터의 안전하고 효율적인 전송 및 저장을 보장합니다.
각각 여러 흐름을 지원하는 10,000~100,000개의 데이터 공급자를 수용하도록 인스턴스를 신속하게 확장할 수 있습니다.
최대 2년치의 데이터를 저장하는 데이터 테이블을 기반으로 분석 및 프레젠테이션을 허용합니다.
100m 기록/일
원격 측정 흐름과 운영 학습 주기 모두에서 데이터 파이프라인 문제를 파악하는 데 중점을 둔 모니터링 인프라의 신속한 반복 개발을 지원합니다.
CEO 성명
당사의 비즈니스 모델은 특허, 분석 및 동적 머신 러닝에 기반합니다. 저렴한 하드웨어는 높은 신뢰성을 갖도록 구성되어 비용 경쟁력을 제공합니다. 신뢰성 및 용량 관련 약속을 충족하기 위해 대규모 분산 데이터 파이프라인을 신속하게 안정화해야 합니다.
CTO 성명서
퍼블릭 클라우드 서비스는 광고된 대로 작동해야 합니다. 확장성이 뛰어나고 데이터 보안을 유지할 수 있는 리소스가 필요합니다. 또한 데이터 과학자들이 모델을 면밀히 분석하고 신속하게 수정할 수 있는 환경도 필요합니다. 데이터 처리에 자동화 기술을 활용하기 때문에 개발 및 테스트 환경 역시 반복적인 작업 과정에서 원활하게 작동해야 합니다.
최고재무책임자(CFO) 성명서
프로젝트 규모가 너무 커서 데이터 및 분석에 필요한 하드웨어와 소프트웨어를 유지 관리하기 어렵습니다.
또한, 수많은 데이터 피드를 모니터링할 운영팀을 구성할 여력이 없으므로 자동화 및 인프라에 의존할 것입니다. Google Cloud의 머신 러닝을 통해 당사의 정량 분석 ​​연구원들은 데이터 파이프라인 문제 해결이 아닌, 가치 창출에 더욱 집중할 수 있을 것입니다.
다음과 같은 요구 사항을 충족하는 운영팀용 시각화 자료를 작성해야 합니다.
원격 측정 데이터에는 최근 6주간(샘플링 1회) 동안 5만 개 설치 장소 전체의 데이터가 포함되어야 합니다.

매분마다)
보고서는 실시간 데이터보다 3시간 이상 지연되어서는 안 됩니다.

실행 가능한 보고서에는 최적화되지 않은 링크만 표시되어야 합니다.

최적화가 덜 된 링크는 대부분 상단으로 정렬되어야 합니다.

최적화되지 않은 링크는 지역별로 그룹화하고 필터링할 수 있습니다.

사용자가 보고서를 불러오는 데 걸리는 응답 시간은 5초 미만이어야 합니다.

6주간의 데이터를 저장하는 데이터 소스를 만들고, 여러 기간, 특정 지역, 다양한 설치 유형별로 데이터를 시각화할 수 있는 도구를 생성합니다. 시각화 자체는 변경하지 않고 항상 최신 데이터만 표시합니다. 매달 새로운 시각화를 만들고 업데이트하는 번거로움을 피하고 싶다면 어떻게 해야 할까요?

Professional-Data-Engineer 문제 183

개발팀과 외부팀은 Visualization이라는 폴더에 프로젝트 뷰어 ID 및 액세스 관리(IAM) 역할을 가지고 있습니다. 개발팀은 클라우드 스토리지와 BigQuery 모두에서 데이터를 읽을 수 있도록 하고, 외부팀은 BigQuery에서만 데이터를 읽을 수 있도록 하려면 어떻게 해야 할까요?

Professional-Data-Engineer 문제 184

귀하는 다음과 같은 조건을 충족하는 클라우드 네이티브 이력 데이터 처리 시스템을 설계하고 있습니다.
* 분석 대상 데이터는 CSV, Avro, PDF 형식이며 Cloud Dataproc, BigQuery, Compute Engine을 포함한 여러 분석 도구에서 접근할 수 있습니다.
* 스트리밍 데이터 파이프라인은 매일 새로운 데이터를 저장합니다.
* 성능은 솔루션 선택 시 고려 사항이 아닙니다.
* 솔루션 설계는 가용성을 극대화해야 합니다.
이 솔루션을 위한 데이터 저장소는 어떻게 설계해야 할까요?

Professional-Data-Engineer 문제 185

다음 중 Dataflow 파이프라인에 대한 설명으로 옳지 않은 것은 무엇입니까?