Professional-Data-Engineer 문제 146

사례 연구: 2 - MJTelco
회사 개요
MJTelco는 전 세계적으로 빠르게 성장하지만 통신 서비스가 부족한 시장에 네트워크를 구축하려는 스타트업입니다. 이 회사는 혁신적인 광통신 하드웨어 관련 특허를 보유하고 있으며, 이러한 특허를 기반으로 저렴한 하드웨어로 안정적이고 고속의 기간망 링크를 다수 구축할 수 있습니다.
회사 개요
통신 업계의 경험 많은 임원들이 설립한 MJTelco는 우주 통신 문제를 해결하기 위해 개발된 기술을 활용합니다. 이들의 운영에 있어 핵심적인 요소는 실시간 분석을 지원하고 머신 러닝을 통해 토폴로지를 지속적으로 최적화하는 분산 데이터 인프라 구축입니다. 저렴한 하드웨어를 사용하는 덕분에 네트워크를 여러 곳에 분산 구축하여 지역 정세 변화가 위치 가용성과 비용에 미치는 영향을 고려할 수 있습니다. 경영 및 운영팀은 전 세계에 걸쳐 분포되어 있어 시스템 내에서 데이터 소비자와 공급자 간의 다대다 관계를 형성합니다. 신중한 검토 끝에 MJTelco는 퍼블릭 클라우드가 이러한 요구 사항을 충족하는 데 가장 적합한 환경이라고 판단했습니다.
솔루션 컨셉
MJTelco는 자사 연구소에서 성공적인 개념 증명(PoC) 프로젝트를 진행하고 있습니다. 그들에게는 두 가지 주요 요구 사항이 있습니다.
5만 개 이상의 설치로 확장될 때 생성되는 훨씬 더 많은 데이터 흐름을 지원할 수 있도록 PoC를 확장하고 강화하십시오.
토폴로지 정의를 제어하는 ​​데 사용하는 동적 모델을 검증하고 개선하기 위해 머신러닝 주기를 정교화합니다.
MJTelco는 또한 개발/테스트, 스테이징 및 프로덕션이라는 세 가지 별도의 운영 환경을 사용할 것입니다.
실험 실행, 새로운 기능 배포 및 실제 고객 서비스 제공에 필요한 요구 사항을 충족하기 위해서입니다.
비즈니스 요구사항
예측 불가능하고 분산된 통신 사용자 커뮤니티에서 필요할 때 필요한 곳에 리소스를 인스턴스화하여 최소 비용으로 프로덕션 환경을 확장하십시오. 최첨단 머신 러닝 및 분석 기능을 보호하기 위해 독점 데이터의 보안을 보장하십시오.
분산된 연구원들이 분석에 필요한 데이터에 안정적이고 시기적절하게 접근할 수 있도록 지원하고, 고객에게 영향을 주지 않으면서 머신러닝 모델의 빠른 반복 개발을 지원하는 격리된 환경을 유지합니다.
기술 요구사항
원격 측정 데이터의 안전하고 효율적인 전송 및 저장을 보장합니다. 여러 흐름을 가진 10,000~100,000명의 데이터 제공자를 지원하도록 인스턴스를 신속하게 확장합니다.
최대 2년치의 데이터를 저장하는 데이터 테이블을 기반으로 분석 및 프레젠테이션을 허용합니다.
100m 기록/일
원격 측정 흐름과 운영 학습 주기 모두에서 데이터 파이프라인 문제를 파악하는 데 중점을 둔 모니터링 인프라의 신속한 반복 개발을 지원합니다.
CEO 성명
당사의 비즈니스 모델은 특허, 분석 및 동적 머신 러닝에 기반합니다. 저렴한 하드웨어는 높은 신뢰성을 갖도록 구성되어 비용 경쟁력을 제공합니다. 신뢰성 및 용량 관련 약속을 충족하기 위해 대규모 분산 데이터 파이프라인을 신속하게 안정화해야 합니다.
CTO 성명서
퍼블릭 클라우드 서비스는 광고된 대로 작동해야 합니다. 확장성이 뛰어나고 데이터 보안을 유지할 수 있는 리소스가 필요합니다. 또한 데이터 과학자들이 모델을 면밀히 분석하고 신속하게 수정할 수 있는 환경도 필요합니다. 데이터 처리에 자동화 기술을 활용하기 때문에 개발 및 테스트 환경 역시 반복적인 작업 과정에서 원활하게 작동해야 합니다.
최고재무책임자(CFO) 성명서
프로젝트 규모가 너무 커서 데이터 및 분석에 필요한 하드웨어와 소프트웨어를 유지 관리하기 어렵습니다.
또한, 수많은 데이터 피드를 모니터링할 운영팀을 구성할 여력이 없으므로 자동화 및 인프라에 의존할 것입니다. Google Cloud의 머신 러닝을 통해 당사의 정량 분석 ​​연구원들은 데이터 파이프라인 문제 해결이 아닌, 가치 창출에 더욱 집중할 수 있을 것입니다.
MJTelco는 지난 2년간의 기록을 분석할 수 있는 Google BigTable 스키마를 생성해 달라고 요청했습니다. 각 기록은 15분마다 전송되며, 기기의 고유 식별자와 데이터 레코드를 포함합니다. 가장 일반적인 쿼리는 특정 기기의 특정 날짜에 대한 모든 데이터를 요청하는 것입니다. 어떤 스키마를 사용해야 할까요?

Professional-Data-Engineer 문제 147

소셜 미디어 게시물을 분당 10,000개씩 거의 실시간으로 Google BigQuery에 저장하고 분석해야 합니다. 초기에는 개별 게시물에 대해 스트리밍 삽입 방식을 사용하도록 애플리케이션을 설계했습니다. 또한, 스트리밍 삽입 직후 데이터 집계를 수행하도록 했습니다. 그런데 스트리밍 삽입 후 쿼리에서 데이터 일관성이 제대로 나타나지 않고, 쿼리 결과 보고서에서 처리 중인 데이터가 누락될 수 있다는 것을 발견했습니다.
애플리케이션 디자인을 어떻게 조정할 수 있을까요?

Professional-Data-Engineer 문제 148

당신은 북미 전역에 지점을 둔 대형 은행에서 근무하고 있습니다. 은행 계좌 거래를 처리할 데이터 저장 시스템을 구축 중이며, ACID 규정을 준수하고 SQL을 사용하여 데이터에 접근할 수 있어야 합니다. 어떤 솔루션이 적합할까요?

Professional-Data-Engineer 문제 149

그들은 사용자 수준 데이터에 대한 액세스는 계속 제어하면서 이러한 데이터의 집계 버전을 다른 Google Cloud 프로젝트에 공개하려고 합니다.
또한, 전체 저장 비용을 최소화하고 다른 프로젝트의 분석 비용이 해당 프로젝트에 할당되도록 해야 합니다.
그들은 어떻게 해야 할까요?

Professional-Data-Engineer 문제 150

수백만 대의 사물인터넷(IoT) 기기에서 제출되는 원격 측정 데이터를 처리하기 위해 NoSQL 데이터베이스를 선택하고 있습니다. 데이터 양은 매년 100TB씩 증가하고 있으며, 각 데이터 항목에는 약 100개의 속성이 있습니다.
데이터 처리 파이프라인은 원자성, 일관성, 격리성, 내구성(ACID)을 요구하지 않습니다. 하지만 높은 가용성과 낮은 지연 시간은 필수적입니다.
개별 필드를 기준으로 쿼리하여 데이터를 분석해야 합니다. 요구 사항을 충족하는 데이터베이스 세 가지는 무엇입니까? (세 가지를 선택하십시오.)