Professional-Data-Engineer 문제 171

배치 처리 작업을 위한 Dataflow 파이프라인을 설계하고 있습니다. 작업 제출 시 여러 영역 오류가 발생하는 상황을 완화하고 싶습니다. 어떻게 해야 할까요?

Professional-Data-Engineer 문제 172

MJTelco 사례 연구
회사 개요
MJTelco는 전 세계적으로 빠르게 성장하지만 통신 서비스가 부족한 시장에 네트워크를 구축하려는 스타트업입니다. 이 회사는 혁신적인 광통신 하드웨어 관련 특허를 보유하고 있으며, 이러한 특허를 기반으로 저렴한 하드웨어로 안정적이고 고속의 기간망 링크를 다수 구축할 수 있습니다.
회사 개요
통신 업계의 경험 많은 임원들이 설립한 MJTelco는 원래 우주 통신 문제를 해결하기 위해 개발된 기술을 활용합니다. 이들의 운영에 있어 핵심적인 요소는 실시간 분석을 지원하고 머신 러닝을 통합하여 네트워크 토폴로지를 지속적으로 최적화하는 분산 데이터 인프라 구축입니다. 저렴한 하드웨어를 사용하는 덕분에 네트워크를 광범위하게 구축하여 지역 정세 변화가 위치 가용성과 비용에 미치는 영향을 고려할 수 있습니다.
그들의 경영 및 운영팀은 전 세계에 걸쳐 분포되어 있으며, 시스템 내에서 데이터 소비자와 공급자 간의 다대다 관계를 형성하고 있습니다. 신중한 검토 끝에, 그들은 퍼블릭 클라우드가 자신들의 요구 사항을 충족하는 데 가장 적합한 환경이라고 판단했습니다.
솔루션 컨셉
MJTelco는 자사 연구소에서 성공적인 개념 증명(PoC) 프로젝트를 진행하고 있습니다. 그들에게는 두 가지 주요 요구 사항이 있습니다.
* PoC를 확장하고 강화하여 규모가 커질 때 생성되는 훨씬 더 많은 데이터 흐름을 지원하도록 합니다.
5만 건의 설치.
* 토폴로지 정의를 제어하는 ​​데 사용하는 동적 모델을 검증하고 개선하기 위해 머신러닝 주기를 정교화합니다.
MJTelco는 실험 실행, 새로운 기능 배포 및 실제 고객 서비스 제공 요구 사항을 충족하기 위해 개발/테스트, 스테이징 및 프로덕션이라는 세 가지 별도의 운영 환경을 사용할 예정입니다.
비즈니스 요구사항
* 예측 불가능하고 분산된 통신 사용자 커뮤니티에서 필요할 때 필요한 곳에 리소스를 인스턴스화하여 최소한의 비용으로 프로덕션 환경을 확장할 수 있습니다.
* 자사 소유 데이터의 보안을 확보하여 최첨단 머신러닝 및 분석 기술을 보호합니다.
* 분산된 연구원들이 분석에 필요한 데이터에 안정적이고 시의적절하게 접근할 수 있도록 지원합니다.
* 고객에게 영향을 주지 않으면서 머신러닝 모델의 빠른 반복 개발을 지원하는 격리된 환경을 유지합니다.
기술 요구사항
원격 측정 데이터의 안전하고 효율적인 전송 및 저장을 보장합니다.
각각 여러 흐름을 지원하는 10,000~100,000개의 데이터 공급자를 수용하도록 인스턴스를 신속하게 확장할 수 있습니다.
최대 2년간의 데이터를 추적하는 데이터 테이블을 기반으로 분석 및 프레젠테이션을 지원하며, 하루 약 1억 건의 레코드를 처리할 수 있습니다. 원격 측정 흐름과 운영 학습 주기 모두에서 데이터 파이프라인 문제를 파악하는 데 중점을 두고 모니터링 인프라를 신속하게 반복적으로 개선할 수 있도록 지원합니다.
CEO 성명
당사의 비즈니스 모델은 특허, 분석 및 동적 머신 러닝에 기반합니다. 저렴한 하드웨어는 높은 신뢰성을 갖도록 구성되어 비용 경쟁력을 제공합니다. 신뢰성 및 용량 관련 약속을 충족하기 위해 대규모 분산 데이터 파이프라인을 신속하게 안정화해야 합니다.
CTO 성명서
우리의 퍼블릭 클라우드 서비스는 광고된 대로 작동해야 합니다. 확장 가능하고 데이터를 안전하게 보호할 수 있는 리소스가 필요합니다.
또한 데이터 과학자들이 모델을 면밀히 연구하고 신속하게 조정할 수 있는 환경이 필요합니다.
데이터 처리를 자동화에 의존하기 때문에, 개발 및 테스트 환경 또한 반복적인 작업 과정에서 원활하게 작동해야 합니다.
최고재무책임자(CFO) 성명서
프로젝트 규모가 너무 커서 데이터 및 분석에 필요한 하드웨어와 소프트웨어를 유지 관리하는 것이 어렵습니다. 또한, 수많은 데이터 피드를 모니터링할 운영팀을 구성할 여력도 없으므로 자동화 및 인프라에 의존해야 합니다. Google Cloud의 머신러닝 기능을 통해 양적 연구원들은 데이터 파이프라인 문제 해결이 아닌, 가치 창출에 더욱 집중할 수 있을 것입니다.
MJTelco는 하루에 기록적인 양의 스트림 데이터를 수집해야 하므로 Google BigQuery 사용 비용이 증가할 것을 우려하고 있습니다. MJTelco는 이러한 상황에 맞는 설계 솔루션을 요청했습니다. 이들은 tracking_table이라는 단일 대형 데이터 테이블을 필요로 하며, 매일 발생하는 이벤트에 대한 세밀한 분석을 수행하면서도 일일 쿼리 비용을 최소화하고자 합니다. 또한 스트리밍 데이터 수집 방식을 사용하고자 합니다. 어떤 솔루션을 설계해야 할까요?

Professional-Data-Engineer 문제 173

ETL 파이프라인을 관리하고 있는데, Dataflow에서 실행되는 스트리밍 파이프라인이 들어오는 데이터를 처리하는 데 시간이 오래 걸려 출력 지연이 발생하는 것을 발견했습니다. 또한 파이프라인 그래프가 Dataflow에 의해 자동으로 최적화되어 하나의 단계로 병합된 것도 확인했습니다. 잠재적인 병목 현상이 발생하는 지점을 파악하고 싶습니다. 어떻게 해야 할까요?

Professional-Data-Engineer 문제 174

Dataflow 프로그램을 로컬에서 실행하려면 어떤 Java SDK 클래스를 사용해야 합니까?

Professional-Data-Engineer 문제 175

조직 내 여러 팀에서 사용하는 뷰가 포함된 공유 BigQuery 데이터 세트를 관리하고 있습니다. 마케팅 팀은 온디맨드 청구 모델을 사용하는 경우 월별 BigQuery 분석 비용의 변동성을 우려하고 있습니다. 마케팅 팀이 매달 일관된 BigQuery 분석 비용을 책정할 수 있도록 지원해야 합니다. 어떻게 해야 할까요?