Professional-Data-Engineer 문제 321
사람 얼굴이 포함되어 있는지 여부가 레이블로 표시된 이미지 데이터셋이 있다고 가정해 봅시다. 이 레이블이 지정된 데이터셋을 사용하여 이미지에서 사람 얼굴을 인식하는 신경망을 구축하려면 어떤 접근 방식이 가장 효과적일까요?
Professional-Data-Engineer 문제 322
귀사의 분석팀은 어떤 고객이 가장 구매 가능성이 높은지 판단하기 위한 간단한 통계 모델을 구축하고자 합니다.
몇 가지 다른 지표를 바탕으로 귀사와 다시 협력하고 싶습니다. 그들은 아파치에서 모델을 실행하고 싶어합니다.
Spark는 Google Cloud Storage에 저장된 데이터를 사용하며, 귀하께서는 Google Cloud 사용을 권장하셨습니다.
Dataproc을 사용하여 이 작업을 실행합니다. 테스트 결과, 이 워크로드는 Dataproc에서 약 30분 정도 소요되는 것으로 나타났습니다.
15개 노드로 구성된 클러스터에서 결과를 Google BigQuery에 출력합니다. 이 워크로드는 매주 실행할 계획입니다.
클러스터의 비용을 최적화하려면 어떻게 해야 할까요?
몇 가지 다른 지표를 바탕으로 귀사와 다시 협력하고 싶습니다. 그들은 아파치에서 모델을 실행하고 싶어합니다.
Spark는 Google Cloud Storage에 저장된 데이터를 사용하며, 귀하께서는 Google Cloud 사용을 권장하셨습니다.
Dataproc을 사용하여 이 작업을 실행합니다. 테스트 결과, 이 워크로드는 Dataproc에서 약 30분 정도 소요되는 것으로 나타났습니다.
15개 노드로 구성된 클러스터에서 결과를 Google BigQuery에 출력합니다. 이 워크로드는 매주 실행할 계획입니다.
클러스터의 비용을 최적화하려면 어떻게 해야 할까요?
Professional-Data-Engineer 문제 323
클라우드 빅테이블용 HBase 셸이란 무엇인가요?
Professional-Data-Engineer 문제 324
분석 목적으로 10PB 규모의 과거 제품 데이터를 제공하는 애플리케이션의 데이터 백엔드를 마이그레이션했습니다. 다른 애플리케이션에서는 제품의 최종 상태 정보(약 10GB)만 API를 통해 제공하면 됩니다. 분석 요구 사항과 초당 최대 1,000건의 쿼리(QPS) 처리, 1초 미만의 지연 시간을 지원하는 API 성능을 모두 충족하는 비용 효율적인 영구 스토리지 솔루션을 선택해야 합니다. 어떤 솔루션을 선택해야 할까요?
Professional-Data-Engineer 문제 325
사례 연구 2 - MJTelco
회사 개요
MJTelco는 전 세계적으로 빠르게 성장하지만 통신 서비스가 부족한 시장에 네트워크를 구축하려는 스타트업입니다. 이 회사는 혁신적인 광통신 하드웨어 관련 특허를 보유하고 있으며, 이러한 특허를 기반으로 저렴한 하드웨어로 안정적이고 고속의 기간망 링크를 다수 구축할 수 있습니다.
회사 개요
통신 업계의 경험 많은 임원들이 설립한 MJTelco는 원래 우주 통신 문제를 해결하기 위해 개발된 기술을 활용합니다. 이들의 운영에 있어 핵심적인 요소는 실시간 분석을 지원하고 머신 러닝을 통합하여 네트워크 토폴로지를 지속적으로 최적화하는 분산 데이터 인프라 구축입니다. 저렴한 하드웨어를 사용하는 덕분에 네트워크를 광범위하게 구축하여 지역 정세 변화가 위치 가용성과 비용에 미치는 영향을 고려할 수 있습니다.
그들의 경영 및 운영팀은 전 세계에 걸쳐 분포되어 있으며, 시스템 내에서 데이터 소비자와 공급자 간의 다대다 관계를 형성합니다. 신중한 검토 끝에 그들은 퍼블릭 클라우드가 자신들의 요구 사항을 충족하는 데 가장 적합한 환경이라고 판단했습니다.
솔루션 컨셉
MJTelco는 자사 연구소에서 성공적인 개념 증명(PoC) 프로젝트를 진행하고 있습니다. 그들에게는 두 가지 주요 요구 사항이 있습니다.
* 5만 개 이상의 설치로 확장될 때 생성되는 훨씬 더 많은 데이터 흐름을 지원할 수 있도록 PoC를 확장하고 강화합니다.
* 토폴로지 정의를 제어하는 데 사용하는 동적 모델을 검증하고 개선하기 위해 머신러닝 주기를 정교화합니다.
MJTelco는 실험 실행, 새로운 기능 배포 및 실제 고객 서비스 제공 요구 사항을 충족하기 위해 개발/테스트, 스테이징 및 프로덕션이라는 세 가지 별도의 운영 환경을 사용할 예정입니다.
비즈니스 요구사항
* 예측 불가능하고 분산된 통신 사용자 커뮤니티에서 필요할 때 필요한 곳에 리소스를 인스턴스화하여 최소한의 비용으로 프로덕션 환경을 확장할 수 있습니다.
* 자사 소유 데이터의 보안을 확보하여 최첨단 머신러닝 및 분석 기술을 보호합니다.
* 분산된 연구원들이 분석에 필요한 데이터에 안정적이고 시의적절하게 접근할 수 있도록 지원합니다.
* 고객에게 영향을 주지 않으면서 머신러닝 모델의 빠른 반복 개발을 지원하는 격리된 환경을 유지합니다.
기술 요구사항
* 원격 측정 데이터의 안전하고 효율적인 전송 및 저장을 보장합니다.
* 여러 흐름을 가진 10,000~100,000개의 데이터 공급자를 지원하도록 인스턴스를 신속하게 확장할 수 있습니다.
* 최대 2년치의 데이터를 추적하는 데이터 테이블을 기반으로 분석 및 프레젠테이션을 지원하며, 하루 약 1억 건의 레코드를 저장할 수 있습니다.
* 원격 측정 흐름과 운영 학습 주기 모두에서 데이터 파이프라인 문제를 파악하는 데 중점을 둔 모니터링 인프라의 신속한 반복 개발을 지원합니다.
CEO 성명
당사의 비즈니스 모델은 특허, 분석 및 동적 머신 러닝에 기반합니다. 저렴한 하드웨어는 높은 신뢰성을 갖도록 구성되어 비용 경쟁력을 제공합니다. 신뢰성 및 용량 관련 약속을 충족하기 위해 대규모 분산 데이터 파이프라인을 신속하게 안정화해야 합니다.
CTO 성명서
퍼블릭 클라우드 서비스는 광고된 대로 작동해야 합니다. 확장성이 뛰어나고 데이터 보안을 유지할 수 있는 리소스가 필요합니다. 또한 데이터 과학자들이 모델을 면밀히 분석하고 신속하게 수정할 수 있는 환경도 필요합니다. 데이터 처리에 자동화 기술을 활용하기 때문에 개발 및 테스트 환경 역시 반복적인 작업 과정에서 원활하게 작동해야 합니다.
최고재무책임자(CFO) 성명서
프로젝트 규모가 너무 커서 데이터 및 분석에 필요한 하드웨어와 소프트웨어를 유지 관리하는 것이 어렵습니다. 또한, 수많은 데이터 피드를 모니터링할 운영팀을 구성할 여력도 없어 자동화와 인프라에 의존해야 합니다. Google Cloud의 머신러닝 기능을 통해 양적 분석 연구원들은 데이터 파이프라인 문제 해결이 아닌, 가치 창출에 더욱 집중할 수 있을 것입니다.
MJTelco는 지난 2년간의 기록을 분석할 수 있는 Google BigTable 스키마를 생성해 달라고 요청했습니다. 각 기록은 15분마다 전송되며, 기기의 고유 식별자와 데이터 레코드를 포함합니다. 가장 일반적인 쿼리는 특정 기기의 특정 날짜에 대한 모든 데이터를 요청하는 것입니다. 어떤 스키마를 사용해야 할까요?
회사 개요
MJTelco는 전 세계적으로 빠르게 성장하지만 통신 서비스가 부족한 시장에 네트워크를 구축하려는 스타트업입니다. 이 회사는 혁신적인 광통신 하드웨어 관련 특허를 보유하고 있으며, 이러한 특허를 기반으로 저렴한 하드웨어로 안정적이고 고속의 기간망 링크를 다수 구축할 수 있습니다.
회사 개요
통신 업계의 경험 많은 임원들이 설립한 MJTelco는 원래 우주 통신 문제를 해결하기 위해 개발된 기술을 활용합니다. 이들의 운영에 있어 핵심적인 요소는 실시간 분석을 지원하고 머신 러닝을 통합하여 네트워크 토폴로지를 지속적으로 최적화하는 분산 데이터 인프라 구축입니다. 저렴한 하드웨어를 사용하는 덕분에 네트워크를 광범위하게 구축하여 지역 정세 변화가 위치 가용성과 비용에 미치는 영향을 고려할 수 있습니다.
그들의 경영 및 운영팀은 전 세계에 걸쳐 분포되어 있으며, 시스템 내에서 데이터 소비자와 공급자 간의 다대다 관계를 형성합니다. 신중한 검토 끝에 그들은 퍼블릭 클라우드가 자신들의 요구 사항을 충족하는 데 가장 적합한 환경이라고 판단했습니다.
솔루션 컨셉
MJTelco는 자사 연구소에서 성공적인 개념 증명(PoC) 프로젝트를 진행하고 있습니다. 그들에게는 두 가지 주요 요구 사항이 있습니다.
* 5만 개 이상의 설치로 확장될 때 생성되는 훨씬 더 많은 데이터 흐름을 지원할 수 있도록 PoC를 확장하고 강화합니다.
* 토폴로지 정의를 제어하는 데 사용하는 동적 모델을 검증하고 개선하기 위해 머신러닝 주기를 정교화합니다.
MJTelco는 실험 실행, 새로운 기능 배포 및 실제 고객 서비스 제공 요구 사항을 충족하기 위해 개발/테스트, 스테이징 및 프로덕션이라는 세 가지 별도의 운영 환경을 사용할 예정입니다.
비즈니스 요구사항
* 예측 불가능하고 분산된 통신 사용자 커뮤니티에서 필요할 때 필요한 곳에 리소스를 인스턴스화하여 최소한의 비용으로 프로덕션 환경을 확장할 수 있습니다.
* 자사 소유 데이터의 보안을 확보하여 최첨단 머신러닝 및 분석 기술을 보호합니다.
* 분산된 연구원들이 분석에 필요한 데이터에 안정적이고 시의적절하게 접근할 수 있도록 지원합니다.
* 고객에게 영향을 주지 않으면서 머신러닝 모델의 빠른 반복 개발을 지원하는 격리된 환경을 유지합니다.
기술 요구사항
* 원격 측정 데이터의 안전하고 효율적인 전송 및 저장을 보장합니다.
* 여러 흐름을 가진 10,000~100,000개의 데이터 공급자를 지원하도록 인스턴스를 신속하게 확장할 수 있습니다.
* 최대 2년치의 데이터를 추적하는 데이터 테이블을 기반으로 분석 및 프레젠테이션을 지원하며, 하루 약 1억 건의 레코드를 저장할 수 있습니다.
* 원격 측정 흐름과 운영 학습 주기 모두에서 데이터 파이프라인 문제를 파악하는 데 중점을 둔 모니터링 인프라의 신속한 반복 개발을 지원합니다.
CEO 성명
당사의 비즈니스 모델은 특허, 분석 및 동적 머신 러닝에 기반합니다. 저렴한 하드웨어는 높은 신뢰성을 갖도록 구성되어 비용 경쟁력을 제공합니다. 신뢰성 및 용량 관련 약속을 충족하기 위해 대규모 분산 데이터 파이프라인을 신속하게 안정화해야 합니다.
CTO 성명서
퍼블릭 클라우드 서비스는 광고된 대로 작동해야 합니다. 확장성이 뛰어나고 데이터 보안을 유지할 수 있는 리소스가 필요합니다. 또한 데이터 과학자들이 모델을 면밀히 분석하고 신속하게 수정할 수 있는 환경도 필요합니다. 데이터 처리에 자동화 기술을 활용하기 때문에 개발 및 테스트 환경 역시 반복적인 작업 과정에서 원활하게 작동해야 합니다.
최고재무책임자(CFO) 성명서
프로젝트 규모가 너무 커서 데이터 및 분석에 필요한 하드웨어와 소프트웨어를 유지 관리하는 것이 어렵습니다. 또한, 수많은 데이터 피드를 모니터링할 운영팀을 구성할 여력도 없어 자동화와 인프라에 의존해야 합니다. Google Cloud의 머신러닝 기능을 통해 양적 분석 연구원들은 데이터 파이프라인 문제 해결이 아닌, 가치 창출에 더욱 집중할 수 있을 것입니다.
MJTelco는 지난 2년간의 기록을 분석할 수 있는 Google BigTable 스키마를 생성해 달라고 요청했습니다. 각 기록은 15분마다 전송되며, 기기의 고유 식별자와 데이터 레코드를 포함합니다. 가장 일반적인 쿼리는 특정 기기의 특정 날짜에 대한 모든 데이터를 요청하는 것입니다. 어떤 스키마를 사용해야 할까요?
프리미엄 번들
DumpTop 에서 공유하는 최신 Professional-Data-Engineer 시험 덤프는 Professional-Data-Engineer 시험패스를 도와드릴수 있습니다! DumpTop 은 최근 업데이트된 Professional-Data-Engineer 시험자료를 제공해드립니다. DumpTop Professional-Data-Engineer 덤프도 시험문제 변경에 따라 업데이트되었으며 오답도 수정되었습니다. DumpTop Professional-Data-Engineer 덤프 최신버전을 공유받아보세요.
(433 Q&As 덤프, 30%OFF할인코드: KrDump)
