Professional-Data-Engineer 문제 221
당신은 여러 사업부를 거느린 대규모 기업에서 BI 책임자로 근무하고 있으며, 각 사업부는 서로 다른 우선순위와 예산을 가지고 있습니다. 당신은 BigQuery 온디맨드 요금제를 사용하고 있으며, 프로젝트당 2,000개의 동시 접속 슬롯 할당량을 사용하고 있습니다. 조직 내 사용자들이 쿼리 실행에 필요한 슬롯을 확보하지 못하는 경우가 발생하고 있으며, 당신은 이 문제를 해결해야 합니다. 하지만 계정에 새로운 프로젝트를 추가하는 것은 피하고 싶습니다.
어떻게 해야 할까요?
어떻게 해야 할까요?
Professional-Data-Engineer 문제 222
귀사는 뉴런과 레이어 수가 많은 TensorFlow 신경망 모델을 구축했습니다. 이 모델은 훈련 데이터에는 잘 맞지만, 새로운 데이터로 테스트했을 때는 성능이 저조합니다.
이 문제를 해결하기 위해 어떤 방법을 사용할 수 있을까요?
이 문제를 해결하기 위해 어떤 방법을 사용할 수 있을까요?
Professional-Data-Engineer 문제 223
귀사는 내부 IT 애플리케이션과 Google BigQuery를 통합하여 사용자가 애플리케이션 인터페이스에서 BigQuery를 쿼리할 수 있도록 하려고 합니다. 개별 사용자가 BigQuery에 인증할 필요도 없고, 데이터 세트에 대한 접근 권한도 부여하고 싶지 않습니다. IT 애플리케이션에서 BigQuery에 안전하게 접근하는 방법을 찾고 있습니다.
어떻게 해야 할까요?
어떻게 해야 할까요?
Professional-Data-Engineer 문제 224
수백만 대의 사물인터넷(IoT) 기기에서 수집되는 원격 측정 데이터를 처리하기 위해 NoSQL 데이터베이스를 선택하고 있습니다. 데이터 양은 매년 100TB씩 증가하고 있으며, 각 데이터 항목에는 약 100개의 속성이 있습니다. 데이터 처리 파이프라인은 원자성, 일관성, 격리성, 내구성(ACID)을 요구하지 않지만, 높은 가용성과 낮은 지연 시간이 필요합니다.
개별 필드를 기준으로 쿼리하여 데이터를 분석해야 합니다. 요구 사항을 충족하는 데이터베이스 세 가지는 무엇입니까? (세 가지를 선택하십시오.)
개별 필드를 기준으로 쿼리하여 데이터를 분석해야 합니다. 요구 사항을 충족하는 데이터베이스 세 가지는 무엇입니까? (세 가지를 선택하십시오.)
Professional-Data-Engineer 문제 225
사례 연구 1 - 플로우로지스틱
회사 개요
Flowlogistic은 선도적인 물류 및 공급망 제공업체입니다. 전 세계 기업들이 자원을 관리하고 최종 목적지까지 운송할 수 있도록 지원합니다. 이 회사는 빠르게 성장하여 철도, 트럭, 항공 및 해상 운송을 포함한 다양한 서비스로 확장해 왔습니다.
회사 개요
이 회사는 지역 트럭 운송 회사로 시작하여 다른 물류 시장으로 확장했습니다. 하지만 인프라를 업데이트하지 않아 주문 및 배송 관리와 추적에 병목 현상이 발생하고 있습니다. 운영 개선을 위해 Flowlogistic은 소포 단위의 실시간 배송 추적 기술을 자체 개발했습니다. 그러나 Apache Kafka 기반의 기술 스택이 처리량을 감당할 수 없어 해당 기술을 배포하지 못하고 있습니다. 또한 Flowlogistic은 주문 및 배송에 대한 추가 분석을 통해 자원을 가장 효율적으로 배분하는 방법을 모색하고자 합니다.
솔루션 컨셉
Flowlogistic은 클라우드를 사용하여 두 가지 개념을 구현하고자 합니다.
* 자사 고유 기술을 활용하여 실시간 재고 추적 시스템을 구축하고 화물의 위치를 파악합니다.
* 모든 주문 및 배송 기록(정형 및 비정형 데이터 포함)에 대한 분석을 수행하여 리소스를 가장 효율적으로 배분하는 방법과 정보 확장이 필요한 시장을 결정합니다.
또한 그들은 예측 분석을 사용하여 배송 지연이 발생할 가능성을 더 일찍 파악하고자 합니다.
기존 기술 환경
Flowlogistic 아키텍처는 단일 데이터 센터에 있습니다.
* 데이터베이스
2개의 클러스터에 8개의 물리적 서버
- SQL Server - 사용자 데이터, 인벤토리, 정적 데이터
물리적 서버 3대
- 카산드라 - 메타데이터, 메시지 추적
Kafka 서버 10대 - 메시지 집계 및 배치 삽입 추적
* 애플리케이션 서버 - 고객 프런트엔드, 주문/통관용 미들웨어
20개의 물리적 서버에 걸쳐 60개의 가상 머신이 있습니다.
- 톰캣 - 자바 서비스
- Nginx - 정적 콘텐츠
- 배치 서버
* 저장 가전제품
- 가상 머신(VM) 호스트용 iSCSI
- 파이버 채널 스토리지 영역 네트워크(FC SAN) - SQL 서버 스토리지
- 네트워크 연결 스토리지(NAS) 이미지 저장, 로그, 백업
* 아파치 하둡/스파크 서버 10대
- 코어 데이터 레이크
- 데이터 분석 작업 부하
* 기타 서버 20대
- 젠킨스, 모니터링, 배스천 호스트
비즈니스 요구사항
* 확장 가능한 프로덕션 환경을 구축하여 안정적이고 재현 가능한 환경을 조성하십시오.
* 분석을 위해 중앙 집중식 데이터 레이크에 데이터를 집계합니다.
* 과거 데이터를 활용하여 향후 출하량에 대한 예측 분석을 수행합니다.
* 독자적인 기술을 사용하여 전 세계 모든 배송을 정확하게 추적합니다.
* 새로운 자원을 신속하게 제공하여 비즈니스 민첩성과 혁신 속도를 향상시키십시오.
* 클라우드 환경에서 성능을 극대화하기 위한 아키텍처를 분석하고 최적화합니다.
* 다른 모든 요구 사항이 충족되면 클라우드로 완전히 마이그레이션하십시오.
기술 요구사항
* 스트리밍 데이터와 배치 데이터를 모두 처리할 수 있습니다.
* 기존 하둡 워크로드를 마이그레이션합니다
* 회사의 변화하는 요구 사항을 충족할 수 있도록 아키텍처가 확장 가능하고 유연한지 확인하십시오.
* 가능한 한 관리형 서비스를 사용하십시오.
* 데이터 전송 및 저장 시 암호화
* 운영 데이터 센터와 클라우드 환경 간에 VPN을 연결하세요. SEO 설명: 우리는 너무 빠르게 성장해서 인프라를 업그레이드할 수 없는 상황이 향후 성장과 효율성을 심각하게 저해하고 있습니다. 우리는 전 세계로 화물을 운송하는 데는 효율적이지만, 데이터를 이동시키는 데는 비효율적입니다.
고객이 어디에 있는지, 무엇을 배송하는지 더 쉽게 파악할 수 있도록 정보를 체계적으로 정리해야 합니다.
CTO 성명서
저희 회사는 IT를 우선순위에 둔 적이 없어서 데이터가 늘어나는 동안 기술 투자를 충분히 하지 못했습니다. IT 관리팀은 훌륭하지만, 인프라 관리에만 급급해서 정작 중요한 업무, 예를 들어 데이터 정리, 분석 시스템 구축, CFO의 추적 기술 도입 등에 집중할 시간이 없습니다.
최고재무책임자(CFO) 성명서
우리의 경쟁력 중 하나는 배송 지연에 대해 스스로 불이익을 주는 것입니다.
배송물의 위치를 항상 파악하는 것은 우리의 순이익과 수익성에 직접적인 영향을 미칩니다. 또한, 서버 환경 구축에 자본을 투자하고 싶지 않습니다.
Flowlogistic은 실시간 재고 추적 시스템을 도입하고 있습니다. 모든 추적 장치는 패키지 추적 메시지를 전송하며, 이 메시지는 기존의 Apache Kafka 클러스터 대신 단일 Google Cloud Pub/Sub 토픽으로 전송됩니다. 구독 애플리케이션은 이 메시지를 처리하여 실시간 보고서를 생성하고, 과거 데이터 분석을 위해 Google BigQuery에 저장합니다. 패키지 데이터의 시간 경과에 따른 분석이 가능하도록 하려면 어떤 접근 방식을 선택해야 할까요?
회사 개요
Flowlogistic은 선도적인 물류 및 공급망 제공업체입니다. 전 세계 기업들이 자원을 관리하고 최종 목적지까지 운송할 수 있도록 지원합니다. 이 회사는 빠르게 성장하여 철도, 트럭, 항공 및 해상 운송을 포함한 다양한 서비스로 확장해 왔습니다.
회사 개요
이 회사는 지역 트럭 운송 회사로 시작하여 다른 물류 시장으로 확장했습니다. 하지만 인프라를 업데이트하지 않아 주문 및 배송 관리와 추적에 병목 현상이 발생하고 있습니다. 운영 개선을 위해 Flowlogistic은 소포 단위의 실시간 배송 추적 기술을 자체 개발했습니다. 그러나 Apache Kafka 기반의 기술 스택이 처리량을 감당할 수 없어 해당 기술을 배포하지 못하고 있습니다. 또한 Flowlogistic은 주문 및 배송에 대한 추가 분석을 통해 자원을 가장 효율적으로 배분하는 방법을 모색하고자 합니다.
솔루션 컨셉
Flowlogistic은 클라우드를 사용하여 두 가지 개념을 구현하고자 합니다.
* 자사 고유 기술을 활용하여 실시간 재고 추적 시스템을 구축하고 화물의 위치를 파악합니다.
* 모든 주문 및 배송 기록(정형 및 비정형 데이터 포함)에 대한 분석을 수행하여 리소스를 가장 효율적으로 배분하는 방법과 정보 확장이 필요한 시장을 결정합니다.
또한 그들은 예측 분석을 사용하여 배송 지연이 발생할 가능성을 더 일찍 파악하고자 합니다.
기존 기술 환경
Flowlogistic 아키텍처는 단일 데이터 센터에 있습니다.
* 데이터베이스
2개의 클러스터에 8개의 물리적 서버
- SQL Server - 사용자 데이터, 인벤토리, 정적 데이터
물리적 서버 3대
- 카산드라 - 메타데이터, 메시지 추적
Kafka 서버 10대 - 메시지 집계 및 배치 삽입 추적
* 애플리케이션 서버 - 고객 프런트엔드, 주문/통관용 미들웨어
20개의 물리적 서버에 걸쳐 60개의 가상 머신이 있습니다.
- 톰캣 - 자바 서비스
- Nginx - 정적 콘텐츠
- 배치 서버
* 저장 가전제품
- 가상 머신(VM) 호스트용 iSCSI
- 파이버 채널 스토리지 영역 네트워크(FC SAN) - SQL 서버 스토리지
- 네트워크 연결 스토리지(NAS) 이미지 저장, 로그, 백업
* 아파치 하둡/스파크 서버 10대
- 코어 데이터 레이크
- 데이터 분석 작업 부하
* 기타 서버 20대
- 젠킨스, 모니터링, 배스천 호스트
비즈니스 요구사항
* 확장 가능한 프로덕션 환경을 구축하여 안정적이고 재현 가능한 환경을 조성하십시오.
* 분석을 위해 중앙 집중식 데이터 레이크에 데이터를 집계합니다.
* 과거 데이터를 활용하여 향후 출하량에 대한 예측 분석을 수행합니다.
* 독자적인 기술을 사용하여 전 세계 모든 배송을 정확하게 추적합니다.
* 새로운 자원을 신속하게 제공하여 비즈니스 민첩성과 혁신 속도를 향상시키십시오.
* 클라우드 환경에서 성능을 극대화하기 위한 아키텍처를 분석하고 최적화합니다.
* 다른 모든 요구 사항이 충족되면 클라우드로 완전히 마이그레이션하십시오.
기술 요구사항
* 스트리밍 데이터와 배치 데이터를 모두 처리할 수 있습니다.
* 기존 하둡 워크로드를 마이그레이션합니다
* 회사의 변화하는 요구 사항을 충족할 수 있도록 아키텍처가 확장 가능하고 유연한지 확인하십시오.
* 가능한 한 관리형 서비스를 사용하십시오.
* 데이터 전송 및 저장 시 암호화
* 운영 데이터 센터와 클라우드 환경 간에 VPN을 연결하세요. SEO 설명: 우리는 너무 빠르게 성장해서 인프라를 업그레이드할 수 없는 상황이 향후 성장과 효율성을 심각하게 저해하고 있습니다. 우리는 전 세계로 화물을 운송하는 데는 효율적이지만, 데이터를 이동시키는 데는 비효율적입니다.
고객이 어디에 있는지, 무엇을 배송하는지 더 쉽게 파악할 수 있도록 정보를 체계적으로 정리해야 합니다.
CTO 성명서
저희 회사는 IT를 우선순위에 둔 적이 없어서 데이터가 늘어나는 동안 기술 투자를 충분히 하지 못했습니다. IT 관리팀은 훌륭하지만, 인프라 관리에만 급급해서 정작 중요한 업무, 예를 들어 데이터 정리, 분석 시스템 구축, CFO의 추적 기술 도입 등에 집중할 시간이 없습니다.
최고재무책임자(CFO) 성명서
우리의 경쟁력 중 하나는 배송 지연에 대해 스스로 불이익을 주는 것입니다.
배송물의 위치를 항상 파악하는 것은 우리의 순이익과 수익성에 직접적인 영향을 미칩니다. 또한, 서버 환경 구축에 자본을 투자하고 싶지 않습니다.
Flowlogistic은 실시간 재고 추적 시스템을 도입하고 있습니다. 모든 추적 장치는 패키지 추적 메시지를 전송하며, 이 메시지는 기존의 Apache Kafka 클러스터 대신 단일 Google Cloud Pub/Sub 토픽으로 전송됩니다. 구독 애플리케이션은 이 메시지를 처리하여 실시간 보고서를 생성하고, 과거 데이터 분석을 위해 Google BigQuery에 저장합니다. 패키지 데이터의 시간 경과에 따른 분석이 가능하도록 하려면 어떤 접근 방식을 선택해야 할까요?
