Professional-Data-Engineer 문제 36
고객의 도로명 주소가 포함된 BigQuery 데이터셋이 하나 있습니다. 이 데이터셋에서 도로명 주소가 나타나는 모든 위치를 가져오고 싶습니다. 어떻게 해야 할까요?
Professional-Data-Engineer 문제 37
당신은 수요가 높은 지역을 파악하고 이용 가능한 운전자를 효율적으로 재배치하여 수요를 충족시키는 실시간 차량 호출 앱을 설계하고 있습니다. 이 시스템은 여러 소스에서 데이터를 수집(Pub/Sub)하고, 처리한 후, 실시간 대시보드에서 시각화 및 분석할 수 있도록 결과를 저장합니다. 데이터 소스에는 5초마다 업데이트되는 운전자 위치 정보와 앱을 통한 승객 예약 이벤트가 포함됩니다. 데이터 처리는 지난 30초 동안의 수요 및 공급 데이터를 2초마다 실시간으로 집계하고, 결과를 지연 시간이 짧은 시스템에 저장하여 시각화하는 과정을 거칩니다. 어떤 방법을 사용해야 할까요?
Professional-Data-Engineer 문제 38
생방송 TV 프로그램에서 시청자들에게 모바일폰을 이용한 투표를 요청합니다. 이 이벤트는 3분 동안 엄청난 양의 데이터를 생성합니다. 당신은 "투표 인프라"를 담당하고 있으며, 플랫폼이 이러한 부하를 처리하고 모든 투표가 처리되도록 해야 합니다. 투표가 진행되는 동안에는 부분적인 결과를 표시해야 합니다. 투표가 종료된 후에는 비용을 최적화하면서 모든 투표를 정확히 한 번만 집계해야 합니다. 어떻게 해야 할까요?


Professional-Data-Engineer 문제 39
클라우드 스토리지에 데이터를 보관하려고 합니다. 일부 데이터는 매우 민감하기 때문에 클라우드 제공업체 직원이 데이터를 해독하지 못하도록 "아무도 신뢰하지 않는(Trust No One, TNO)" 방식을 사용하여 데이터를 암호화하려고 합니다.
a. 어떻게 해야 할까요?
a. 어떻게 해야 할까요?
Professional-Data-Engineer 문제 40
플로우로지스틱 사례 연구
회사 개요
Flowlogistic은 선도적인 물류 및 공급망 제공업체입니다. 전 세계 기업들이 자원을 관리하고 최종 목적지까지 운송할 수 있도록 지원합니다. 이 회사는 빠르게 성장하여 철도, 트럭, 항공 및 해상 운송을 포함한 다양한 서비스로 확장해 왔습니다.
회사 개요
이 회사는 지역 트럭 운송 회사로 시작하여 다른 물류 시장으로 확장했습니다. 하지만 인프라를 업데이트하지 않아 주문 및 배송 관리와 추적에 병목 현상이 발생하고 있습니다. 운영 개선을 위해 Flowlogistic은 소포 단위의 실시간 배송 추적 기술을 자체 개발했습니다. 그러나 Apache Kafka 기반의 기술 스택이 처리량을 감당할 수 없어 해당 기술을 배포하지 못하고 있습니다. 또한 Flowlogistic은 주문 및 배송에 대한 추가 분석을 통해 자원을 가장 효율적으로 배분하는 방법을 모색하고자 합니다.
솔루션 컨셉
Flowlogistic은 클라우드를 사용하여 두 가지 개념을 구현하고자 합니다.
* 자사 고유 기술을 활용하여 실시간 재고 추적 시스템을 구축하고 화물의 위치를 파악합니다.
* 모든 주문 및 배송 기록(정형 및 비정형 데이터 포함)에 대한 분석을 수행하여 리소스를 가장 효율적으로 배분하는 방법과 정보 확장 대상 시장을 결정합니다. 또한 예측 분석을 활용하여 배송 지연 가능성을 미리 파악하고자 합니다.
기존 기술 환경
Flowlogistic 아키텍처는 단일 데이터 센터에 있습니다.
* 데이터베이스
* 2개 클러스터에 8개의 물리적 서버
* SQL Server - 사용자 데이터, 인벤토리, 정적 데이터
* 3개의 물리적 서버
* 카산드라 - 메타데이터, 메시지 추적
Kafka 서버 10대 - 메시지 집계 및 배치 삽입 추적
* 애플리케이션 서버 - 고객 프런트엔드, 주문/통관용 미들웨어
* 20개의 물리적 서버에 걸쳐 60개의 가상 머신
* Tomcat - Java 서비스
* Nginx - 정적 콘텐츠
* 배치 서버
수납 가전제품
* 가상 머신(VM) 호스트용 iSCSI
* 파이버 채널 스토리지 영역 네트워크(FC SAN) - SQL 서버 스토리지
* 네트워크 연결 스토리지(NAS) 이미지 저장, 로그, 백업
* 아파치 하둡/스파크 서버 10대
* 코어 데이터 레이크
* 데이터 분석 작업 부하
* 기타 서버 20대
* 젠킨스, 모니터링, 배스천 호스트,
비즈니스 요구사항
* 확장 가능한 프로덕션 환경을 구축하여 안정적이고 재현 가능한 환경을 조성하십시오.
* 분석을 위해 중앙 집중식 데이터 레이크에 데이터를 집계합니다.
* 과거 데이터를 활용하여 향후 출하량에 대한 예측 분석을 수행합니다.
* 독자적인 기술을 사용하여 전 세계 모든 배송을 정확하게 추적합니다.
* 새로운 자원을 신속하게 제공하여 비즈니스 민첩성과 혁신 속도를 향상시키십시오.
* 클라우드 환경에서 성능을 극대화하기 위한 아키텍처를 분석하고 최적화합니다.
* 다른 모든 요구 사항이 충족되면 클라우드로 완전히 마이그레이션하십시오.
기술 요구사항
* 스트리밍 데이터와 배치 데이터를 모두 처리할 수 있습니다.
* 기존 하둡 워크로드를 마이그레이션합니다
* 회사의 변화하는 요구 사항을 충족할 수 있도록 아키텍처가 확장 가능하고 유연한지 확인하십시오.
* 가능한 한 관리형 서비스를 사용하십시오.
* 데이터 전송 및 저장 시 암호화
* 운영 데이터 센터와 클라우드 환경 간에 VPN을 연결하세요. SEO 설명: 우리는 너무 빠르게 성장해서 인프라를 업그레이드할 수 없는 상황이 향후 성장과 효율성을 심각하게 저해하고 있습니다. 우리는 전 세계로 화물을 운송하는 데는 효율적이지만, 데이터를 이동시키는 데는 비효율적입니다.
고객이 어디에 있는지, 무엇을 배송하는지 더 쉽게 파악할 수 있도록 정보를 체계적으로 정리해야 합니다.
CTO 성명서
저희 회사는 IT를 우선순위에 둔 적이 없어서 데이터가 늘어나는 동안 기술 투자를 충분히 하지 못했습니다. IT 관리팀은 훌륭하지만, 인프라 관리에만 급급해서 정작 중요한 업무, 예를 들어 데이터 정리, 분석 시스템 구축, CFO의 추적 기술 도입 등에 집중할 시간이 없습니다.
최고재무책임자(CFO) 성명서
저희 경쟁력의 일부는 배송 지연에 대해 스스로 불이익을 주는 데 있습니다. 배송 상황을 항상 파악하는 것은 수익성과 직결되는 중요한 요소입니다. 또한, 서버 환경 구축에 자본을 투자하고 싶지 않습니다.
Flowlogistic은 실시간 재고 추적 시스템을 도입하고 있습니다. 모든 추적 장치는 패키지 추적 메시지를 전송하며, 이 메시지는 기존의 Apache Kafka 클러스터 대신 단일 Google Cloud Pub/Sub 토픽으로 전송됩니다. 구독 애플리케이션은 이 메시지를 처리하여 실시간 보고서를 생성하고, 과거 분석을 위해 Google BigQuery에 저장합니다. 따라서 패키지 데이터의 시간 경과에 따른 분석이 가능하도록 하는 것이 중요합니다.
어떤 접근 방식을 취해야 할까요?
회사 개요
Flowlogistic은 선도적인 물류 및 공급망 제공업체입니다. 전 세계 기업들이 자원을 관리하고 최종 목적지까지 운송할 수 있도록 지원합니다. 이 회사는 빠르게 성장하여 철도, 트럭, 항공 및 해상 운송을 포함한 다양한 서비스로 확장해 왔습니다.
회사 개요
이 회사는 지역 트럭 운송 회사로 시작하여 다른 물류 시장으로 확장했습니다. 하지만 인프라를 업데이트하지 않아 주문 및 배송 관리와 추적에 병목 현상이 발생하고 있습니다. 운영 개선을 위해 Flowlogistic은 소포 단위의 실시간 배송 추적 기술을 자체 개발했습니다. 그러나 Apache Kafka 기반의 기술 스택이 처리량을 감당할 수 없어 해당 기술을 배포하지 못하고 있습니다. 또한 Flowlogistic은 주문 및 배송에 대한 추가 분석을 통해 자원을 가장 효율적으로 배분하는 방법을 모색하고자 합니다.
솔루션 컨셉
Flowlogistic은 클라우드를 사용하여 두 가지 개념을 구현하고자 합니다.
* 자사 고유 기술을 활용하여 실시간 재고 추적 시스템을 구축하고 화물의 위치를 파악합니다.
* 모든 주문 및 배송 기록(정형 및 비정형 데이터 포함)에 대한 분석을 수행하여 리소스를 가장 효율적으로 배분하는 방법과 정보 확장 대상 시장을 결정합니다. 또한 예측 분석을 활용하여 배송 지연 가능성을 미리 파악하고자 합니다.
기존 기술 환경
Flowlogistic 아키텍처는 단일 데이터 센터에 있습니다.
* 데이터베이스
* 2개 클러스터에 8개의 물리적 서버
* SQL Server - 사용자 데이터, 인벤토리, 정적 데이터
* 3개의 물리적 서버
* 카산드라 - 메타데이터, 메시지 추적
Kafka 서버 10대 - 메시지 집계 및 배치 삽입 추적
* 애플리케이션 서버 - 고객 프런트엔드, 주문/통관용 미들웨어
* 20개의 물리적 서버에 걸쳐 60개의 가상 머신
* Tomcat - Java 서비스
* Nginx - 정적 콘텐츠
* 배치 서버
수납 가전제품
* 가상 머신(VM) 호스트용 iSCSI
* 파이버 채널 스토리지 영역 네트워크(FC SAN) - SQL 서버 스토리지
* 네트워크 연결 스토리지(NAS) 이미지 저장, 로그, 백업
* 아파치 하둡/스파크 서버 10대
* 코어 데이터 레이크
* 데이터 분석 작업 부하
* 기타 서버 20대
* 젠킨스, 모니터링, 배스천 호스트,
비즈니스 요구사항
* 확장 가능한 프로덕션 환경을 구축하여 안정적이고 재현 가능한 환경을 조성하십시오.
* 분석을 위해 중앙 집중식 데이터 레이크에 데이터를 집계합니다.
* 과거 데이터를 활용하여 향후 출하량에 대한 예측 분석을 수행합니다.
* 독자적인 기술을 사용하여 전 세계 모든 배송을 정확하게 추적합니다.
* 새로운 자원을 신속하게 제공하여 비즈니스 민첩성과 혁신 속도를 향상시키십시오.
* 클라우드 환경에서 성능을 극대화하기 위한 아키텍처를 분석하고 최적화합니다.
* 다른 모든 요구 사항이 충족되면 클라우드로 완전히 마이그레이션하십시오.
기술 요구사항
* 스트리밍 데이터와 배치 데이터를 모두 처리할 수 있습니다.
* 기존 하둡 워크로드를 마이그레이션합니다
* 회사의 변화하는 요구 사항을 충족할 수 있도록 아키텍처가 확장 가능하고 유연한지 확인하십시오.
* 가능한 한 관리형 서비스를 사용하십시오.
* 데이터 전송 및 저장 시 암호화
* 운영 데이터 센터와 클라우드 환경 간에 VPN을 연결하세요. SEO 설명: 우리는 너무 빠르게 성장해서 인프라를 업그레이드할 수 없는 상황이 향후 성장과 효율성을 심각하게 저해하고 있습니다. 우리는 전 세계로 화물을 운송하는 데는 효율적이지만, 데이터를 이동시키는 데는 비효율적입니다.
고객이 어디에 있는지, 무엇을 배송하는지 더 쉽게 파악할 수 있도록 정보를 체계적으로 정리해야 합니다.
CTO 성명서
저희 회사는 IT를 우선순위에 둔 적이 없어서 데이터가 늘어나는 동안 기술 투자를 충분히 하지 못했습니다. IT 관리팀은 훌륭하지만, 인프라 관리에만 급급해서 정작 중요한 업무, 예를 들어 데이터 정리, 분석 시스템 구축, CFO의 추적 기술 도입 등에 집중할 시간이 없습니다.
최고재무책임자(CFO) 성명서
저희 경쟁력의 일부는 배송 지연에 대해 스스로 불이익을 주는 데 있습니다. 배송 상황을 항상 파악하는 것은 수익성과 직결되는 중요한 요소입니다. 또한, 서버 환경 구축에 자본을 투자하고 싶지 않습니다.
Flowlogistic은 실시간 재고 추적 시스템을 도입하고 있습니다. 모든 추적 장치는 패키지 추적 메시지를 전송하며, 이 메시지는 기존의 Apache Kafka 클러스터 대신 단일 Google Cloud Pub/Sub 토픽으로 전송됩니다. 구독 애플리케이션은 이 메시지를 처리하여 실시간 보고서를 생성하고, 과거 분석을 위해 Google BigQuery에 저장합니다. 따라서 패키지 데이터의 시간 경과에 따른 분석이 가능하도록 하는 것이 중요합니다.
어떤 접근 방식을 취해야 할까요?
