Professional-Data-Engineer 문제 136

당신은 의류 추천 모델을 구축하고 있습니다. 사용자의 패션 선호도는 시간이 지남에 따라 변할 가능성이 높으므로, 새로운 데이터가 생성되는 즉시 모델에 반영할 수 있도록 데이터 파이프라인을 구축합니다.
이 데이터를 어떻게 활용하여 모델을 학습시켜야 할까요?

Professional-Data-Engineer 문제 137

당신은 글로벌 해운 회사에서 근무하고 있습니다. 40TB 규모의 데이터를 사용하여 특정 지역에서 특정 날짜에 배송 지연을 유발할 가능성이 높은 선박을 예측하는 모델을 학습시키려고 합니다. 이 모델은 여러 소스에서 수집된 다양한 속성을 기반으로 합니다. 각 선박에서 위치 정보(GeoJSON 형식)를 포함한 원격 측정 데이터는 매시간 수집되어 데이터에 저장됩니다. 특정 지역에서 배송 지연을 유발할 가능성이 높은 선박의 수와 종류를 보여주는 대시보드를 구축하고자 합니다. 예측 및 지리 공간 처리 기능을 기본적으로 제공하는 스토리지 솔루션을 사용하고자 합니다. 어떤 스토리지 솔루션을 선택해야 할까요?

Professional-Data-Engineer 문제 138

지진 데이터를 분석하는 시스템을 설계했습니다. 추출, 변환, 로드(ETL) 프로세스는 Apache Hadoop 클러스터에서 MapReduce 작업 시리즈로 실행됩니다. 일부 단계의 계산 비용이 많이 들기 때문에 ETL 프로세스는 데이터 세트를 처리하는 데 며칠이 걸립니다. 그런데 센서 보정 단계가 누락된 것을 발견했습니다. 향후 센서 보정을 체계적으로 수행하도록 ETL 프로세스를 어떻게 변경해야 할까요?

Professional-Data-Engineer 문제 139

다음 중 Dataproc 클러스터 인스턴스의 소프트웨어를 사용자 지정하는 방법이 아닌 것은 무엇입니까?

Professional-Data-Engineer 문제 140

1000개의 센서로 구성된 네트워크가 있습니다. 각 센서는 초당 하나의 메트릭과 타임스탬프를 포함하는 시계열 데이터를 생성합니다. 현재 1TB의 데이터가 있으며, 매일 1GB씩 증가할 것으로 예상됩니다. 이 데이터에 접근하는 방법은 두 가지입니다. 첫 번째 접근 방식은 특정 타임스탬프에 저장된 특정 센서의 메트릭을 가져오는 것으로, 평균 지연 시간은 한 자릿수 밀리초입니다. 두 번째 접근 방식은 하루에 한 번 조인을 포함한 복잡한 분석 쿼리를 데이터에 적용하는 것입니다. 이 데이터를 어떻게 저장해야 할까요?