Professional-Data-Engineer 문제 206

며칠 동안 CSV(쉼표로 구분된 값) 파일에서 데이터를 가져와 Google BigQuery의 CLICK_STREAM 테이블에 로드했습니다. DT 열에는 클릭 이벤트의 에포크 시간이 저장됩니다. 편의상 모든 필드를 문자열(STRING) 유형으로 처리하는 간단한 스키마를 선택했습니다. 이제 사이트를 방문하는 사용자의 웹 세션 지속 시간을 계산하고 데이터 유형을 타임스탬프(TIMESTAMP)로 변경하려고 합니다. 향후 쿼리의 계산 비용을 증가시키지 않으면서 마이그레이션 작업을 최소화하고 싶습니다. 어떻게 해야 할까요?

Professional-Data-Engineer 문제 207

클라우드 Dataproc 클러스터를 관리하고 있습니다. 클러스터에서 진행 중인 작업을 손실하지 않으면서 비용을 최소화하고 작업 속도를 높여야 합니다. 어떻게 해야 할까요?

Professional-Data-Engineer 문제 208

당신은 대형 전자상거래 회사에서 근무하고 있습니다. Pub/Sub 기능을 사용하여 클릭스트림 데이터를 Google Cloud에 수집하고 분석하고 있습니다. 그런데 새로운 구독자가 기존 주제에 연결하여 데이터를 분석하려고 할 때, 두 달 후 예정된 연례 할인 행사와 관련된 이전 데이터는 구독할 수 없다는 것을 발견했습니다. 따라서 구현 후에는 모든 신규 구독자가 최근 30일간의 데이터를 읽을 수 있도록 하는 솔루션이 필요합니다. 어떻게 해야 할까요?

Professional-Data-Engineer 문제 209

구글이 빅쿼리에서 요금을 부과하는 모든 작업은 무엇인가요?

Professional-Data-Engineer 문제 210

한 조직에서 사용자 수준 데이터가 포함된 테이블이 있는 Google BigQuery 데이터 세트를 관리하고 있습니다. 이 조직은 사용자 수준 데이터에 대한 접근 권한을 제어하면서 이 데이터의 집계 결과를 다른 Google Cloud 프로젝트에 공개하고자 합니다. 또한 전체 스토리지 비용을 최소화하고 다른 프로젝트의 분석 비용이 해당 프로젝트에 할당되도록 해야 합니다. 이 조직은 어떻게 해야 할까요?