Professional-Data-Engineer 문제 231

아래와 같은 고객 데이터를 분석하기 위해 Google Dataflow SDK를 사용할 계획입니다. 프로젝트 요구 사항은 데이터 소스에서 고객 이름만 추출하여 출력 PCollection에 저장하는 것입니다.
톰, 555 X 스트리트
팀, Y 스트리트 553번지
샘, Z 스트리트 111번지
위의 데이터 처리 요구사항에 가장 적합한 연산은 무엇입니까?

Professional-Data-Engineer 문제 232

며칠 동안 CSV(쉼표로 구분된 값) 파일에서 데이터를 가져와 Google BigQuery의 CLICK_STREAM 테이블에 로드했습니다. DT 열에는 클릭 이벤트의 에포크 시간이 저장됩니다. 편의상 모든 필드를 문자열(STRING) 유형으로 처리하는 간단한 스키마를 선택했습니다. 이제 사이트를 방문하는 사용자의 웹 세션 지속 시간을 계산하고 데이터 유형을 타임스탬프(TIMESTAMP)로 변경하려고 합니다. 향후 쿼리의 계산 비용을 증가시키지 않으면서 마이그레이션 작업을 최소화하고 싶습니다. 어떻게 해야 할까요?

Professional-Data-Engineer 문제 233

귀사에서는 유사한 이름을 가진 여러 테이블의 데이터를 조회하기 위해 WHILECARD 테이블을 사용하고 있습니다. 현재 SQL 문에서 다음과 같은 오류가 발생하며 실행이 실패하고 있습니다.
# 구문 오류: 문장의 끝이 예상되었지만 [4:11]에서 "-"가 나왔습니다.
나이를 선택하세요
에서
bigquery-public-data.noaa_gsod.gsod
어디
나이 != 99세
AND_TABLE_SUFFIX = '1929'
순서대로
나이 설명
어떤 테이블 이름을 사용해야 SQL 문이 올바르게 작동할까요?

Professional-Data-Engineer 문제 234

You are developing an Apache Beam pipeline to extract data from a Cloud SQL instance by using JdbclO. You have two projects running in Google Cloud. The pipeline will be deployed and executed on Dataflow in Project A. The Cloud SQL instance is running jn Project B and does not have a public IP address. After deploying the pipeline, you noticed that the pipeline failed to extract data from the Cloud SQL instance due to connection failure. You verified that VPC Service Controls and shared VPC are not in use in these projects. You want to resolve this error while ensuring that the data does not go through the public internet. What should you do?

Professional-Data-Engineer 문제 235

귀사의 금융 서비스 회사는 클라우드 기술로 전환하면서 50TB 규모의 금융 시계열 데이터를 클라우드에 저장하려고 합니다. 이 데이터는 자주 업데이트되며 새로운 데이터가 끊임없이 유입될 예정입니다. 또한, 기존 Apache Hadoop 작업도 클라우드로 이전하여 이 데이터를 분석하고 인사이트를 얻고자 합니다.
데이터를 저장하기 위해 어떤 제품을 사용해야 할까요?