SPS-C01 문제 76
데이터 엔지니어링 팀은 고객 주문을 처리하고, 외부 데이터(예: 지리적 위치, 날씨)를 추가하여 Customer360 테이블을 업데이트하는 Snowpark Python 애플리케이션을 개발했습니다. 이 애플리케이션은 운영 환경에 배포되었습니다. 지난주부터 애플리케이션의 지연 시간이 크게 증가했습니다. 조사 결과, 애플리케이션에서 사용하는 Snowflake 데이터 웨어하우스가 '확장 중'과 '축소 중' 상태를 지속적으로 전환하고 있는 것으로 나타났습니다. 팀은 자동 일시 중단 시간을 5분으로, 자동 재개를 '참'으로 설정했습니다. 팀에서 코드, 외부 API 또는 데이터 수집 관련 매개변수를 변경하지 않았다고 가정할 때, 상당한 비용 증가 없이 데이터 웨어하우스 불안정 문제를 해결하고 운영 환경에서 Snowpark 애플리케이션의 성능을 향상시킬 수 있는 가장 효과적인 조치는 다음 중 무엇일까요?
SPS-C01 문제 77
'employee_data'라는 이름의 Snowpark 데이터프레임이 있으며, 'employee_id', 'department', 'salary', 'hire date' 열이 있습니다. 다음 변환을 수행해야 합니다. 1. 각 부서의 평균 급여를 계산합니다. 2. 각 직원에 대해 해당 직원의 급여를 부서 평균 급여와 비교합니다(급여 - 부서 평균 급여). 3. 급여가 부서 평균 급여보다 낮은 직원을 제외합니다. 4. 'employee_id', 'department', 'salary' 및 해당 직원의 급여와 부서 평균 급여의 차이를 표시합니다. 다음 중 올바르고 효율적인 Snowpark 구현은 무엇입니까?
SPS-C01 문제 78
Snowpark Python을 사용하여 'SALES DATA'라는 Snowflake 테이블에 저장된 판매 데이터를 분석하려고 합니다. 이 테이블에는 'PRODUCT ICY', 'REGION', 'SALE DATE' 열이 있습니다. 각 지역별 각 제품의 총 판매액을 계산해야 합니다. 'group_by' 및 'agg' 함수를 사용할 예정입니다. 다음 Snowpark Python 코드 조각 중 집계를 올바르게 수행하고 집계된 열의 이름을 'TOTAL SALES'로 변경하는 코드는 무엇입니까? ('session'은 유효한 Snowpark 세션 객체라고 가정합니다.)
SPS-C01 문제 79
Snowpark DataFrame이 있고, 각 고객의 평균 구매 금액을 계산하는 저장 프로시저를 만들려고 합니다. 이 저장 프로시저는 DataFrame을 입력으로 받아 집계를 수행하고 결과를 담은 새로운 DataFrame을 반환해야 합니다. 다음 코드 조각 중 이 저장 프로시저를 올바르게 정의하고 배포하는 방법을 가장 잘 보여주는 것은 무엇입니까?
SPS-C01 문제 80
데이터 엔지니어링 팀이 Snowpark Python을 사용하여 데이터 파이프라인을 구축하고 있습니다. 고객 정보를 나타내는 JSON 문자열 열을 '이름', '나이', '도시' 필드를 평면화한 STRUCT 타입으로 변환하는 사용자 정의 함수(UDF)를 생성해야 합니다. 이 UDF는 null 값을 적절하게 처리하고, 입력 JSON이 유효하지 않거나 '이름' 필드가 없는 경우 NULL을 반환해야 합니다. 성능 및 오류 처리를 고려할 때, 다음 중 이 UDF를 정의하고 등록하는 데 가장 적합한 접근 방식은 무엇일까요?
