SPS-C01 문제 1
'order_id', 'product_id', 'sale_date'(DATE), 'sale_amount' 열을 가진 Snowpark DataFrame이 있습니다. 다음 변환을 수행해야 합니다. 1. 2023년 1월 1일 이전의 판매 기록을 필터링합니다. 2. 'product_id'를 기준으로 데이터를 그룹화하고 각 제품의 총 'sale_amount'를 계산합니다. 3. 각 제품의 총 'sale_amount'를 고유한 'order_id'의 개수로 나누어 'average_sale_amount'라는 새 열을 생성합니다. 집계 함수에 별칭을 지정해야 합니다. 다음 Snowpark 코드 조각 중 이러한 변환을 올바르게 구현한 것은 무엇입니까?
SPS-C01 문제 2
고객 리뷰에 대한 감정 분석을 수행하는 Snowpark Python UDF가 있습니다. 이 UDF는 Snowflake 스테이지에 파일 형태로 저장된 사전 학습된 머신러닝 모델을 사용합니다. 보안을 강화하기 위해 안전한 UDF를 만들고자 합니다. 이를 위해 필요한 단계는 무엇일까요?
SPS-C01 문제 3
'events'라는 테이블의 'payload'라는 VARIANT 열에 저장된 복잡한 JSON 구조로부터 Snowpark DataFrame을 생성해야 합니다. 'payload'에는 중첩된 객체와 배열이 포함되어 있으며, 특정 필드를 DataFrame의 별도 열로 추출해야 합니다. 추출해야 하는 필드는 JSON 최상위 레벨의 'event_id'(INT), 'payload' 내부에 중첩된 'user' 객체의 'user_id'(INT), 그리고 역시 'payload' 내부에 중첩된 'tags' 배열의 첫 번째 요소(VARCHAR)입니다. 다음 코드 조각 중 'StructType'과 'StructField'를 사용하여 스키마를 올바르게 정의하고, 'events' 테이블에 여러 행이 있다고 가정할 때 DataFrame 생성 시 이를 적용하는 코드는 무엇입니까?
SPS-C01 문제 4
당신은 'CUSTOMER DATA'라는 Snowflake 테이블에 저장된 대규모 데이터 세트를 처리하는 Snowpark Python 애플리케이션을 개발하고 있습니다. 이 애플리케이션은 Snowpark의 지연 평가 및 쿼리 최적화를 활용하여 복잡한 데이터 변환 및 집계를 수행해야 합니다. 다음 중 리소스 활용 및 성능 측면에서 가장 효율적인 실행을 가져오는 접근 방식은 무엇일까요?
SPS-C01 문제 5
한 금융 회사가 Snowpark Python을 사용하여 주식 거래 데이터를 분석하고 있습니다. 'trades'라는 이름의 DataFrame에는 'trade_id', 'stock_symbol', 'trade_price', 'trade_timestamp' 열이 있습니다. 이 회사는 다음과 같은 기준에 따라 잠재적으로 사기성 거래를 식별하고자 합니다. 1. 'trade_price'가 지난 한 시간 동안 해당 'stock_symbol'의 평균 가격에서 크게 벗어난 거래. 2. 거래 가격이 1,000달러 이상인 사용자 계정에서 발생한 거래. 3. 주식 기호가 'XYZ'인 거래. 이 회사는 사기성 거래만 추출하기 위해 DataFrame에 여러 필터를 적용하고자 하며, Snowpark를 사용하여 효율적이고 간결한 접근 방식을 필요로 합니다. 'trade_price' > 1000을 사용자 식별자로 사용할 때, 다음 코드 조각 중 이 필터링 로직을 가장 정확하고 효율적으로 구현하는 것은 무엇입니까? Snowflake 사용자는 거래에 사용할 수 있는 최대 금액이 정해져 있으며, 따라서 사용자 ID는 'trade_price'와 연결되어 있다고 가정합니다.
