DSA-C03 문제 76
웹사이트 사용자 활동을 나타내는 타임스탬프가 포함된 데이터세트를 사용하고 있습니다. 타임스탬프는 'website_activity'라는 Snowflake 테이블에 'YYYY-MM-DD HH:MI:SS.SSSSSS' 형식의 문자열로 저장됩니다. 이 타임스탬프에서 시간을 추출하고 사인 및 코사인 변환을 사용하여 순환 특성으로 인코딩해야 합니다. 이는 하루 종일 사용자 활동의 순환적 특성(예: 23:00과 00:00은 시간적으로 근접함)을 포착하기 위한 것입니다. 다음 Snowflake SQL 코드 조각 중 이 순환 인코딩을 올바르게 구현하고 'hour_sin' 및 'hour_cos' 열을 생성하는 것은 무엇입니까?
DSA-C03 문제 77
Snowflake를 사용하여 고객 이탈을 예측하는 모델을 개발하고 있습니다. 데이터 세트는 규모가 크고 지속적으로 증가하고 있습니다. 모델 학습 및 추론 성능을 최적화하기 위해 분할 전략을 구현해야 합니다. 다음과 같은 분할 전략을 고려합니다. 1. '고객 세그먼트'별 분할(예: '고가', '중가', '저가'). 2. '가입일'별 분할(예: 월별 분할). 3. '지역'별 분할(예: '북미', '유럽', '아시아'). 다음 중 Snowflake 환경, 특히 모델 학습 및 추론 측면에서 이러한 분할 전략의 잠재적 이점과 단점을 정확하게 설명하는 것은 무엇입니까?
DSA-C03 문제 78
사기 탐지 모델을 개발 중이며 거래 데이터를 준비해야 합니다. 'transactions' 테이블(transaction_id, customer_id, transaction_date, amount, merchant_id)과 (merchant_id, city, state) 두 개가 있습니다. Snowpark를 사용하여 다음과 같은 데이터 정리 및 특성 엔지니어링 단계를 수행해야 합니다. 1. 'transaction_id'를 기준으로 중복 거래를 제거합니다. 2.
'transactions' 테이블과 'merchant_locations' 테이블을 연결하여 각 거래에 도시와 주 정보를 추가합니다. 3. 거래 금액을 기준으로 '낮음', '보통', '높음'으로 분류되는 'amount_category'라는 새 기능을 만듭니다. 4. 분류 임계값은 다음과 같이 정의됩니다. '낮음: 금액 < 50 '보통': 50 금액 < 200 '높음': 금액 >= 200 Snowpark를 사용하여 이러한 작업을 수행하는 것에 대한 다음 설명 중 정확한 것은 무엇입니까?
'transactions' 테이블과 'merchant_locations' 테이블을 연결하여 각 거래에 도시와 주 정보를 추가합니다. 3. 거래 금액을 기준으로 '낮음', '보통', '높음'으로 분류되는 'amount_category'라는 새 기능을 만듭니다. 4. 분류 임계값은 다음과 같이 정의됩니다. '낮음: 금액 < 50 '보통': 50 금액 < 200 '높음': 금액 >= 200 Snowpark를 사용하여 이러한 작업을 수행하는 것에 대한 다음 설명 중 정확한 것은 무엇입니까?
DSA-C03 문제 79
Snowpark를 사용하여 대출 불이행 가능성을 예측하는 모델을 구축하고 Snowflake UDF로 배포했습니다. 현재 신청자 데이터가 포함된 별도의 Snowflake 테이블 'LOAN APPLICATIONS'를 입력으로 사용하고 있습니다. 몇 주간의 운영 후 모델의 정확도가 크게 떨어졌음을 확인했습니다. 원래 학습 데이터는 저금리와 안정적인 경제 상황 속에서 수집되었습니다. Snowflake 환경에서 이러한 성능 저하의 잠재적 원인을 파악하고 모델 재학습의 필요성을 판단하는 데 가장 효과적인 전략은 무엇입니까?
DSA-C03 문제 80
Snowflake Tasks와 저장 프로시저를 사용하여 Snowflake에서 판매 예측 모델에 대한 자동화된 모델 재학습 파이프라인을 구축하고 있습니다. 재학습 후, 이미 배포된 챔피언 모델과 비교하여 새 모델을 검증하려고 합니다. 다음 모델을 사용하여 검증 전략을 정의해야 합니다. 챔피언 모델은 UDF "FORECAST UDF"로 배포되고, 경쟁 모델은 UDF "FORECAST UDF NEW"로 배포됩니다. 다음과 같은 목표를 고려합니다. (1) 운영 지연 시간에 미치는 영향 최소화, (2) 대량의 실시간 데이터에서 예측 비교 가능, (3) 통계적으로 타당한 비교 지표. 다음 SQL 문 중 샘플 데이터세트에서 두 모델의 예측을 효율적으로 비교하고 새 모델의 검증을 위해 평균 제곱근 오차(RMSE)를 계산하는 방법을 가장 잘 나타내는 것은 무엇입니까?
