DSA-C03 문제 26

Snowflake 내에서 Snowpark를 사용하여 사용자 지정 모델을 배포했습니다. 이 모델은 고객 이탈을 예측하도록 설계되었으며, 사용하기 쉽도록 사용자 정의 함수(UDF)로 래핑했습니다. UDF는 여러 고객 특성을 입력으로 받아 이탈 확률을 반환합니다. 그러나 특히 대규모 고객 배치를 평가할 때 UDF의 성능이 느리다는 것을 알게 되었습니다. 다음 중 Snowflake 내에서 모델 배포 성능을 최적화하는 데 가장 효과적인 전략은 무엇일까요? UDF가 이미 벡터화 기술을 사용하고 있다고 가정해 보겠습니다.

DSA-C03 문제 27

Snowflake에서 통신 회사의 고객 이탈을 예측하는 모델을 학습하는 업무를 맡고 있습니다. 데이터세트는 'CUSTOMER DATA'라는 이름의 Snowflake 테이블에 저장되어 있습니다. 특성에는 'age'와 'data_usage'가 포함됩니다. 대상 변수는 'churned'(부울)입니다. SCIkit-learn을 활용하여 모델 학습을 위해 SNOWFLAKE.ML.ANACONDA INTEGRATION을 사용하려고 합니다. 다음 중 Snowflake ML을 사용하여 모델 학습을 올바르게 수행하고, 특성 확장 및 저장 프로시저 내 데이터 유형 처리와 같은 잠재적 문제를 해결하는 코드 조각은 무엇입니까?

DSA-C03 문제 28

Snowflake ML을 사용하여 이진 분류 모델을 학습하고 있습니다. 학습 후 모델의 성능을 평가해야 합니다. 다음 중 학습된 모델을 평가하는 데 가장 적합한 지표는 무엇이며, 특히 불균형 데이터 세트를 다룰 때 해석에 있어 어떤 차이가 있습니까?

DSA-C03 문제 29

Snowflake에 Snowpark를 사용하여 사기 탐지 모델을 구축하고 성능을 모니터링하고 있습니다. 학습에 사용된 데이터와 비교하여 거래 데이터 분포에 상당한 편차가 있음을 발견했습니다. 이를 해결하기 위해 재학습 전략을 구현하려고 합니다. Snowflake의 기능을 사용하여 재학습 프로세스를 자동화하는 데 가장 중요한 단계는 무엇입니까?

DSA-C03 문제 30

Snowflake에서 거래 내역을 기반으로 고가치 고객을 식별하는 예측 모델을 구축하는 업무를 맡고 있습니다. 'CUSTOMER_TRANSACTIONS' 테이블에는 'TRANSACTION_AMOUNT' 열이 있습니다. 이 열을 이진화하여 거래 금액이 동적으로 계산되는 임계값(거래 금액의 90번째 백분위수)을 초과하면 '고가'로, 그렇지 않으면 '저가'로 분류해야 합니다. 다음 Snowflake SQL 쿼리 중 윈도우 함수를 사용하여 임계값을 계산하고 'CUSTOMER SEGMENT' 열을 생성하여 이진화를 올바르게 수행하는 것은 무엇입니까?