DSA-C03 문제 81

고객 ID, 거래 날짜, 거래 금액이 포함된 Snowflake 테이블 '고객 거래'를 사용하고 있습니다. 지도 학습 모델을 사용하여 다음 달에 이탈(거래 중단) 가능성이 높은 고객을 파악해야 합니다. 다음 중 Snowflake 기반 머신러닝 파이프라인에 적합한 이탈 예측 문제에 대한 목표 변수(이탈 여부)를 정의하고 특성을 생성하는 데 가장 적합한 전략은 무엇입니까?

DSA-C03 문제 82

'고객 데이터'라는 Snowflake 테이블에 고객 정보가 포함되어 있으며 '전화번호' 열도 포함되어 있습니다. 데이터 입력 오류로 인해 일부 전화번호는 NULL로 저장되고, 다른 전화번호는 존재하지만 다양한 형식(예: 하이픈, 괄호 또는 국가 코드 포함 여부)으로 저장됩니다. Snowpark for Python을 사용하여 '전화번호' 열을 표준화하고 누락된 값을 대체하려고 합니다. 이미 '고객 데이터' 테이블을 나타내는 '고객 df'라는 Snowpark DataFrame을 생성했습니다. 확장성이 필요하다는 점을 고려할 때, 다음 중 어떤 방법을 조합하여 사용하면 기존 데이터를 정리하고 향후 데이터 수집을 처리하는 데 가장 효율적이고 안정적인가요?

DSA-C03 문제 83

scikit-learn을 사용하여 머신 러닝 모델을 학습시키기 위해 Snowflake에서 Python 저장 프로시저를 개발하고 있습니다. 학습 데이터는 'SALES DATA'라는 Snowflake 테이블에 있습니다. 특성 열(예: 'PRICE', 'QUANTITY')과 대상 열('REVENUE')을 저장 프로시저에 동적으로 전달해야 합니다. 다음 중 SQL 삽입 취약점을 방지하고 저장 프로시저 내 데이터 무결성을 보장하면서 이를 달성하는 가장 안전하고 효율적인 방법은 무엇입니까?

DSA-C03 문제 84

데이터 과학자가 Snowflake에서 Snowpark ML을 사용하여 사기 탐지 모델을 개발하고 있습니다. Snowpark DataFrame 변환으로 구현된 피처 엔지니어링 파이프라인이 있습니다. 이 파이프라인에는 여러 개의 복잡한 UDF가 포함되어 있습니다. 데이터 과학자는 파이프라인 실행 속도가 느리다는 것을 발견했습니다. Snowpark에서 피처 엔지니어링 파이프라인의 성능을 최적화하는 가장 효과적인 기술은 무엇입니까?

DSA-C03 문제 85

Snowflake에서 Python UDTF를 구현하여 수신 데이터를 사용하여 머신 러닝 모델을 증분적으로 학습시켰습니다. UDTF는 처음에는 잘 작동하지만, 처리되는 데이터 양이 크게 증가함에 따라 성능이 눈에 띄게 저하되고 쿼리 실행 시간이 증가합니다. 병목 현상은 UDTF 내에서 모델이 업데이트되고 유지되는 방식과 관련이 있는 것으로 추정됩니다. 다음 중 이 성능 문제를 해결하는 데 가장 효과적인 최적화 전략 또는 전략 조합은 무엇입니까?