DSA-C03 문제 21

일일 판매 거래 내역이 포함된 '라는 이름의 테이블에 대해 탐색적 데이터 분석을 수행하는 업무를 맡고 있습니다. 이 테이블에는 '거래일', '제품 ID', '수량', '가격'과 같은 열이 포함되어 있습니다. 잠재적인 데이터 품질 문제를 파악하고 판매 분포를 파악하는 것이 목표입니다. Snowflake의 통계 함수와 기능을 사용하는 다음 SQL 쿼리 중 '수량' 열의 이상치, 잠재적인 데이터 왜곡도, 그리고 결측값을 빠르게 식별하는 데 가장 효과적인 것은 무엇입니까?

DSA-C03 문제 22

전자상거래 플랫폼의 사기 탐지 시스템을 개발하고 있습니다. 'TRANSACTIONS' 테이블과 'TRANSACTION AMOUNT' 열이 있습니다. 거래 금액을 명시적인 경계를 사용하여 여러 위험 범주('낮음', '보통', '높음', '매우 높음')로 분류하려고 합니다. 각 범주는 하한값은 포함하고 상한값은 제외해야 합니다(예: [0, 100, [100, 500) 등). 'WIDTH BUCKET' 함수를 사용하여 다음 중 0, 100, 500, 1000, 무한대라는 경계를 가정하고 거래 금액을 범주별로 올바르게 분류하고 적절한 레이블을 지정하는 SQL 문은 무엇입니까?

DSA-C03 문제 23

Snowflake에서 모델 레지스트리를 사용하여 머신러닝 모델 수명 주기를 관리하고 있습니다. 모델 버전 관리 및 배포를 위해 모델 레지스트리를 활용할 때 모델 계보 및 거버넌스와 관련하여 다음 중 참인 것은 무엇입니까?

DSA-C03 문제 24

데이터 과학자가 전자상거래 플랫폼의 웹사이트 전환율을 분석하고 있습니다. 95% 신뢰도로 실제 전환율을 추정하려고 합니다. 10,000명의 웹사이트 방문자 데이터를 수집하여 그중 500명이 구매를 완료한 것으로 확인되었습니다. 이 정보를 바탕으로 이항 분포에 대한 정규 근사(표본 크기가 크기 때문에 적절함)를 가정할 때, 다음 Python 코드 중 scipy를 사용하여 전환율의 95% 신뢰 구간을 정확하게 계산하는 것은 무엇입니까? ('import scipy.stats as St' 및 'import numpy as np'와 같은 표준 import 구문을 가정합니다.)

DSA-C03 문제 25

Snowpark Python을 사용하여 Snowflake에서 사기 탐지 모델을 개발하고 있습니다. 각기 다른 기능 세트와 알고리즘을 가진 여러 버전의 모델을 반복했습니다. 성능 저하 시 재현성과 손쉬운 롤백을 보장하려면 Snowflake 환경 내에서 배포 및 모니터링의 수명 주기 단계에 초점을 맞춰 모델 버전 관리를 어떻게 구현해야 할까요?