DSA-C03 문제 36

소매 회사에서 일하는 데이터 과학자입니다. 사기 거래를 식별하는 업무를 맡았습니다. 'TRANSACTIONS'라는 이름의 Snowflake 테이블이 있으며, 이 테이블에는 'TRANSACTION ID', 'AMOUNT', 'TRANSACTION DATE', 'CUSTOMER ID', 'LOCATION' 열이 있습니다. 거래 금액의 이상치가 사기를 나타낼 수 있다고 의심됩니다. 다음 SQL 쿼리 중 사분위 범위(IQR) 방법을 사용하여 잠재적 이상치를 식별하고, 견고한 백분위수 계산에 필요한 데이터 유형을 고려하는 데 가장 효율적이고 적절한 것은 무엇입니까? 또한 대규모 데이터 세트에서 각 접근 방식과 관련된 계산 비용도 고려하십시오.

DSA-C03 문제 37

Snowpark Python을 사용하여 주택 가격을 예측하는 머신 러닝 모델을 구축하고 있습니다. 데이터세트에는 주택 위치에 대한 자유 형식 텍스트 설명이 포함된 'location'이라는 피처 열이 포함되어 있습니다. 외부에서 호스팅되는 사전 학습된 대규모 언어 모델(LLM)을 활용하여 Snowpark 내의 자유 형식 텍스트에서 도시, 주, 우편번호와 같은 구조화된 위치 피처를 추출하려고 합니다. Snowflake 외부로 전송되는 데이터를 최소화하려고 합니다. 어떤 접근 방식이 가장 효율적이고 안전할까요?

DSA-C03 문제 38

Snowflake에 거래 데이터를 저장하는 소매 회사에서 일하는 데이터 과학자입니다. 고객 구매 내역 데이터에 대한 피처 엔지니어링을 수행하여 고객 이탈 예측 모델을 구축해야 합니다. 다음 중 Snowflake의 기능과 scikit-learn과 같은 머신러닝 프레임워크를 결합하여 효율적인 피처 엔지니어링을 구현하는 가장 효과적인 방법은 무엇일까요? 데이터가 '고객 ID', '거래 날짜', '금액', '제품 범주'와 같은 열을 가진 '고객 거래'라는 테이블에 저장되어 있다고 가정해 보겠습니다.

DSA-C03 문제 39

Snowflake에 저장된 데이터를 사용하여 대출 불이행을 예측하는 모델을 구축하고 있습니다. Snowflake Notebook 내에서 피처 엔지니어링 프로세스의 일환으로 'annual_income' 및 'annual_income' 열의 결측값을 처리해야 합니다. 결측값을 중앙값으로, 'annual_income'을 평균으로, 그리고 상수 값 0.5로 대체하는 등 여러 가지 대체 전략을 조합하여 사용하고자 합니다. Snowpark DataFrame API를 활용하고 있습니다. 다음 중 이 대체 전략을 올바르게 구현한 코드 조각은 무엇입니까?

DSA-C03 문제 40

한 금융 기관이 Snowflake에 구축된 지도 학습 모델을 사용하여 사기 거래를 탐지하고자 합니다. 이 기관은 거래 금액, 타임스탬프, 가맹점 카테고리, 고객 ID 등 거래 세부 정보가 포함된 데이터셋을 가지고 있습니다. 목표 변수는 'is_fraudulent'(0 또는 1)입니다. 이 기관은 다양한 지도 학습 알고리즘을 고려하고 있습니다. 해석 가능성, 확장성, 그리고 불균형 클래스의 가능성을 고려할 때, 다음 중 어떤 알고리즘이 이 사기 탐지 작업에 가장 적합할까요? 그리고 Snowflake 내에서 클래스 불균형을 처리하기 위해 사용할 수 있는 구체적인 전략은 무엇일까요?