DSA-C03 문제 71

Snowflake ML을 사용하여 모델을 학습시켰고, Snowflake UDF를 사용하여 실시간 예측에 배포하려고 합니다. 지연 시간을 최소화하려면 UDF의 성능을 최적화해야 합니다. Snowflake에서 모델 추론용 UDF를 생성하고 배포할 때, 특히 모델이 큰 경우(예: 100MB 이상) 지연 시간을 최소화하기 위해 다음 중 가장 중요한 전략과 고려 사항은 무엇입니까?
해당되는 모든 항목을 선택하세요.

DSA-C03 문제 72

Snowflake에서 고객 거래 데이터를 분석하여 사기 행위를 식별하고 있습니다. '거래 금액' 열은 우측으로 치우친 분포를 보입니다. 다음 Snowflake 쿼리 중 사분위 범위(IQR) 방식을 기반으로 이상치를 식별하는 데 가장 효과적인 쿼리는 무엇일까요? 특히 비정상적으로 큰 거래 금액을 타겟팅하는 쿼리는 무엇일까요? Snowflake 세션에서 IQR은 이미 변수로, QI는 변수로, Q3는 변수로 계산되었다고 가정합니다.

DSA-C03 문제 73

Snowflake 테이블에 저장된 'transactions'라는 대용량 데이터세트에 대해 Python용 Snowpark를 사용하여 피처 엔지니어링을 수행하고 있습니다. 'transaction_amount' 열을 기반으로 'transaction_size category'라는 새 피처를 생성해야 합니다. 각 피처는 다음과 같이 정의됩니다. Small(amount < 10), Medium(amount < 100), Large(amount 100). Snowflake의 병렬 처리 기능을 활용하여 성능을 최적화하려고 합니다. 다음 Snowpark for Python 코드 조각 중 가장 효율적이고 Python적인 방법은 무엇입니까?

DSA-C03 문제 74

크기, 침실 수, 위치, 연령 등 구조화된 데이터를 기반으로 주택 가격을 예측하는 모델을 개발하고 있습니다. Snowflake에서 선형 회귀 모델을 구축했습니다. 평가 과정에서 잔차가 이분산성을 보이는 것을 확인했습니다. Snowflake의 기본 제공 기능을 주로 사용하여 솔루션을 구현하려는 경우, 이 시나리오에서 이분산성을 해결하기에 가장 적합하지 않은 조치는 무엇입니까?

DSA-C03 문제 75

Snowflake에서 주택 가격을 예측하기 위한 선형 회귀 모델을 구축하고 있습니다. 'square_footage', 'number of bedrooms', 'location id', 그리고 'year'라는 피처가 있습니다. 'location id'는 여러 지역을 나타내는 범주형 변수입니다. 'square footage'와 'price'의 관계는 'location id'에 따라 달라질 수 있다고 생각합니다. Snowflake에서 다음 중 이러한 잠재적 상호작용 효과를 탐색하고 모델링하는 데 가장 적합한 접근 방식은 무엇입니까?