DSA-C03 문제 11
'웹사이트 방문'이라는 Snowflake 테이블이 있고, 이 테이블에는 'user id', 'visit_date', 'user_id' 열이 있습니다. 특정 페이지 URL에서 지속적으로 많은 시간을 소비하는 사용자를 파악해야 합니다. 각 페이지 URL에서 사용자당 평균 소비 시간을 계산하여 사용자가 평균적으로 가장 많은 시간을 소비하는 상위 10개 페이지 URL을 찾고 싶습니다. Snowflake에서 이 목표를 달성하기 위해 다음 중 가장 효율적이고 정확한 방법은 무엇입니까?
DSA-C03 문제 12
소매업체의 매출을 예측하기 위해 Snowflake에서 Python 저장 프로시저를 개발하고 있습니다. 외부 데이터(예: 날씨 예보)를 모델에 통합하려고 합니다. 다음 중 Snowflake Python 저장 프로시저 내에서 외부 데이터에 액세스하고 사용하는 데 유효하고 효율적인 방법은 무엇입니까?
DSA-C03 문제 13
Snowflake 고객의 연간 중위소득에 대한 95% 신뢰구간을 추정하는 과제를 받았습니다. 소득 분포가 비정규적이고 표본 크기가 비교적 작기 때문에(n=50), 부트스트래핑을 사용하기로 결정했습니다. 'customer_income'이라는 이름의 Snowflake 테이블에 'annual_income' 열이 있습니다. Snowflake와 상호 작용하는 Python 스크립트 내에서 다음 SQL 코드 조각을 올바르게 구현했을 때, 1,000번의 재샘플링을 사용한 부트스트래핑을 통해 신뢰구간을 정확하게 계산하고 이 목표를 가장 정확하게 달성할 수 있는 것은 무엇입니까?
DSA-C03 문제 14
Snowflake에서 시계열 예측을 수행하기 위해 Python UDTF를 개발하고 있습니다. UDTF 내에서 피처 엔지니어링 프로세스의 일부로 외부 REST API의 데이터를 통합해야 합니다. 그러나 간헐적인 네트워크 연결 문제로 인해 UDTF가 중단됩니다. 이러한 네트워크 오류를 원활하게 처리하고 외부 데이터를 사용할 수 없을 때 예측 정확도가 떨어질 수 있지만, UDTF가 계속 작동하도록 강력한 오류 처리 메커니즘을 구현하고자 합니다. 다음 중 Python UDTF 내에서 이러한 네트워크 오류를 처리하는 데 가장 적합하고 효과적인 방법은 무엇입니까?
DSA-C03 문제 15
Snowflake 테이블에 저장된 대규모 센서 판독값 데이터 세트를 사용하고 있습니다. 각 센서에 대해 특정 기간 동안 이동 평균 등의 롤링 통계를 계산하는 등 여러 복잡한 피처 엔지니어링 단계를 수행해야 합니다. 이 작업에는 Snowpark Pandas를 사용하고자 합니다. 하지만 데이터 세트가 너무 커서 Snowpark Pandas 작업자 한 명의 메모리에 모두 담을 수 없습니다. 메모리 제한을 초과하지 않고 롤링 통계 계산을 효율적으로 수행하려면 어떻게 해야 할까요? 해당하는 모든 옵션을 선택하세요.
