Databricks-Machine-Learning-Professional 문제 1

머신러닝 엔지니어는 시계열 모델을 구축해야 합니다. Databricks에서는 개발, 스테이징 및 프로덕션 환경을 위해 서로 다른 워크스페이스에 격리된 환경을 생성했습니다.
이 모델을 관리하기 위해 "코드 배포" 전략을 사용할 계획입니다. 하지만 개발 환경에서 학습된 모델이 설치된 종속성 차이로 인해 환경 간에 일관성을 유지하지 못할까 봐 우려하고 있습니다. 모델이 동일한 패키지로 학습되도록 하려면 어떻게 해야 할까요?

Databricks-Machine-Learning-Professional 문제 2

데이터 과학자가 scikit-learn 모델(sklearn_model)을 개발했고, MLflow를 사용하여 모델의 로그를 출력하려고 합니다.
그들은 다음과 같은 불완전한 코드 블록을 작성했습니다.

코드 블록이 작업을 성공적으로 완료할 수 있도록 빈칸을 채우는 데 사용할 수 있는 코드 줄은 무엇입니까?

Databricks-Machine-Learning-Professional 문제 3

데이터 과학자가 다음과 같은 스키마를 가진 Spark DataFrame을 반환하는 Python 함수 compute_features를 만들었습니다.

결과로 생성된 DataFrame은 features_df 변수에 할당됩니다. 데이터 과학자는 features_df를 사용하여 Feature Store 테이블을 생성하려고 합니다.
다음 코드 블록 중 어떤 것을 사용하여 Feature Store Client fs를 이용해 Feature Store 테이블을 생성하고 데이터를 채울 수 있습니까?

Databricks-Machine-Learning-Professional 문제 4

머신러닝 엔지니어는 매년 예측 결과를 업데이트하는 머신러닝 파이프라인을 운영하고 있습니다. 최종 예측 데이터셋은 수백만 개의 행으로 구성되어 있으며, 해당 데이터셋에 대한 접근은 불규칙적입니다. 이러한 상황에서 비용 효율성을 유지하려면 어떤 솔루션을 사용하는 것이 좋을까요?

Databricks-Machine-Learning-Professional 문제 5

머신러닝 엔지니어가 FeatureStoreClient(fs)를 사용하여 모델을 개발하고 등록했습니다. 모델의 URI는 model_uri입니다. 이제 엔지니어는 모델과 함께 등록된 학습 데이터셋에 대해 배치 추론을 수행해야 하는데, 고객 수준 Spark DataFrame(spark_df)의 spend 열에 있는 일부 특징 값들이 업데이트되어 있습니다. customer_id 열은 spark_df의 기본 키이며, 모델 학습 및 등록 시 사용된 학습 데이터셋의 기본 키이기도 합니다. spark_df의 새로운 spend 값으로 기존 spend 값을 덮어쓰면서 학습 데이터셋에 대한 예측을 계산하는 데 사용할 수 있는 코드 블록은 무엇일까요?