Databricks-Machine-Learning-Professional 문제 66

데이터 과학자가 MLflow 실행 시 `model` 모델에 대해 `outlier_path` 경로의 CSV 파일에서 이상치 특징 데이터를 로그에 기록하려고 합니다. 기존 MLflow 실행 블록 내에서 이 작업을 수행하는 코드 블록은 무엇일까요?

Databricks-Machine-Learning-Professional 문제 67

머신러닝 엔지니어는 모델 학습 실행 추적을 위한 MLflow 실험, 버전 관리를 위한 Unity Catalog에 등록된 모델, 실시간 추론을 위한 모델 제공 엔드포인트를 포함하는 프로덕션 ML 워크플로우를 배포해야 합니다. 팀은 인프라스트럭처 코드(Infrastructure-as-Code) 모범 사례를 준수하면서 개발 및 프로덕션 환경 전반에 걸쳐 일관된 배포를 보장하는 통합 구성 방식을 필요로 합니다. 머신러닝 엔지니어는 이 세 가지 구성 요소를 모두 정의하기 위해 어떤 접근 방식을 사용해야 할까요?

Databricks-Machine-Learning-Professional 문제 68

데이터 과학자가 델타 테이블로 저장된 프로덕션 피처 세트에서 특정 열이 누락된 것을 발견한 후, 머신 러닝 엔지니어링 팀은 해당 열이 피처 세트에서 언제 삭제되었는지 파악하는 임무를 맡았습니다.
다음 SQL 명령 중 이 작업을 수행하는 데 사용할 수 있는 명령은 무엇입니까?

Databricks-Machine-Learning-Professional 문제 69

머신러닝 엔지니어가 scikit-learn을 사용하여 랜덤 포레스트 모델을 개발하고, MLflow를 사용하여 random_forest_model이라는 이름으로 모델을 기록하고, 실행 ID를 run_id라는 Python 변수에 저장했습니다. 이제 Spark DataFrame인 spark_df에 대해 배치 추론을 수행하여 해당 모델을 배포하려고 합니다.
다음 코드 블록 중 어떤 것을 사용하여 과제를 완료하는 데 사용할 수 있는 predict라는 함수를 만들 수 있을까요?

Databricks-Machine-Learning-Professional 문제 70

머신러닝 엔지니어링 팀이 배치 작업으로 계산된 예측 결과를 쿼리용 델타 테이블에 저장했습니다. 하지만 쿼리 속도가 느려지는 문제가 발생했습니다. 데이터 파일 크기를 최적화하는 등의 조치는 이미 시도해 보았습니다. 조사 결과, 쿼리 조건을 만족하는 행들이 각 데이터 파일 전체에 드문드문 분포되어 있는 것으로 나타났습니다. 이러한 상황에서, 여러 열의 값을 고려하면서 유사한 레코드들을 함께 배치하는 최적화 기법을 통해 쿼리 속도를 향상시킬 수 있을까요?