Databricks-Machine-Learning-Professional 문제 71

데이터 과학자가 Spark MLlib의 파이프라인을 사용하여 Spark 환경에서 로지스틱 회귀 모델로 원시 텍스트를 분류하는 머신 러닝 파이프라인을 구축하고 있습니다. 이 파이프라인은 세 단계로 구성됩니다. 첫 번째 단계는 토크나이저(원시 텍스트를 토큰으로 분할), 두 번째 단계는 해시 함수(토큰을 해시로 변환), 세 번째 단계는 로지스틱 회귀 모델(텍스트 분류 수행)입니다. 학습 데이터가 포함된 Spark DataFrame은 trainingDF이고, 테스트 데이터가 포함된 DataFrame은 testDF입니다.
이를 위해 그들은 다음과 같은 불완전한 코드를 사용합니다.

다음 중 어느 옵션이 정확하게 설명하고 있습니까?
(i) 모델 학습을 실행하기 위한 전체 명령;
(ii) 테스트 데이터에 대한 예측을 실행하기 위한 전체 명령;
(iii) 모델이 반환하는 모델 객체의 객체 유형
훈련 명령.

Databricks-Machine-Learning-Professional 문제 72

머신러닝 엔지니어가 MLflow 클라이언트를 사용하여 MLflow 모델 레지스트리에 등록된 모델(model_version)을 스테이징 단계에서 프로덕션 단계로 이동하려고 합니다. 이 작업을 수행하는 데 사용할 수 있는 코드 블록은 무엇입니까?

Databricks-Machine-Learning-Professional 문제 73

머신러닝 엔지니어는 머신러닝 모델의 예측 결과를 실시간으로 제공해야 합니다. 하지만 예측 계산에 필요한 특징값들은 쿼리 시점보다 일주일 전에 확보할 수 있습니다.
다음 중 쿼리 시점에 예측값을 계산하는 실시간 서비스 배포 방식 대신 배치 서비스 배포 방식을 이 시나리오에서 사용하는 이점은 무엇입니까?

Databricks-Machine-Learning-Professional 문제 74

머신러닝 엔지니어는 입력 변수의 요약 통계 추세를 분석하여 수치형 드리프트 모니터링 솔루션을 구현했습니다. 그러나 이해관계자들은 더욱 강력한 모니터링 솔루션을 원합니다. 다음 중 수치형 특징 변수에 대해 더욱 강력한 드리프트 모니터링 솔루션을 제공할 수 있는 것은 무엇일까요?

Databricks-Machine-Learning-Professional 문제 75

머신러닝 엔지니어는 회귀 모델을 모니터링하고 R² 점수가 특정 임계값을 초과하지 않도록 하는 간단하고 코드를 최소화한 솔루션을 구현해야 합니다. 임계값을 초과하면 지정된 메일링 리스트로 이메일을 보내야 합니다. 제시된 솔루션 중 조건을 충족하는 것은 무엇입니까?