Databricks-Machine-Learning-Professional 문제 26
다음 중 Databricks에서 관리하는 MLflow 기능 중 중앙 집중식 모델 저장소는 무엇입니까?
Databricks-Machine-Learning-Professional 문제 27
머신러닝 엔지니어링 팀이 머신러닝 애플리케이션의 데이터 준비를 위한 연속적인 파이프라인을 구축하려고 합니다. 팀은 데이터가 완전히 처리되어 추론에 사용할 수 있는 상태가 되도록 동일한 크기의 배치로 나누어 처리하기를 원합니다. 이러한 연속적인 처리를 제공하는 데 사용할 수 있는 도구는 무엇일까요?
Databricks-Machine-Learning-Professional 문제 28
머신러닝 엔지니어가 사기 탐지 모델을 구축하고 있는데, 이 모델은 특징 테이블에서 미리 계산된 특징과 각 추론 요청과 함께 전송되는 사용자 위치 데이터를 기반으로 실시간으로 계산된 특징을 모두 사용해야 합니다. 엔지니어는 Unity 카탈로그의 main.fraud_detection.calculate_distance에 있는 calculate_distance라는 Python UDF를 생성하여 거래 위치와 사용자의 현재 위치 간의 거리를 계산합니다. 특징 테이블 main.fraud_detection.user_features에는 기본 키 user_id를 가진 과거 사용자 지출 패턴이 저장되어 있습니다.
엔지니어는 이 시나리오를 구현하기 위해 다음과 같은 코드를 작성했습니다.

이 구현 방식의 어떤 이점 때문에 실시간 사기 탐지 사용 사례에 적합한가요?
엔지니어는 이 시나리오를 구현하기 위해 다음과 같은 코드를 작성했습니다.

이 구현 방식의 어떤 이점 때문에 실시간 사기 탐지 사용 사례에 적합한가요?
Databricks-Machine-Learning-Professional 문제 29
머신러닝 엔지니어가 SparkML을 사용하여 클러스터에서 대규모 그래디언트 부스팅 모델을 학습시키고 있습니다. 몇 번의 반복 처리 후, 단일 실행 노드에서 메모리 오버플로가 발생하여 학습 작업이 실패합니다. 클러스터 리소스는 실행 노드당 16개의 CPU 코어와 64GB의 RAM으로 제한되어 있습니다. 엔지니어는 하이퍼파라미터를 변경하거나 데이터셋 크기를 줄이지 않고 모델 학습을 계속 진행하려고 합니다. Spark 아키텍처에 대한 이해도가 높고 Spark의 장점을 활용하고자 합니다. 이 문제를 해결할 수 있는 접근 방식은 무엇일까요?
Databricks-Machine-Learning-Professional 문제 30
데이터 과학자는 Delta 테이블의 위치 경로에서 star_rating 열을 제거하려고 합니다. 이를 위해 데이터를 불러와 star_rating 열을 삭제해야 합니다.
다음 코드 블록 중 어느 것이 이 작업을 수행합니까?
다음 코드 블록 중 어느 것이 이 작업을 수행합니까?
