Databricks-Certified-Professional-Data-Engineer 문제 101
다음 중 파이썬에서 테이블의 행 수가 10인지 테스트하는 코드의 기능을 테스트하는 데 사용할 수 있는 문장은 무엇입니까?
row_count = spark.sql("테이블에서 count(*)를 선택하세요").collect()[0][0]
row_count = spark.sql("테이블에서 count(*)를 선택하세요").collect()[0][0]
Databricks-Certified-Professional-Data-Engineer 문제 102
데이터 엔지니어링 팀은 다음 코드를 유지 관리합니다.

이 코드가 논리적으로 올바른 결과를 생성하고 소스 테이블의 데이터가 중복 제거되고 검증되었다고 가정할 때, 이 코드를 실행하면 어떤 일이 발생하는지 설명하는 문장은 무엇입니까?

이 코드가 논리적으로 올바른 결과를 생성하고 소스 테이블의 데이터가 중복 제거되고 검증되었다고 가정할 때, 이 코드를 실행하면 어떤 일이 발생하는지 설명하는 문장은 무엇입니까?
Databricks-Certified-Professional-Data-Engineer 문제 103
업스트림 시스템은 주어진 데이터 배치의 날짜를 Databricks Jobs API에 매개변수로 전달하도록 구성되었습니다. 예약될 노트북은 이 매개변수를 사용하여 다음 코드로 데이터를 로드합니다.
df = spark.read.format("parquet").load(f"/mnt/source/(date)")
위 코드 블록에서 사용된 날짜 Python 변수를 생성하려면 어떤 코드 블록을 사용해야 합니까?
df = spark.read.format("parquet").load(f"/mnt/source/(date)")
위 코드 블록에서 사용된 날짜 Python 변수를 생성하려면 어떤 코드 블록을 사용해야 합니까?
Databricks-Certified-Professional-Data-Engineer 문제 104
질문-3: 머신 러닝에서 피처 해싱은 해싱 트릭(커널과 유사)으로도 알려져 있습니다.
트릭)은 언어의 단어와 같은 특징을 벡터화하는 빠르고 공간 효율적인 방법입니다. 즉,
임의의 특징을 벡터 또는 행렬의 인덱스로 변환합니다. 이 기능은 특징에 해시 함수를 적용하여 작동합니다.
인덱스를 직접 찾는 것보다 기능 수에 대한 해시 값을 모듈로 인덱스로 사용하는 것이 더 좋습니다.
연관 배열. 그렇다면 분류기를 구축하는 데 해싱 기법을 사용하는 주된 이유는 무엇일까요?
트릭)은 언어의 단어와 같은 특징을 벡터화하는 빠르고 공간 효율적인 방법입니다. 즉,
임의의 특징을 벡터 또는 행렬의 인덱스로 변환합니다. 이 기능은 특징에 해시 함수를 적용하여 작동합니다.
인덱스를 직접 찾는 것보다 기능 수에 대한 해시 값을 모듈로 인덱스로 사용하는 것이 더 좋습니다.
연관 배열. 그렇다면 분류기를 구축하는 데 해싱 기법을 사용하는 주된 이유는 무엇일까요?
Databricks-Certified-Professional-Data-Engineer 문제 105
다음 도구 중 데이터 접근 제어, 접근 감사, 데이터 계보 및 데이터 검색 기능을 제공하는 도구는 무엇입니까?
