Databricks Certified Professional Data Engineer Exam (Databricks-Certified-Professional-Data-Engineer Korean Version) - Databricks-Certified-Professional-Data-Engineer Korean Exam Practice Test
데이터 엔지니어가 S3 버킷에 저장된 환자 진료 기록 데이터를 일괄 처리하는 시스템을 설계하고 있습니다. 이 시스템은 encounter_id, patient_id, encounter_date, diagnosis_code, treatment_cost 열을 가진 Delta 테이블(patient_encounters)을 생성합니다. 이 테이블은 patient_id와 encounter_date를 기준으로 자주 조회되므로 빠른 처리 속도가 요구됩니다. 또한, 세분화된 접근 제어가 필수적입니다. 엔지니어는 유지 관리를 최소화하고 성능을 향상시키고자 합니다.
데이터 엔지니어는 patient_encounters 테이블을 어떻게 생성해야 할까요?
데이터 엔지니어는 patient_encounters 테이블을 어떻게 생성해야 할까요?
Correct Answer: A
Explanation: Only visible for TrainingDump members. You can sign-up / login (it's free).
데이터 엔지니어링 팀은 Databricks Lakehouse Monitoring을 사용하여 Delta 테이블의 핵심 열에 대한 percent_null 지표를 추적합니다.
프로필 메트릭 테이블(prod_catalog.prod_schema.customer_data_profile_metrics)에는 시간별 percent_null 값이 저장됩니다.
팀의 목표는 다음과 같습니다.
* percent_null의 일일 평균값이 3일 연속 5%를 초과할 경우 알림을 발생시킵니다.
* 문제가 지속되는 동안 알림이 스팸처럼 전송되지 않도록 하십시오.
옵션:
프로필 메트릭 테이블(prod_catalog.prod_schema.customer_data_profile_metrics)에는 시간별 percent_null 값이 저장됩니다.
팀의 목표는 다음과 같습니다.
* percent_null의 일일 평균값이 3일 연속 5%를 초과할 경우 알림을 발생시킵니다.
* 문제가 지속되는 동안 알림이 스팸처럼 전송되지 않도록 하십시오.
옵션:
Correct Answer: A
Explanation: Only visible for TrainingDump members. You can sign-up / login (it's free).
PySpark에서 ETL 코드에 DataFrame.transform을 사용하는 모듈식 및 테스트 가능한 방법을 보여주는 접근 방식은 무엇입니까?
Correct Answer: B
Explanation: Only visible for TrainingDump members. You can sign-up / login (it's free).
팀의 주니어 데이터 엔지니어가 다음 코드 블록을 구현했습니다.

뷰 `new_events`에는 `events Delta` 테이블과 동일한 스키마를 가진 레코드 배치가 포함되어 있습니다. `event_id` 필드는 이 테이블의 고유 키 역할을 합니다.
이 쿼리가 실행될 때, 기존 레코드와 동일한 event_id를 가진 새 레코드는 어떻게 처리됩니까?

뷰 `new_events`에는 `events Delta` 테이블과 동일한 스키마를 가진 레코드 배치가 포함되어 있습니다. `event_id` 필드는 이 테이블의 고유 키 역할을 합니다.
이 쿼리가 실행될 때, 기존 레코드와 동일한 event_id를 가진 새 레코드는 어떻게 처리됩니까?
Correct Answer: E
Explanation: Only visible for TrainingDump members. You can sign-up / login (it's free).
현재 활성화된 클러스터의 모든 노드에 노트북 수준의 범위로 Python 패키지를 설치하는 방법은 무엇입니까?
Correct Answer: C
Explanation: Only visible for TrainingDump members. You can sign-up / login (it's free).
Databricks Auto Loader의 기본 실행 모드를 설명하는 문장은 무엇입니까?
Correct Answer: B
Explanation: Only visible for TrainingDump members. You can sign-up / login (it's free).
마케팅팀은 영업팀과 집계 테이블 형태로 데이터를 공유하려고 하지만, 두 팀에서 사용하는 필드 이름이 일치하지 않고, 마케팅 관련 필드 중 일부는 영업팀의 승인을 받지 못했습니다.
다음 중 간결성을 강조하면서 상황을 해결하는 방법은 무엇입니까?
다음 중 간결성을 강조하면서 상황을 해결하는 방법은 무엇입니까?
Correct Answer: B
Explanation: Only visible for TrainingDump members. You can sign-up / login (it's free).
아래 쿼리를 사용하여 Delta Lake 테이블이 생성되었습니다.

다음 질문을 고려해 보세요.
DROP TABLE prod.sales_by_store -
워크스페이스 관리자가 이 명령문을 실행하면 어떤 결과가 발생할까요?

다음 질문을 고려해 보세요.
DROP TABLE prod.sales_by_store -
워크스페이스 관리자가 이 명령문을 실행하면 어떤 결과가 발생할까요?
Correct Answer: E
Explanation: Only visible for TrainingDump members. You can sign-up / login (it's free).
데이터 아키텍트는 두 개의 구조화된 스트리밍 작업이 하나의 브론즈 델타 테이블에 동시에 데이터를 기록하는 시스템을 설계했습니다. 각 작업은 Apache Kafka 소스의 서로 다른 토픽을 구독하지만, 동일한 스키마를 사용하여 데이터를 기록합니다. 디렉터리 구조를 단순하게 유지하기 위해 데이터 엔지니어는 두 스트림이 공유하는 체크포인트 디렉터리를 중첩하기로 결정했습니다.
제안된 디렉토리 구조는 아래와 같습니다.

주어진 시나리오에서 이 체크포인트 디렉터리 구조가 유효한지 여부를 설명하는 문장은 무엇이며, 그 이유는 무엇입니까?
제안된 디렉토리 구조는 아래와 같습니다.

주어진 시나리오에서 이 체크포인트 디렉터리 구조가 유효한지 여부를 설명하는 문장은 무엇이며, 그 이유는 무엇입니까?
Correct Answer: C
Explanation: Only visible for TrainingDump members. You can sign-up / login (it's free).
다음 코드는 기존 워크로드에서 Databricks 노트북으로 마이그레이션되었습니다.

코드는 성공적으로 실행되어 논리적으로 올바른 결과를 제공하지만, 약 1GB의 데이터를 추출하고 불러오는 데 20분 이상이 소요됩니다.
다음 중 이러한 행동에 대한 가능한 설명은 무엇입니까?

코드는 성공적으로 실행되어 논리적으로 올바른 결과를 제공하지만, 약 1GB의 데이터를 추출하고 불러오는 데 20분 이상이 소요됩니다.
다음 중 이러한 행동에 대한 가능한 설명은 무엇입니까?
Correct Answer: B
Explanation: Only visible for TrainingDump members. You can sign-up / login (it's free).
신입 데이터 엔지니어가 silver_device_recordings라는 Lakehouse 테이블에 대한 로직을 구현하는 작업을 진행하고 있습니다.
원본 데이터는 고도로 중첩된 JSON 구조에 100개의 고유 필드를 포함하고 있습니다.
silver_device_recordings 테이블은 여러 필드를 기준으로 매우 선택적인 조인을 수행하는 데 사용될 것이며, 머신 러닝 팀에서도 관련 필드를 기준으로 필터링하는 데 활용될 것입니다. 총 15개의 필드가 필터링 및 조인 로직에 자주 사용될 것으로 예상됩니다.
데이터 엔지니어는 테이블 스키마를 선언하기 전에 이러한 중첩 필드를 처리하는 최적의 접근 방식을 결정하려고 합니다.
다음 중 Delta Lake와 Databricks에 대한 정보를 정확하게 제시하여 그들의 의사 결정 과정에 영향을 미칠 수 있는 것은 무엇입니까?
원본 데이터는 고도로 중첩된 JSON 구조에 100개의 고유 필드를 포함하고 있습니다.
silver_device_recordings 테이블은 여러 필드를 기준으로 매우 선택적인 조인을 수행하는 데 사용될 것이며, 머신 러닝 팀에서도 관련 필드를 기준으로 필터링하는 데 활용될 것입니다. 총 15개의 필드가 필터링 및 조인 로직에 자주 사용될 것으로 예상됩니다.
데이터 엔지니어는 테이블 스키마를 선언하기 전에 이러한 중첩 필드를 처리하는 최적의 접근 방식을 결정하려고 합니다.
다음 중 Delta Lake와 Databricks에 대한 정보를 정확하게 제시하여 그들의 의사 결정 과정에 영향을 미칠 수 있는 것은 무엇입니까?
Correct Answer: B
Explanation: Only visible for TrainingDump members. You can sign-up / login (it's free).