Databricks Certified Data Engineer Professional Exam (Databricks-Certified-Data-Engineer-Professional日本語版) - Databricks-Certified-Data-Engineer-Professional日本語 Exam Practice Test

データエンジニアは、修復履歴を含む最新のジョブ実行に関する情報を収集するアプリケーションを作成する必要があります。データエンジニアはリクエストをどのようにフォーマットすればよいでしょうか?
Correct Answer: C
Explanation: Only visible for TrainingDump members. You can sign-up / login (it's free).
データ エンジニアのチームは、多くの同じデータ品質チェックに対する繰り返しの期待値を含むテーブルを DLT パイプラインに追加しています。
チームのメンバーの 1 人が、このパイプラインに定義されているすべてのテーブルでこれらのデータ品質ルールを再利用することを提案しました。
どのようなアプローチでこれを実現できるでしょうか?
Correct Answer: B
Explanation: Only visible for TrainingDump members. You can sign-up / login (it's free).
上流システムは、特定のデータバッチの日付をパラメータとしてDatabricks Jobs APIに渡すように構成されています。スケジュール対象のノートブックは、このパラメータを使用して、以下のコードでデータを読み込みます。
df = spark.read.format("parquet").load(f"/mnt/source/(date)")
上記のコード ブロックで使用されている日付 Python 変数を作成するには、どのコード ブロックを使用する必要がありますか?
Correct Answer: A
Explanation: Only visible for TrainingDump members. You can sign-up / login (it's free).
Databricks CLI が正しくインストールされ、構成されていると仮定すると、実稼働ジョブで使用するために DBFS がマウントされたオブジェクト ストレージにカスタム Python Wheel をアップロードするには、どの Databricks CLI コマンドを使用できますか?
Correct Answer: D
Explanation: Only visible for TrainingDump members. You can sign-up / login (it's free).
データアナリストの分散チームは、自動スケーリングが設定されたインタラクティブなクラスター上でコンピューティングリソースを共有しています。ワークスペース管理者は、コストとクエリスループットをより適切に管理するために、クラスターのスケールアップが多数の同時ユーザーによるものか、リソースを大量に消費するクエリによるものかを評価したいと考えています。
クラスターのサイズ変更イベントのタイムラインはどこで確認できますか?
Correct Answer: D
Explanation: Only visible for TrainingDump members. You can sign-up / login (it's free).
述語プッシュダウンを活用しないことによって発生するパフォーマンスの問題を、Spark UI のどこで診断できますか?
Correct Answer: D
Explanation: Only visible for TrainingDump members. You can sign-up / login (it's free).
3 つのエグゼキュータ ノードを持つ特定のクラスターの Ganglia メトリックを評価する場合、VM のリソースが適切に使用されていることを示す指標はどれですか。
Correct Answer: C
Explanation: Only visible for TrainingDump members. You can sign-up / login (it's free).
ある企業では、タスクの最新ステータスを追跡するタスク管理システムを導入しています。このシステムはタスクイベントを入力として受け取り、Lakeflow Declarative Pipelines を使用してほぼリアルタイムでイベントを処理します。タスクが作成されるか、タスクステータスが変更されると、新しいタスクイベントがシステムに取り込まれます。Lakeflow Declarative Pipelines は、BI ユーザーがクエリを実行できるストリーミングテーブル (tasks_status) を提供します。
表はすべてのタスクの最新のステータスを表し、5 つの列が含まれます。
task_id(タスクごとに一意)
タスク名
タスクオーナー
タスクステータス
タスクイベント時間
テーブルでは、削除ベクトル、行追跡、変更データ フィード (CDF) の 3 つのプロパティが有効になります。
データ エンジニアは、静的ディメンション テーブル (従業員) から検索できる task_owner の部門を表す 1 つの列を追加することで、tasks_status テーブルをほぼリアルタイムで拡充するための新しい Lakeflow 宣言型パイプラインを作成するように求められています。
この強化はどのように実装する必要がありますか?
Correct Answer: C
Explanation: Only visible for TrainingDump members. You can sign-up / login (it's free).
データエンジニアはDelta LaleテーブルにLiquid Clusteringを実装しており、それがデータ管理操作にどのような影響を与えるかを理解する必要があります。テーブルは新しいデータで頻繁に更新されます。
このテーブルは外部テーブルであり、Unity Catalog では管理されていません。Delta Lake の Liquid Clustering は、最初のテーブル作成後に挿入された新しいデータをどのように処理しますか?
Correct Answer: B
Explanation: Only visible for TrainingDump members. You can sign-up / login (it's free).
データ アーキテクトは、Lakehouse 内のすべてのテーブルを外部 (「管理されていない」とも呼ばれる) Delta Lake テーブルとして構成することを義務付けています。
この要件を確実に満たすには、どのようなアプローチが有効でしょうか?
Correct Answer: A
Explanation: Only visible for TrainingDump members. You can sign-up / login (it's free).
施設監視チームは、Delta テーブル device_readings からほぼリアルタイムの PowerBI ダッシュボードを構築しています。
列:
device_id (文字列、一意のセンサーID)
event_ts (TIMESTAMP、取り込みタイムスタンプ UTC)
temperature_c (DOUBLE、温度(℃))
要件:
各センサーについて、重複しない5分ごとに1行生成する
間隔、2 分ずつオフセットされます (例: 00:02-00:07、00:07-00:12、...)。
各行には、間隔の開始、間隔の終了、平均を含める必要があります。
そのスライスの温度。
下流のBIツール(Power BIなど)は、間隔タイムスタンプを使用する必要があります。
時系列バーをプロットします。
Correct Answer: A
Explanation: Only visible for TrainingDump members. You can sign-up / login (it's free).
0
0
0
0