Databricks-Certified-Data-Engineer-Professional日本語試験無料問題集「Databricks Certified Data Engineer Professional Exam (Databricks-Certified-Data-Engineer-Professional日本語版) 認定」
運用ワークロードは、外部の変更データキャプチャフィードからの更新を、常時稼働の構造化ストリームジョブとして Delta Lake テーブルに段階的に適用します。このテーブルのデータが最初に移行された際に、OPTIMIZE が実行され、ほとんどのデータファイルのサイズが 1 GB に変更されました。ストリーミング運用ジョブでは、自動最適化と自動圧縮の両方がオンになっていました。最近のデータファイルのレビューでは、テーブル内の各パーティションには少なくとも 1 GB のデータが含まれており、テーブル全体のサイズは 10 TB を超えているにもかかわらず、ほとんどのデータファイルは 64 MB 未満であることがわかりました。
ファイル サイズが小さくなる理由として考えられるのは次のうちどれでしょうか?
ファイル サイズが小さくなる理由として考えられるのは次のうちどれでしょうか?
正解:A
解答を投票する
解説: (GoShiken メンバーにのみ表示されます)
データエンジニアは、S3バケットに保存された患者の診療データを一括処理するシステムを設計しており、encounter_id、patient_id、encounter_date、diagnostic_code、treatment_costという列を持つDeltaテーブル(patient_encounters)を作成しています。このテーブルはpatient_idとencounter_dateで頻繁にクエリされるため、高速なパフォーマンスが求められます。きめ細かなアクセス制御を適用する必要があります。エンジニアはメンテナンスを最小限に抑え、パフォーマンスを向上したいと考えています。データエンジニアはpatient_encountersテーブルをどのように作成すればよいでしょうか?
正解:D
解答を投票する
解説: (GoShiken メンバーにのみ表示されます)
データエンジニアがDatabricksで大規模なパーティション化された小売データセットを分析しています。各行は営業担当者による売上を表しています。データセットには、以下のスキーマを持つ数百万件のレコードが含まれています。
sales_df: [salesperson_id: string, region: string, sale_amount: double, sale_date: date] データ エンジニアは、各地域内の営業担当者を累計売上高に基づいてランク付けし、最高の売上高を 1 とする DataFrame を生成する必要があります。複数の営業担当者の合計売上高が同じ場合は、同じランクを共有する必要があります。
データ エンジニアは、PySpark ウィンドウ関数と dense_rank () 関数を使用してこのロジックを実装したいと考えています。
このランキングを実行するコード スニペットはどれですか?
sales_df: [salesperson_id: string, region: string, sale_amount: double, sale_date: date] データ エンジニアは、各地域内の営業担当者を累計売上高に基づいてランク付けし、最高の売上高を 1 とする DataFrame を生成する必要があります。複数の営業担当者の合計売上高が同じ場合は、同じランクを共有する必要があります。
データ エンジニアは、PySpark ウィンドウ関数と dense_rank () 関数を使用してこのロジックを実装したいと考えています。
このランキングを実行するコード スニペットはどれですか?
正解:B
解答を投票する
解説: (GoShiken メンバーにのみ表示されます)
データガバナンスチームは、GDPR遵守のため、ユーザーのレコード削除を審査しています。削除リクエストをuser_lookupテーブルからユーザー集計テーブルに反映させるため、以下のロジックが実装されています。

user_id が一意の識別キーであり、削除を要求したすべてのユーザーが user_lookup テーブルから削除されていると仮定すると、上記のロジックを正常に実行すると、user_aggregates テーブルから削除されるレコードにアクセスできなくなることが保証されるかどうか、またその理由はどれですか。

user_id が一意の識別キーであり、削除を要求したすべてのユーザーが user_lookup テーブルから削除されていると仮定すると、上記のロジックを正常に実行すると、user_aggregates テーブルから削除されるレコードにアクセスできなくなることが保証されるかどうか、またその理由はどれですか。
正解:B
解答を投票する
解説: (GoShiken メンバーにのみ表示されます)
データチームは、Databricks で毎日のマルチタスク ETL パイプラインを自動化しています。このパイプラインには、生データを取り込むためのノートブック、データ変換のための Python Wheel タスク、集計を更新するための SQL クエリが含まれています。パイプラインをプログラムでトリガーし、GUI で過去の実行を確認したいと考えています。タスクが失敗した場合は再試行し、失敗したタスクがあれば関係者にメールで通知する必要があります。これらの要件を満たす 2 つのアプローチはどれですか?(2 つ選択してください。)
正解:A,B
解答を投票する
解説: (GoShiken メンバーにのみ表示されます)
データエンジニアは、医療費請求データを処理するためのLakeflow宣言型パイプラインを構築しています。メタデータJSONファイルには、複数のテーブルのデータ品質ルールが定義されています。これには以下が含まれます。
{
"claims": [
{"name": "valid_patient_id", "constraint": "patient_id IS NOT NULL"},
{"name": "non_negative_amount", "constraint": "claim_amount >= 0"}
]
}
パイプラインは、ルールをハードコーディングせずに、これらのルールをクレーム テーブルに動的に適用する必要があります。
データエンジニアはこれをどのように実現すべきでしょうか?
{
"claims": [
{"name": "valid_patient_id", "constraint": "patient_id IS NOT NULL"},
{"name": "non_negative_amount", "constraint": "claim_amount >= 0"}
]
}
パイプラインは、ルールをハードコーディングせずに、これらのルールをクレーム テーブルに動的に適用する必要があります。
データエンジニアはこれをどのように実現すべきでしょうか?
正解:C
解答を投票する
解説: (GoShiken メンバーにのみ表示されます)
コンピューティング リソースを最も多く消費しているユーザーを特定するために、データ エンジニアリング チームは、リソースの使用率とコスト管理を向上させるために、Databricks ワークスペース内の使用状況を監視する必要があります。
チームは、ワークスペースのアクティビティを詳細に可視化するために、Unity Catalog のシステムカタログで利用可能な Databricks システムテーブルを使用することにしました。これを実現するには、システムカタログからどの SQL クエリを実行すればよいでしょうか?
チームは、ワークスペースのアクティビティを詳細に可視化するために、Unity Catalog のシステムカタログで利用可能な Databricks システムテーブルを使用することにしました。これを実現するには、システムカタログからどの SQL クエリを実行すればよいでしょうか?
正解:A
解答を投票する
解説: (GoShiken メンバーにのみ表示されます)
データエンジニアは、顧客がレンタル自転車を利用中にどこに持ち込んでいるかを把握するためのデータ取り込みパイプラインを構築しています。エンジニアは、時間の経過とともに、自転車のセンサーから送信されるデータに緯度や経度などの重要な詳細情報が含まれていないことに気づきました。下流のアナリストは、クリーンなレコードと隔離されたレコードの両方を個別に処理する必要があります。
データ エンジニアはすでに次のコードを持っています。
インポートDLT
pyspark.sql.functionsからexprをインポートする
rules = {
"valid_lat": "(lat IS NOT NULL)",
"valid_long": "(long IS NOT NULL)"
}
quarantine_rules = "NOT({})".format(" AND ".join(rules.values()))
@dlt.view
def raw_trips_data():
return spark.readStream.table("ride_and_go.telemetry.trips")
How should the data engineer meet the requirements to capture good and bad data?
データ エンジニアはすでに次のコードを持っています。
インポートDLT
pyspark.sql.functionsからexprをインポートする
rules = {
"valid_lat": "(lat IS NOT NULL)",
"valid_long": "(long IS NOT NULL)"
}
quarantine_rules = "NOT({})".format(" AND ".join(rules.values()))
@dlt.view
def raw_trips_data():
return spark.readStream.table("ride_and_go.telemetry.trips")
How should the data engineer meet the requirements to capture good and bad data?
正解:A
解答を投票する
解説: (GoShiken メンバーにのみ表示されます)