最適な練習法にはDatabricks Databricks-Certified-Data-Engineer-Professional日本語問題集で素晴らしいDatabricks-Certified-Data-Engineer-Professional日本語試験問題PDF [Q92-Q115]

Share

最適な練習法にはDatabricks Databricks-Certified-Data-Engineer-Professional日本語問題集で素晴らしいDatabricks-Certified-Data-Engineer-Professional日本語試験問題PDF

更新された検証済みの合格させるDatabricks-Certified-Data-Engineer-Professional日本語試験リアル問題と解答

質問 # 92
データガバナンスチームは、個人識別情報(PH)を含むすべてのテーブルに明確な注釈を付けるという要件を制定しました。これには、列コメント、テーブルコメントの追加、カスタムテーブルプロパティ「contains_pii」をtrueに設定することが含まれます。
新しいテーブルを作成するには、次の SQL DDL ステートメントが実行されます。

これら 3 つの要件が満たされていることを手動で確認できるコマンドはどれですか?

  • A. SHOW TABLES dev
  • B. 拡張dev.piiテストの説明
  • C. 履歴の説明 dev.pii テスト
  • D. SHOW TBLPROPERTIES dev.pii テスト
  • E. DETAIL dev.pii テスト

正解:B

解説:
This is the correct answer because it allows manual confirmation that these three requirements have been met. The requirements are that all tables containing Personal Identifiable Information (PII) must be clearly annotated, which includes adding column comments, table comments, and setting the custom table property "contains_pii" = true. The DESCRIBE EXTENDED command is used to display detailed information about a table, such as its schema, location, properties, and comments. By using this command on the dev.pii_test table, one can verify that the table has been created with the correct column comments, table comment, and custom table property as specified in the SQL DDL statement.


質問 # 93
データエンジニアは、Databricks 間のシナリオにおいて読み取りパフォーマンスを最適化するために、Delta Sharing を設定しようとしています。受信者は、共有された売上データに対してタイムトラベルクエリとストリーミング読み取りを実行する必要があります。これらの機能を有効にしながら最適なパフォーマンスを実現するには、どの構成が最適でしょうか?

  • A. 履歴付きでテーブルを共有し、テーブルでパーティションが有効になっていないことを確認し、共有する前に CDF を有効にします。
  • B. 履歴なしでスキーマ全体を共有し、パフォーマンスのために受信者側のキャッシュに依存します。
  • C. パフォーマンスを向上させるには、Databricks 間の共有ではなくオープン共有プロトコルを使用します。
  • D. 履歴なしでテーブルを共有し、パーティション分割を有効にしてクエリのパフォーマンスを向上させます。

正解:A

解説:
The official Delta Sharing guidance specifies that in order for recipients to use time travel queries and streaming reads, providers must share Delta tables WITH HISTORY. Sharing history ensures the Delta log is included, which enables efficient access to table snapshots and incremental data streams.
Additionally, Change Data Feed (CDF) must be enabled prior to sharing if downstream consumers require streaming CDC queries. Without history, recipients cannot perform time travel or streaming queries. Open sharing supports static Delta tables but lacks streaming support.
Therefore, sharing tables WITH HISTORY and enabling CDF is the required configuration for both performance and functionality.


質問 # 94
以下の各構成は、各クラスターに合計 400 GB の RAM、合計 160 個のコアがあり、VM ごとに 1 つの Executor のみがあるという点では同一です。
完了を保証する必要のある非常に長時間実行されるジョブがある場合、1 つ以上の VM 障害を考慮して、どのクラスター構成でジョブの完了を保証できますか。

  • A. - Total VMs: 8
    - 50 GB per Executor
    - 20 Cores / Executor
  • B. - Total VMs: 4
    - 100 GB per Executor
    - 40 Cores / Executor
  • C. - Total VMs: 1
    - 400 GB per Executor
    - 160 Cores/Executor
  • D. - Total VMs: 2
    - 200 GB per Executor
    - 80 Cores / Executor
  • E. - Total VMs: 16
    - 25 GB per Executor
    Certified-Data-Engineer-Professional試験の最新かつ実際の質問と回答を入手する
    - 10 Cores / Executor

正解:E

解説:
Get Latest & Actual Certified-Data-Engineer-Professional Exam's Question and Answers from


質問 # 95
1時間ごとのバッチジョブは、クラウドオブジェクトストレージコンテナからデータファイルを取り込むように構成されています。各バッチは、ソースシステムが特定の時間に生成したすべてのレコードを表します。これらのレコードをレイクハウスに処理するバッチジョブは、遅れて到着するデータが欠落しないように十分な遅延が設定されます。user_idフィールドはデータの一意のキーを表し、次のスキーマを持ちます。
user_id BIGINT、username STRING、user_utc STRING、user_region STRING、last_login BIGINT、auto_pay BOOLEAN、last_updated BIGINT 新しいレコードはすべてaccount_historyというテーブルに取り込まれ、ソースと同じスキーマ内のすべてのデータの完全な記録が保持されます。システム内の次のテーブルはaccount_currentという名前で、各一意のuser_idの最新の値を表すType 1テーブルとして実装されています。
数百万のユーザー アカウントがあり、1 時間ごとに数万のレコードが処理されると仮定すると、記述されている account_current テーブルを各時間ごとのバッチ ジョブの一部として効率的に更新するには、どの実装を使用できますか?

  • A. Delta Lake のバージョン履歴を使用して、アカウント履歴の最新バージョンと 1 つ前のバージョンの違いを取得し、これらのレコードを現在のアカウントに書き込みます。
  • B. 最後に更新されたフィールドと最後に処理された時間、およびユーザー ID による最後の最大入力を使用してアカウント履歴のレコードをフィルターし、各ユーザー ID の最新の値を更新または挿入するマージ ステートメントを記述します。
  • C. 最後に更新されたフィールドと最後に処理された時間を使用してアカウント履歴のレコードをフィルターし、ユーザー名の重複を排除します。各ユーザー名の最新の値を更新または挿入するためのマージ ステートメントを記述します。
  • D. 自動ローダーを使用して、アカウント履歴ディレクトリ内の新しいファイルをサブスクライブします。Structured Streaminq トリガー 1 回限りのジョブを構成して、新しく検出されたファイルをアカウントの現在のテーブルに一括更新します。
  • E. ユーザー ID でグループ化し、最終更新の最大値をフィルタリングしたアカウント履歴テーブルに対するクエリの結果を使用して、各バッチでアカウントの現在のテーブルを上書きします。

正解:B

解説:
This is the correct answer because it efficiently updates the account current table with only the most recent value for each user id. The code filters records in account history using the last updated field and the most recent hour processed, which means it will only process the latest batch of data. It also filters by the max last login by user id, which means it will only keep the most Get Latest & Actual Certified-Data-Engineer-Professional Exam's Question and Answers from recent record for each user id within that batch. Then, it writes a merge statement to update or insert the most recent value for each user id into account current, which means it will perform an upsert operation based on the user id column.


質問 # 96
データチームの構造化ストリーミングジョブは、下流のマーケティングダッシュボードを更新するために、アイテムの売上に関する集計を実行するように設定されています。マーケティングチームは、各アイテムでこのプロモーションコードが使用された回数を追跡するための新しいフィールドを導入しました。あるジュニアデータエンジニアは、既存のクエリを次のように更新することを提案しました。提案された変更は太字で示されています。
元のクエリ:
Certified-Data-Engineer-Professional試験の最新かつ実際の質問と回答を入手する

提案されたクエリ:

提案されたクエリ:
.start("/item_agg")
提案されたクエリを本番環境に導入するには、どの手順も完了する必要がありますか?

  • A. "/item_agg"ディレクトリ内のデータをHiveメタストアに登録します
  • B. ストリーミング書き込みから .option (mergeSchema', true') を削除します。
  • C. REFRESH TABLE delta, /item_agg' を実行します。
  • D. 追加の集計を考慮してシャッフルパーティションを増やす
  • E. 新しいチェックポイントの場所を指定します

正解:E

解説:
When introducing a new aggregation or a change in the logic of a Structured Streaming query, it is generally necessary to specify a new checkpoint location. This is because the checkpoint directory contains metadata about the offsets and the state of the aggregations of a streaming query. If the logic of the query changes, such as including a new aggregation field, the state information saved in the current checkpoint would not be compatible with the new logic, potentially leading to incorrect results or failures. Therefore, to accommodate the new field and ensure the streaming job has the correct starting point and state information for aggregations, a new checkpoint location should be specified.


質問 # 97
統合テストについて説明している記述はどれですか?

  • A. アプリケーションのユースケースを検証する
  • B. アプリケーションの個々の要素の動作を検証します
  • C. 自動テストフレームワークが必要です
  • D. 手動介入が必要
  • E. アプリケーションのサブシステム間の相互作用を検証します

正解:E

解説:
Integration testing is a type of software testing where components of the software are gradually integrated and then tested as a unified group.


質問 # 98
データガバナンスチームは、GDPR遵守のため、レコード削除に使用されるコードをレビューしています。Delta Lakeのusersテーブルからレコードを削除する際に、以下のロジックが使用されていることが確認されました。

user_id が一意の識別キーであり、delete_requests に削除を要求したすべてのユーザーが含まれていると仮定すると、上記のロジックを正常に実行すると、削除対象のレコードにアクセスできなくなることが保証されるかどうか、またその理由を説明するステートメントはどれですか。

  • A. いいえ。削除されたレコードを含むファイルは、無効化されたデータ ファイルを削除するために vacuum コマンドが使用されるまで、タイム トラベルで引き続きアクセスできる可能性があります。
  • B. いいえ。クラスターが再起動されるまで、デルタ キャッシュはテーブルの以前のバージョンからのレコードを返す場合があります。
  • C. いいえ。Delta Lake の delete コマンドは、merge into コマンドと組み合わせた場合にのみ ACID 保証を提供します。
  • D. はい。デルタ キャッシュは、ディスクに記録された最新のデータ ファイルを反映してすぐに更新されます。
  • E. はい。Delta Lake ACID 保証により、削除コマンドが完全に成功し、これらのレコードが永続的に消去されたことが保証されます。

正解:A

解説:
Get Latest & Actual Certified-Data-Engineer-Professional Exam's Question and Answers from Explanation:
The code uses the DELETE FROM command to delete records from the users table that match a condition based on a join with another table called delete_requests, which contains all users that have requested deletion. The DELETE FROM command deletes records from a Delta Lake table by creating a new version of the table that does not contain the deleted records. However, this does not guarantee that the records to be deleted are no longer accessible, because Delta Lake supports time travel, which allows querying previous versions of the table using a timestamp or version number. Therefore, files containing deleted records may still be accessible with time travel until a vacuum command is used to remove invalidated data files from physical storage.


質問 # 99
あるデータエンジニアが、組織内の安全なデータ共有戦略を設計しています。同社は、機密性の高い顧客分析データを2つの異なるパートナーと共有する必要があります。パートナーAはUnity Catalogを有効にしたDatabricksを使用していますが、パートナーBはDatabricksを使用せずにAWS上のApache Sparkを使用しています。これらのシナリオにおいて、安全なデータ共有をどのように実装すればよいでしょうか?

  • A. Databricks 間共有 (D2D) は同じクラウドプロバイダー内でのみ使用できます。そのため、クロスクラウドシナリオではオープン共有 (D2O) を使用する必要があります。ユニットカタログガバナンスは、外部プラットフォームと共有する場合は利用できません。
  • B. セキュリティ要件が同一であるため、両方のパートナーは同じデルタ共有アプローチを使用する必要があります。最大限の互換性を確保するため、両方のパートナーに対してベアラートークンを作成し、オープン共有プロトコル (D2O) を使用する必要があります。
  • C. オープン共有プロトコル(D2O)はD2D共有よりもセキュリティが高いため、両方のパートナーで使用してください。ベアラートークン方式は、Unity Catalogのネイティブ認証よりも常に安全です。
  • D. パートナーAには、ユニットカタログ統合とトークン不要の交換システムを備えたDatabricks間共有(D2D)を実装します。パートナーBには、ベアラートークンまたはOIDCフェデレーションによる認証を備えたオープン共有プロトコル(D2O)を使用し、両方のアプローチで堅牢なセキュリティとガバナンスを維持します。

正解:D

解説:
Databricks-to-Databricks sharing with Unity Catalog provides the most seamless and secure option for Partner A by enabling native governance, fine-grained access controls, and a no-token exchange model. For Partner B, which does not use Databricks, the open sharing protocol enables secure access from external Spark environments using standard authentication mechanisms such as bearer tokens or OIDC federation, while still enforcing sharing policies and protecting sensitive data.


質問 # 100
プラットフォームチームリーダーは、各チームのSQL Warehouse利用状況のアトリビューションを自動化する責任を負います。要件は、個々のユーザーレベルでSQL Warehouseの利用状況を特定し、全事業部門のリーダーを含む経営チームと共有するための日次レポートを生成することです。プラットフォームリーダーは、どのようにすれば毎日共有可能な自動レポートを生成できるでしょうか?

  • A. システムテーブルを使用して監査および課金の使用状況データを取得し、クエリを経営陣と共有します。これにより、経営陣はいつでもクエリを実行し、最新の結果を確認できます。
  • B. システム テーブルを使用して監査および課金の使用状況データを取得し、毎日の更新スケジュールを含むダッシュボードを作成して経営陣と共有します。
  • C. 帰属を計算して経営陣と共有できるように、ユーザーがすべてのクエリ詳細を提供しない限り、SQL クエリの実行を制限します。
  • D. ユーザーがSQLクエリを実行し、使用状況を経営陣に直接報告できるようにします。SQLウェアハウスの使用状況の所有権は各チームにあります。

正解:B

解説:
System tables provide authoritative audit and billing data needed for per-user SQL Warehouse attribution. Creating a dashboard with a scheduled daily refresh automates report generation and ensures executives receive consistent, up-to-date insights without needing to run queries themselves.


質問 # 101
データアーキテクトは、2つの構造化ストリーミングジョブが単一のブロンズDeltaテーブルに同時に書き込みを行うシステムを設計しました。各ジョブはApache Kafkaソースの異なるトピックをサブスクライブしますが、同じスキーマでデータを書き込みます。ディレクトリ構造をシンプルに保つため、データエンジニアは両方のストリームで共有されるチェックポイントディレクトリをネストすることにしました。
提案されたディレクトリ構造を以下に示します。

このチェックポイント ディレクトリ構造が特定のシナリオに対して有効であるかどうか、またその理由を説明している記述はどれですか。

  • A. はい。Delta Lake は無制限の同時書き込みをサポートします。
  • B. いいえ。Delta Lake はトランザクション ログ内のストリーミング チェックポイントを管理します。
  • C. いいえ。Delta Lake テーブルに書き込むことができるのは 1 つのストリームだけです。
  • D. はい。両方のストリームで単一のチェックポイント ディレクトリを共有できます。
  • E. いいえ。各ストリームには独自のチェックポイント ディレクトリが必要です。

正解:E

解説:
This is the correct answer because checkpointing is a critical feature of Structured Streaming that provides fault tolerance and recovery in case of failures. Checkpointing stores the current state and progress of a streaming query in a reliable storage system, such as DBFS or S3. Each streaming query must have its own checkpoint directory that is unique and exclusive to that query. If two streaming queries share the same checkpoint directory, they will interfere with each other and cause unexpected errors or data loss.


質問 # 102
データエンジニアは、Databricks の Lakeflow 宣言型パイプライン (LDP) を使用して、顧客データを取り込むためのシンプルなデータパイプラインを構築しています。生の顧客データは、JSON 形式でクラウドストレージに保存されています。タスクは、生の JSON データを読み取り、Delta テーブルに書き込んでさらに処理する Lakeflow 宣言型パイプラインを作成することです。LDP を使用して生の JSON データを正しく取り込み、Delta テーブルを作成するコードスニペットはどれですか?

  • A. dlt をインポートする
    @dlt.テーブル
    raw_customers() を定義します:
    spark.read.format("csv").load("s3://my-bucket/raw-customers/") を返します。
  • B. dlt をインポートする
    @dlt.テーブル
    raw_customers() を定義します:
    spark.read.json("s3://my-bucket/raw-customers/") を返します
  • C. dlt をインポートする
    @dlt.view
    raw_customers() を定義します:
    spark.format.json("s3://my-bucket/raw-customers/") を返します
  • D. dlt をインポートする
    @dlt.テーブル
    raw_customers() を定義します:
    spark.read.format("parquet").load("s3://my-bucket/raw-customers/") を返します。

正解:B

解説:
The correct method to define a table using Lakeflow Declarative Pipelines (LDP) is with the
@dlt.table decorator, which persists the output as a managed Delta table. When ingesting raw JSON data, spark.read.json() or spark.read.format("json").load() is the standard approach. This reads JSON- formatted files from the source and stores them in Delta format automatically managed by Databricks.


質問 # 103
データエンジニアリングチームは、顧客からの忘れ去られる(データを削除する)リクエストを処理するジョブを設定しました。削除が必要なすべてのユーザーデータは、デフォルトのテーブル設定を使用してDelta Lakeテーブルに保存されます。
チームは、毎週日曜日の午前1時に、前週のすべての削除処理をバッチジョブとして実行することにしました。このジョブの合計所要時間は1時間未満です。毎週月曜日の午前3時には、バッチジョブが組織全体のすべてのDelta Lakeテーブルに対して一連のVACUUMコマンドを実行します。
コンプライアンス担当者は最近、Delta Lakeのタイムトラベル機能について知りました。これにより、削除されたデータへの継続的なアクセスが可能になるのではないかと懸念しています。
すべての削除ロジックが正しく実装されていると仮定すると、どのステートメントがこの問題に正しく対処していますか?

  • A. デフォルトのデータ保持しきい値は 7 日間であるため、削除されたレコードを含むデータ ファイルは、8 日後にバキューム ジョブが実行されるまで保持されます。
  • B. vacuum コマンドは削除されたレコードを含むすべてのファイルを完全に削除するため、削除されたレコードにはタイムトラベルで約 24 時間アクセスできる場合があります。
  • C. デフォルトのデータ保持しきい値は 24 時間であるため、削除されたレコードを含むデータ ファイルは、翌日にバキューム ジョブが実行されるまで保持されます。
  • D. Delta Lake タイム トラベルではテーブルの履歴全体へのフル アクセスが提供されるため、削除されたレコードは完全な管理者権限を持つユーザーがいつでも再作成できます。
  • E. Delta Lake の削除ステートメントには ACID 保証があるため、削除ジョブが完了するとすぐに、削除されたレコードはすべてのストレージ システムから完全に消去されます。

正解:A

解説:
https://learn.microsoft.com/en-us/azure/databricks/delta/vacuum


質問 # 104
データ エンジニアリング チームは次のコードを管理しています。

このコードが論理的に正しい結果を生成し、ソース テーブル内のデータが重複排除され検証されていると仮定すると、このコードを実行すると何が起こるかを説明するステートメントはどれですか。

  • A. silver_customer_sales テーブルは、バッチ ジョブとして gold_customer_lifetime_sales_summary テーブルのすべてのレコードから計算された集計値によって上書きされます。
  • B. バッチ ジョブは、customer_id を主キーとして使用して、gold_customer_lifetime_sales_summary テーブルを更新し、テーブルの現在のバージョンと異なる値を持つ行のみを置き換えます。
  • C. gold_customer_lifetime_sales_summary テーブルは、バッチ ジョブとして silver_customer_sales テーブルのすべてのレコードから計算された集計値によって上書きされます。
  • D. 増分ジョブは、silver_customer_sales テーブルに新しい行が書き込まれたかどうかを検出します。新しい行が検出されると、すべての集計が再計算され、gold_customer_lifetime_sales_summary テーブルを上書きするために使用されます。
  • E. 増分ジョブは、状態ストア内の実行情報を活用して、gold_customer_lifetime_sales_summary テーブルの集計値を更新します。

正解:C

解説:
This code is using the pyspark.sql.functions library to group the silver_customer_sales table by customer_id and then aggregate the data using the minimum sale date, maximum sale total, and sum of distinct order ids. The resulting aggregated data is then written to the gold_customer_lifetime_sales_summary table, overwriting any existing data in that table. This is a batch job that does not use any incremental or streaming logic, and does not perform any merge or update operations. Therefore, the code will overwrite the gold table with the aggregated values from the silver table every time it is executed.


質問 # 105
ビジネスレポート作成チームでは、ダッシュボードのデータを1時間ごとに更新する必要があります。パイプラインで変換を抽出し、データをロードする処理時間は合計10分です。
通常の動作条件を前提とすると、どの構成が最も低いコストでサービス レベル契約の要件を満たすでしょうか。

  • A. 新しいジョブ クラスターで 1 時間に 1 回パイプラインを実行するようにジョブをスケジュールします。
  • B. 専用のインタラクティブ クラスターで 1 時間に 1 回パイプラインを実行するジョブをスケジュールします。
  • C. 特定のディレクトリに新しいデータが追加されるたびに実行されるジョブを構成します。
  • D. トリガー間隔を 60 分にして構造化ストリーミング ジョブをスケジュールします。

正解:A

解説:
Scheduling a job to execute the data processing pipeline once an hour on a new job cluster is the most cost-effective solution given the scenario. Job clusters are ephemeral in nature; they are spun up just before the job execution and terminated upon completion, which means you only incur costs for the time the cluster is active. Since the total processing time is only 10 minutes, a new job cluster created for each hourly execution minimizes the running time and thus the cost, while also fulfilling the requirement for hourly data updates for the business reporting team's dashboards.


質問 # 106
データエンジニアは、スキーマ「finance」内のUnityカタログテーブル「customer_data」を管理しています。このテーブルには、SSNやcredit_scoreといった機密性の高いフィールドが含まれています。インターンシップグループはマスクされた値のみを参照でき、アナリストグループは担当地域の行のみにアクセスできる必要があります。データエンジニアは、データの重複を避けつつ、ユーザーロールと地域に基づいてアクセスを制限する必要があります。データエンジニアはこのセキュリティポリシーをどのように適用すればよいでしょうか?

  • A. current_user() および is_account_group_member() 関数を使用してビューを作成し、各機密列の SQL SELECT 句内でマスキング ロジックを適用します。
  • B. ユーザー ロールに基づいて Unity Catalog の行フィルターを使用し、リージョンに基づいて列マスクを使用します。
  • C. 各ユーザー ロールに対して動的ビューを作成し、ACL を使用してアクセスを管理します。
  • D. 地域に基づいて Unity Catalog の行フィルターを使用し、ユーザー ロールに基づいて列マスクを使用します。

正解:D

解説:
Unity Catalog row filters can restrict which rows are visible based on attributes such as the user's assigned region, while column masks can dynamically obfuscate sensitive fields like ssn and credit_score based on user roles. This enforces fine-grained, role-and region-based access control directly at the table level without duplicating data or relying on custom views.


質問 # 107
ある大企業は、膨大な量と高速のデータを持つ多数のテーブルを並列更新する数百のパイプラインを伴う、ほぼリアルタイムのソリューションを実装したいと考えています。
この要件を満たすには、次のどのソリューションを実装しますか?

  • A. 多数のデータ ファイルを並行して書き込めるように、取り込みテーブルを短い時間間隔でパーティション分割します。
  • B. すべてのデータをオブジェクト ストレージではなく接続された SSD ボリュームに保存するように Databricks を構成すると、ファイル I/O が大幅に増加します。
  • C. クラウド ベンダーによって課せられる API 制限を回避するために、Delta Lake テーブルを独自のストレージ コンテナーに分離します。
  • D. 最適化されたクラウド ストレージ接続を活用してデータ スループットを最大化する Databricks 高同時実行クラスターを使用します。
  • E. すべてのテーブルを単一のデータベースに保存し、Databricks Catalyst Metastore が全体的なスループットを負荷分散できるようにします。

正解:D

解説:
High Concurrency clusters in Databricks are designed for multiple concurrent users and workloads. They provide fine-grained sharing of cluster resources and are optimized for operations such as running multiple parallel queries and updates. This would be suitable for a solution that involves many pipelines with parallel updates, especially with high volume and high velocity data.


質問 # 108
Delta Lake の最適化された書き込みについて説明している記述はどれですか。

  • A. 書き込み前にシャッフルが発生し、データをグループ化しようとするため、各実行者がディレクトリ パーティションに基づいて複数のファイルを書き込む代わりに、ファイル数が減ります。
  • B. 最適化された書き込みでは、ディレクトリ パーティションではなく論理パーティションが使用され、パーティション境界はメタデータでのみ表され、書き込まれる小さなファイルが少なくなります。
  • C. 書き込みが完了した後、ファイルをさらに圧縮できるかどうかを検出するための非同期ジョブが実行されます。はい、デフォルトの 1 GB に向けて OPTIMIZE ジョブが実行されます。
  • D. ジョブ クラスターが終了する前に、最新のジョブ中に変更されたすべてのテーブルに対して OPTIMIZE が実行されます。

正解:A

解説:
Delta Lake optimized writes involve a shuffle operation before writing out data to the Delta table.
The shuffle operation groups data by partition keys, which can lead to a reduction in the number of output files and potentially larger files, instead of multiple smaller files. This approach can significantly reduce the total number of files in the table, improve read performance by reducing the metadata overhead, and optimize the table storage layout, especially for workloads with many small files.


質問 # 109
次の表は、電子商取引 Web サイト内のユーザー カートにあるアイテムで構成されています。
Certified-Data-Engineer-Professional試験の最新かつ実際の質問と回答を入手する

次の MERGE ステートメントは、このテーブルでスキーマ評価を有効にして、更新ビューを使用してこのテーブルを更新するために使用されます。

次のアップデートはどのように処理されますか?

  • A. ターゲット スキーマで予期される列が欠落しているため、更新は別の「復元された」列に移動されます。
  • B. 新しいネストされたフィールドがターゲット スキーマに追加され、既存のレコードの基になるファイルが更新されて、新しいフィールドに NULL 値が含まれるようになります。
  • C. 新しく復元されたフィールドがターゲット スキーマに追加され、既存の一致しないレコードに対して NULL として動的に読み取られます。
  • D. ターゲット スキーマ内の既存の列への変更はサポートされていないため、更新でエラーが発生します。

正解:B

解説:
With schema evolution enabled in Databricks Delta tables, when a new field is added to a record through a MERGE operation, Databricks automatically modifies the table schema to include the new field. In existing records where this new field is not present, Databricks will insert NULL values for that field. This ensures that the schema remains consistent across all records in the table, with the new field being present in every record, even if it is NULL for records that did not originally include it.


質問 # 110
データエンジニアリングチームは、顧客からの忘れ去られる(データを削除する)リクエストを処理するジョブを設定しました。削除が必要なすべてのユーザーデータは、デフォルトのテーブル設定を使用してDelta Lakeテーブルに保存されます。
チームは、毎週日曜日の午前1時に、前週のすべての削除処理をバッチジョブとして実行することにしました。このジョブの合計所要時間は1時間未満です。毎週月曜日の午前3時には、バッチジョブが組織全体のすべてのDelta Lakeテーブルに対して一連のVACUUMコマンドを実行します。
コンプライアンス担当者は最近、Delta Lakeのタイムトラベル機能について知りました。これにより、削除されたデータへの継続的なアクセスが可能になるのではないかと懸念しています。
すべての削除ロジックが正しく実装されていると仮定すると、どのステートメントがこの問題に正しく対処していますか?

  • A. デフォルトのデータ保持しきい値は7日間なので、削除されたレコードを含むデータファイルは、8日後にバキュームジョブが実行されるまで保持されます。
  • B. vacuum コマンドは削除されたレコードを含むすべてのファイルを完全に削除するため、削除されたレコードにはタイムトラベルで約 24 時間アクセスできる場合があります。
  • C. デフォルトのデータ保持しきい値は 24 時間であるため、削除されたレコードを含むデータ ファイルは、翌日にバキューム ジョブが実行されるまで保持されます。
  • D. Delta Lake タイム トラベルではテーブルの履歴全体へのフル アクセスが提供されるため、削除されたレコードは完全な管理者権限を持つユーザーがいつでも再作成できます。
  • E. Delta Lake の削除ステートメントには ACID 保証があるため、削除ジョブが完了するとすぐに、削除されたレコードはすべてのストレージ システムから完全に消去されます。

正解:A

解説:
https://learn.microsoft.com/en-us/azure/databricks/delta/vacuum


質問 # 111
データ エンジニアリング チームは次のコードを管理しています。

このコードが論理的に正しい結果を生成し、ソース テーブル内のデータが重複排除され検証されていると仮定すると、このコードを実行すると何が起こるかを説明するステートメントはどれですか。

  • A. バッチ ジョブは、accountID を主キーとして使用して、enriched_itemized_orders_by_account テーブルを更新し、テーブルの現在のバージョンとは異なる値を持つ行のみを置き換えます。
  • B. 増分ジョブは状態ストアの情報を活用して、ソース テーブル内の結合されていない行を識別し、これらの行を enriched_iteinized_orders_by_account テーブルに書き込みます。
  • C. enriched_itemized_orders_by_account がクエリされるまで計算は行われません。クエリの具体化時に、結合ロジックで参照される 3 つのテーブルのそれぞれにある現在の有効なデータ バージョンを使用して結果が計算されます。
  • D. enriched_itemized_orders_by_account テーブルは、結合ロジックで参照される 3 つのテーブルのそれぞれにある現在の有効なデータ バージョンを使用して上書きされます。
  • E. 増分ジョブは、いずれかのソース テーブルに新しい行が書き込まれたかどうかを検出します。新しい行が検出されると、すべての結果が再計算され、enriched_itemized_orders_by_account テーブルを上書きするために使用されます。

正解:D

解説:
This is the correct answer because it describes what will occur when this code is executed. The code uses three Delta Lake tables as input sources: accounts, orders, and order_items. These tables are joined together using SQL queries to create a view called new_enriched_itemized_orders_by_account, which contains information about each order item and its associated account details. Then, the code uses write.format("delta").mode("overwrite") to overwrite a target table called enriched_itemized_orders_by_account using the data from the view. This means that every time this code is executed, it will replace all existing data in the target table with new data based on the current valid version of data in each of the three input tables.


質問 # 112
プラットフォーム エンジニアは、開発チームが使用するカタログとスキーマを作成しています。
エンジニアは初期カタログcatalog_Aと初期スキーマschema_Aを作成しました。また、エンジニアは開発チームにUSE CATALOG、USE SCHEMA、およびCREATE TABLE権限を付与し、スキーマへの新しいテーブルの登録を開始できるようにしました。
エンジニアは、カタログとスキーマの所有者であるにもかかわらず、Schema_A の基礎となるテーブルにアクセスできないことに気付きました。
エンジニアが基礎となるテーブルにアクセスできない理由は何ですか?

  • A. スキーマの所有者は、スキーマ内のテーブルに対する権限を自動的には持ちませんが、いつでも自分自身に権限を付与できます。
  • B. テーブル作成者によって明示的に付与された権限は、プラットフォーム エンジニアがスキーマ内の基礎となるテーブルにアクセスできる唯一の方法です。
  • C. USE CATALOG が付与されたユーザーは、ダウンストリーム テーブルに対する所有者の権限を変更できます。
  • D. 所有者のテーブル権限が自動的に更新されなかったため、プラットフォーム エンジニアは REFRESH ステートメントを実行する必要があります。

正解:A

解説:
In Databricks, owning a catalog or schema does not automatically grant access to the tables within it. Table-level permissions are separate, so even the schema or catalog owner must be explicitly granted privileges on individual tables or use the ability to grant themselves access.


質問 # 113
大規模なデータセットを扱うパフォーマンスが重要なアプリケーションでは、従来の PySpark UDF よりも Pandas UDF が好まれることが多いのはなぜでしょうか?

  • A. Apache Arrow を活用して、JVM と Python ランタイム間のベクトル化された操作を可能にし、シリアル化コストを削減し、計算効率を向上させます。
  • B. シリアル化を完全にバイパスすることで JVM と Python の境界を排除し、データ変換のオーバーヘッドを回避します。
  • C. 軽量の Python ラッパーを介して各行を個別にストリーミングすることで、メモリ使用量を最小限に抑え、バッチ処理のオーバーヘッドを回避します。
  • D. ネイティブ Spark 最適化を使用して Python で関数の行レベルの実行が可能になり、列実行の必要性がなくなります。

正解:A

解説:
Pandas UDFs use Apache Arrow to transfer data between the JVM and Python in a columnar, vectorized format. This significantly reduces serialization overhead and enables efficient batch processing, resulting in much better performance than traditional row-by-row PySpark UDFs on large datasets.


質問 # 114
ジュニアデータエンジニアが、Delta Lakeの変更データフィード機能を利用して、delta.enableChangeDataFeed = trueプロパティで作成されたブロンズテーブルの全行で有効であったすべての値を表すType 1テーブルを作成しようとしています。彼らは、以下のコードを日常的なジョブとして実行する予定です。

上記のクエリを複数回実行した場合の実行と結果を説明するステートメントはどれですか?

  • A. ジョブが実行されるたびに、挿入または更新されたレコードの利用可能な履歴全体がターゲット テーブルに追加され、多くの重複エントリが生成されます。
  • B. ジョブが実行されるたびに、新しく更新されたレコードがターゲット テーブルにマージされ、同じ主キーを持つ以前の値が上書きされます。
  • C. ジョブが実行されるたびに、前回の実行以降に挿入または更新されたレコードのみがターゲット テーブルに追加され、目的の結果が得られます。
  • D. ジョブが実行されるたびに、元のバージョンと現在のバージョンの違いが計算されます。これにより、一部のレコードに重複したエントリが発生する可能性があります。
  • E. ジョブが実行されるたびに、挿入または更新されたレコードの履歴全体を使用してターゲット テーブルが上書きされ、目的の結果が得られます。

正解:A

解説:
Reading table's changes, captured by CDF, using spark.read means that you are reading them as a static source. So, each time you run the query, all table's changes (starting from the specified startingVersion) will be read.


質問 # 115
......

更新されたPDF(2026年最新)実際にあるDatabricks Databricks-Certified-Data-Engineer-Professional日本語試験問題:https://jp.fast2test.com/Databricks-Certified-Data-Engineer-Professional-JPN-premium-file.html


弊社を連絡する

我々は12時間以内ですべてのお問い合わせを答えます。

我々の働いている時間: ( GMT 0:00-15:00 )
月曜日から土曜日まで

サポート: 現在連絡 

English Deutsch 繁体中文 한국어