Google Professional-Data-Engineer日本語試験情報と無料練習テストはこちら [Q154-Q177]

Share

Google Professional-Data-Engineer日本語試験情報と無料練習テストはこちら

合格させるGoogle Professional-Data-Engineer日本語プレミアムお試しセットテストエンジンPDFで無料問題集セット

質問 # 154
Dataprocクラスターには多くの構成ファイルが含まれています。これらのファイルを更新するには、-propertiesオプションを使用する必要があります。オプションの形式は、file_prefix:property = _____です。

  • A. id
  • B. 値
  • C. null
  • D. 詳細

正解:B

解説:
Explanation
To make updating files and properties easy, the --properties command uses a special format to specify the configuration file and the property and value within the file that should be updated. The formatting is as follows: file_prefix:property=value.
Reference: https://cloud.google.com/dataproc/docs/concepts/cluster-properties#formatting


質問 # 155
Bigtableクラスター内の特定のノードで不均衡な数の読み取りや書き込みを引き起こす可能性が高い行キーはどれですか(2つの回答を選択してください)。

  • A. 連続した数値ID
  • B. 銘柄記号とそれに続くタイムスタンプ
  • C. 非順次数値ID
  • D. タイムスタンプとそれに続く銘柄記号

正解:A、D

解説:
using a timestamp as the first element of a row key can cause a variety of problems.
In brief, when a row key for a time series includes a timestamp, all of your writes will target a single node; fill that node; and then move onto the next node in the cluster, resulting in hotspotting.
Suppose your system assigns a numeric ID to each of your application's users. You might be tempted to use the user's numeric ID as the row key for your table. However, since new users are more likely to be active users, this approach is likely to push most of your traffic to a small number of nodes.
[https://cloud.google.com/bigtable/docs/schema-design]
Reference:
https://cloud.google.com/bigtable/docs/schema-design-time-series#ensure_that_your_row_key_avoids_hotspotti


質問 # 156
Google Cloud Bigtableは、各行の単一の値にインデックスを付けます。この値は_______と呼ばれます。

  • A. 主キー
  • B. 一意のキー
  • C. 行キー
  • D. マスターキー

正解:C

解説:
Cloud Bigtable is a sparsely populated table that can scale to billions of rows and thousands of columns, allowing you to store terabytes or even petabytes of data. A single value in each row is indexed; this value is known as the row key.


質問 # 157
あなたのチームはあなたの会社でETLを開発し維持する責任があります。入力データのエラーが原因でDataflowジョブの1つが失敗しているため、パイプラインの信頼性を向上させる必要があります(失敗したすべてのデータを再処理できるようにするなど)。
あなたは何をするべきか?

  • A. try ... catchブロックをsideOutputに追加して、後でPubSubに保存できるPCollectionを作成します。
  • B. フィルタリングステップを追加して、将来これらのタイプのエラーをスキップし、ログからエラーのある行を抽出します。
  • C. データを変換するtry ... catchブロックをDoFnに追加し、ログから誤った行を抽出します。
  • D. データを変換するtry ... catchブロックをDoFnに追加し、誤った行をDoFnから直接PubSubに書き込みます。

正解:D


質問 # 158
バッチ処理ジョブ用の Dataflow パイプラインを設計しています。ジョブ送信時の複数のゾーン障害を軽減したいと考えています。あなたは何をするべきか?

  • A. パイプラインのステージング場所を地域の Cloud Storage バケットとして設定します。
  • B. -zone フラグを使用して、2 つの異なるゾーンに重複したパイプラインを送信します。
  • C. -region フラグを使用してワーカー領域を指定します。
  • D. ジョブの送信時にゾーン障害が発生した場合にジョブを再送信するための Eventarc トリガーを作成します。

正解:C

解説:
By specifying a worker region, you can run your Dataflow pipeline in a multi-zone or multi-region configuration, which provides higher availability and resilience in case of zonal failures1. The -region flag allows you to specify the regional endpoint for your pipeline, which determines the location of the Dataflow service and the default location of the Compute Engine resources1. If you do not specify a zone by using the
-zone flag, Dataflow automatically selects a zone within the region for your job workers1. This option is recommended over submitting duplicate pipelines in two different zones, which would incur additional costs and complexity. Setting the pipeline staging location as a regional Cloud Storage bucket does not affect the availability of your pipeline, as the staging location only stores the pipeline code and dependencies2. Creating an Eventarc trigger to resubmit the job in case of zonal failure is not a reliable solution, as it depends on the availability of the Eventarc service and the zonal resources at the time of resubmission. References:
* 1: Pipeline troubleshooting and debugging | Cloud Dataflow | Google Cloud
* 3: Regional endpoints | Cloud Dataflow | Google Cloud


質問 # 159
次のうち、データフローパイプラインについて正しくないものはどれですか?

  • A. データフローパイプラインは他のGoogleCloudサービスからのデータを消費する可能性があります
  • B. データフローパイプラインはJavaでプログラムできます
  • C. DataflowパイプラインはDataflowに関連付けられており、他のランナーで実行することはできません
  • D. データフローパイプラインは統合プログラミングモデルを使用しているため、ストリーミングデータソースとバッチデータソースの両方で機能します

正解:C

解説:
Dataflow pipelines can also run on alternate runtimes like Spark and Flink, as they are built using the Apache Beam SDKs Reference: https://cloud.google.com/dataflow/


質問 # 160
Cloud Machine Learning Engineでサポートされているソフトウェアライブラリはどれですか?

  • A. TheanoとTensorFlow
  • B. TensorFlowとトーチ
  • C. TensorFlow
  • D. テアノとトーチ

正解:C

解説:
Cloud ML Engine mainly does two things:
Enables you to train machine learning models at scale by running TensorFlow training applications in the cloud.
Hosts those trained models for you in the cloud so that you can use them to get predictions about new data.
Reference: https://cloud.google.com/ml-engine/docs/technical-overview#what_it_does


質問 # 161
本番環境で Pub/Sub からデータを取り込むストリーミング パイプラインがあります。改善されたビジネス ロジックでこのストリーミング パイプラインを更新する必要があります。更新されたパイプラインが配信された Pub/Sub メッセージの過去 2 日間を再処理するようにする必要があります。あなたは何をするべきか?
2 つの答えを選択してください

  • A. デプロイの 2 日前に Pub/Sub スナップショット キャプチャを使用します。
  • B. タイムスタンプを使用して Pub/Sub Seek を使用します。
  • C. Pub/Sub サブスクリプションの保持要求メッセージ フラグを使用します。
  • D. Pub/Sub サブスクリプションの clear-retry-policy フラグを使用します。
  • E. デプロイの 2 日前に新しい Pub/Sub サブスクリプションを作成します。

正解:A、B

解説:
To update a streaming pipeline with improved business logic and reprocess the previous two days of delivered Pub/Sub messages, you should use Pub/Sub Seek with a timestamp and Pub/Sub Snapshot capture two days before the deployment. Pub/Sub Seek allows you to replay or purge messages in a subscription based on a time or a snapshot. Pub/Sub Snapshot allows you to capture the state of a subscription at a given point in time and replay messages from that point. By using these features, you can ensure that the updated pipeline can process the messages that were delivered in the past two days without losing any data. References:
* Pub/Sub Seek
* Pub/Sub Snapshot


質問 # 162
時系列トランザクションデータをコピーするデータパイプラインを作成して、分析のためにデータサイエンスチームがBigQuery内からクエリを実行できるようにする必要があります。 1時間ごとに、何千ものトランザクションが新しいステータスで更新されます。初期データセットのサイズは1.5PBで、1日あたり3TBずつ増加します。データは高度に構造化されており、データサイエンスチームはこのデータに基づいて機械学習モデルを構築します。データサイエンスチームのパフォーマンスと使いやすさを最大化する必要があります。どの2つの戦略を採用する必要がありますか?
2つの答えを選択してください。

  • A. データの構造を可能な限り維持します。
  • B. BigQuery UPDATEを使用して、データセットのサイズをさらに縮小します。
  • C. トランザクションデータの毎日のスナップショットをCloud Storageにコピーし、Avroファイルとして保存します。クエリを実行するには、外部データソースに対するBigQueryのサポートを使用します。
  • D. ステータスの更新が更新される代わりにBigQueryに追加されるデータパイプラインを開発します。
  • E. 可能な限りデータを非正規化します。

正解:C、E


質問 # 163
何百万ものモノのインターネット(IoT)デバイスから送信されたテレメトリデータを処理するためにNoSQLデータベースを選択しています。データの量は年間100TBで増加しており、各データエントリには約100の属性があります。
データ処理パイプラインは、原子性、一貫性、分離、および耐久性(ACID)を必要としません。
ただし、高可用性と低遅延が必要です。
個々のフィールドに対してクエリを実行して、データを分析する必要があります。要件を満たす3つのデータベースはどれですか? (3つ選択してください。)

  • A. HBase
  • B. Hiveを使用したHDFS
  • C. MySQL
  • D. MongoDB
  • E. カサンドラ
  • F. Redis

正解:A、B、D


質問 # 164
ローカルマシンでBigQueryソースを含むパイプラインを実行すると、引き続きアクセス許可拒否エラーが発生します。その理由は何でしょうか?

  • A. パイプラインはローカルで実行できません
  • B. マシンにgcloudがありません
  • C. ローカルマシンからBigQueryにアクセスできません
  • D. gcloudはBigQueryリソースにアクセスできません

正解:D

解説:
When reading from a Dataflow source or writing to a Dataflow sink using DirectPipelineRunner, the Cloud Platform account that you configured with the gcloud executable will need access to the corresponding source/sink


質問 # 165
BigQueryテーブルの特定のパーティションをどのようにクエリしますか?

  • A. WHERE句で__PARTITIONTIME疑似列を使用します
  • B. EXTRACT(DAY)句を使用します
  • C. WHERE句でDATEBETWEENを使用します
  • D. WHERE句でDAY列を使用します

正解:A

解説:
Explanation
Partitioned tables include a pseudo column named _PARTITIONTIME that contains a date-based timestamp for data loaded into the table. To limit a query to particular partitions (such as Jan 1st and 2nd of 2017), use a clause similar to this:
WHERE _PARTITIONTIME BETWEEN TIMESTAMP('2017-01-01') AND TIMESTAMP('2017-01-02') Reference: https://cloud.google.com/bigquery/docs/partitioned-tables#the_partitiontime_pseudo_column


質問 # 166
インフラストラクチャには、一連のYouTubeチャンネルが含まれています。あなたは、分析のためにYouTubeチャンネルデータをGoogleCloudに送信するプロセスを作成する任務を負っています。世界中のマーケティングチームが最新のYouTubeチャンネルのログデータでANSISQLやその他のタイプの分析を実行できるようにするソリューションを設計したいと考えています。
a。Google Cloudへのログデータ転送をどのように設定する必要がありますか?

  • A. ストレージ転送サービスを使用して、オフサイトのバックアップファイルを最終的な宛先としてクラウドストレージリージョナルバケットに転送します。
  • B. BigQuery Data Transfer Serviceを使用して、オフサイトのバックアップファイルを最終的な宛先としてCloudStorageMulti-Regionalストレージバケットに転送します。
  • C. BigQuery Data Transfer Serviceを使用して、オフサイトのバックアップファイルをCloudStorageRegionalに転送します
  • D. ストレージ転送サービスを使用して、オフサイトのバックアップファイルを最終的な宛先としてCloudStorageMulti-Regionalストレージバケットに転送します。

正解:A

解説:
storage bucket as a final destination.


質問 # 167
Dataflow SDKは最近、どのApacheサービスに移行されましたか?

  • A. Apache Spark
  • B. Apache Beam
  • C. Apache Hadoop
  • D. Apache Kafka

正解:B

解説:
Dataflow SDKs are being transitioned to Apache Beam, as per the latest Google directive Reference: https://cloud.google.com/dataflow/docs/


質問 # 168
あなたは服の推奨をするためのモデルを構築しています。ユーザーのファッションの好みは時間の経過とともに変化する可能性が高いことがわかっているため、データパイプラインを構築して、新しいデータが利用可能になったときにモデルにストリーミングします。
このデータをどのように使用してモデルをトレーニングする必要がありますか?

  • A. 既存のデータをテストセットとして使用しながら、新しいデータをトレーニングします。
  • B. 既存のデータと新しいデータの組み合わせでモデルを継続的に再トレーニングします。
  • C. 新しいデータをテストセットとして使用しながら、既存のデータをトレーニングします。
  • D. 新しいデータのみでモデルを継続的に再トレーニングします。

正解:C

解説:
https://cloud.google.com/automl-tables/docs/prepare


質問 # 169
Cloud Bigtableにデータを保存する場合、保存されるデータの推奨最小量はどれくらいですか?

  • A. 1 GB
  • B. 500 TB
  • C. 500 GB
  • D. 1 TB

正解:D

解説:
Cloud Bigtable is not a relational database. It does not support SQL queries, joins, or multi-row transactions. It is not a good solution for less than 1 TB of data.
Reference: https://cloud.google.com/bigtable/docs/overview#title_short_and_other_storage_options


質問 # 170
既存のオンプレミス データ戦略を最新化する必要があります。あなたの組織は現在使用しています。
* データ レプリケーション用のオンプレミス Hadoop 分散ファイル システム (HDFS) を含む、複数の大規模データ セットを処理するための Apache Hadoop クラスター。
* Apache Airflow は、数千のジョブ ステップを含む数百の ETL パイプラインを調整します。
Hadoop ワークロードを処理でき、既存のオーケストレーション プロセスへの変更を最小限に抑えることができる新しいアーキテクチャを Google Cloud にセットアップする必要があります。あなたは何をするべきか?

  • A. 大規模なワークロードには Bigtable を使用し、Cloud Storage に接続して HDFS ユースケースを処理します。 Cloud Composer でパイプラインをオーケストレーションします。
  • B. Dataproc を使用して Hadoop クラスタを Google Cloud に移行し、Cloud Storage を使用して HDFS のユースケースを処理します。Cloud Data Fusion を使用して、ETL パイプラインを視覚的に設計してデプロイします。
  • C. Dataproc を使用して Hadoop クラスタを Google Cloud に移行し、Cloud Storage を使用して HDFS ユースケースを処理します ETL パイプラインを Dataflow に変換します。
  • D. Dataproc を使用して Hadoop クラスタを Google Cloud に移行し、Cloud Storage を使用して HDFS のユースケースを処理します。Cloud Composer を使用してパイプラインをオーケストレーションします。

正解:D

解説:
Dataproc is a fully managed service that allows you to run Apache Hadoop and Spark workloads on Google Cloud. It is compatible with the open source ecosystem, so you can migrate your existing Hadoop clusters to Dataproc with minimal changes. Cloud Storage is a scalable, durable, and cost-effective object storage service that can replace HDFS for storing and accessing data. Cloud Storage offers interoperability with Hadoop through connectors, so you can use it as a data source or sink for your Dataproc jobs. Cloud Composer is a fully managed service that allows you to create, schedule, and monitor workflows using Apache Airflow. It is integrated with Google Cloud services, such as Dataproc, BigQuery, Dataflow, and Pub/Sub, so you can orchestrate your ETL pipelines across different platforms. Cloud Composer is compatible with your existing Airflow code, so you can migrate your existing orchestration processes to Cloud Composer with minimal changes.
The other options are not as suitable as Dataproc and Cloud Composer for this use case, because they either require more changes to your existing code, or do not meet your requirements. Dataflow is a fully managed service that allows you to create and run scalable data processing pipelines using Apache Beam. However, Dataflow is not compatible with your existing Hadoop code, so you would need to rewrite your ETL pipelines using Beam. Bigtable is a fully managed NoSQL database service that can handle large and complex data sets.
However, Bigtable is not compatible with your existing Hadoop code, so you would need to rewrite your queries and applications using Bigtable APIs. Cloud Data Fusion is a fully managed service that allows you to visually design and deploy data integration pipelines using a graphical interface. However, Cloud Data Fusion is not compatible with your existing Airflow code, so you would need to recreate your orchestration processes using Cloud Data Fusion UI. References:
* Dataproc overview
* Cloud Storage connector for Hadoop
* Cloud Composer overview


質問 # 171
Google Cloudで新しいパイプラインを作成して、IoTデータをCloud Pub / SubからCloudDataflowを介してBigQueryにストリーミングします。データをプレビューしていると、データの約2%が破損しているように見えます。この破損したデータを除外するには、CloudDataflowパイプラインを変更する必要があります。あなたは何をするべきか?

  • A. 破損した要素を破棄するためにCloudDataflowにParDoトランスフォームを追加します。
  • B. 要素が破損している場合にブール値を返すSideInputを追加します。
  • C. Cloud DataflowにPartitionトランスフォームを追加して、有効なデータを破損したデータから分離します。
  • D. Cloud DataflowにGroupByKeyトランスフォームを追加して、すべての有効なデータをグループ化し、残りを破棄します。

正解:A


質問 # 172
リアルタイムアプリケーションにBigtableを使用していて、読み取りと書き込みが混在する重い負荷があります。
最近、追加のユースケースを特定し、データベース全体の特定の統計を計算するために1時間ごとに分析ジョブを実行する必要があります。本番アプリケーションの信頼性と分析ワークロードの両方を確保する必要があります。
あなたは何をするべきか?

  • A. BigtableダンプをGCSにエクスポートし、エクスポートされたファイルに対して分析ジョブを実行します。
  • B. 既存のクラスターのサイズを2倍に増やし、サイズを変更した新しいクラスターで分析ワークロードを実行します。
  • C. マルチクラスタールーティングを使用して既存のインスタンスに2つ目のクラスターを追加し、通常のワークロードにはライブトラフィックアプリプロファイルを使用し、分析ワークロードにはバッチ分析プロファイルを使用します。
  • D. 単一クラスタールーティングを使用して既存のインスタンスに2番目のクラスターを追加し、通常のワークロードにはライブトラフィックアプリプロファイルを使用し、分析ワークロードにはバッチ分析プロファイルを使用します。

正解:C


質問 # 173
キャンセルしたい仕事があります。これはストリーミングパイプラインであり、処理中のデータが処理されて出力に書き込まれるようにする必要があります。パイプラインジョブを停止するためにDataflow監視コンソールで使用できるコマンドは次のうちどれですか?

  • A. 排水
  • B. 停止
  • C. 終了
  • D. キャンセル

正解:A

解説:
Using the Drain option to stop your job tells the Dataflow service to finish your job in its current state. Your job will immediately stop ingesting new data from input sources, but the Dataflow service will preserve any existing resources (such as worker instances) to finish processing and writing any buffered data in your pipeline.
Reference: https://cloud.google.com/dataflow/pipelines/stopping-a-pipeline


質問 # 174
データポイントを取り込んでGUIDを返すサービスを使用して、新しいWebサイトユーザーにグローバル一意識別子(GUID)を提供する必要があります。このデータは、パイプライン内のマイクロサービスを介して行うHTTP呼び出しを介して内部システムと外部システムの両方から供給されます。毎秒数万のメッセージになり、マルチスレッド化できるため、システムのバックプレッシャが心配になります。そのバックプレッシャを最小限に抑えるようにパイプラインをどのように設計する必要がありますか?

  • A. HTTP経由でサービスを呼び出す
  • B. DoFnのstartBundleメソッドで新しいオブジェクトを作成します
  • C. クラス定義で静的にパイプラインを作成します
  • D. ジョブを10秒単位でバッチ処理します

正解:A


質問 # 175
世界中の倉庫の温度データを収集するために、10,000台の新しいモノのインターネットデバイスを導入しています。これらの非常に大きなデータセットをリアルタイムで処理、保存、分析する必要があります。あなたは何をするべきか?

  • A. データをCloud Storageに送信し、分析が必要な場合はいつでも、Google CloudDataprocで必要に応じてApacheHadoopクラスターを起動します。
  • B. データをGoogle Cloud Datastoreに送信してから、BigQueryにエクスポートします。
  • C. ログをバッチでGoogle Cloud Storageにエクスポートしてから、Google Cloud SQLインスタンスを起動し、Cloud Storageからデータをインポートして、必要に応じて分析を実行します。
  • D. データをGoogle Cloud Pub / Subに送信し、Cloud Pub / SubをGoogleCloud Dataflowにストリーミングして、データをGoogleBigQueryに保存します。

正解:D


質問 # 176
MJTelcoケーススタディ
会社概要
MJTelcoは、世界中の急速に成長し、サービスの行き届いていない市場でネットワークを構築することを計画している新興企業です。
同社は革新的な光通信ハードウェアの特許を取得しています。これらの特許に基づいて、安価なハードウェアで多くの信頼性の高い高速バックボーンリンクを作成できます。
会社背景
経験豊富な通信幹部によって設立されたMJTelcoは、宇宙での通信の課題を克服するために元々開発されたテクノロジーを使用しています。運用の基本として、リアルタイム分析を推進し、機械学習を組み込んでトポロジを継続的に最適化する分散データインフラストラクチャを作成する必要があります。彼らのハードウェアは安価であるため、ネットワークを過剰に展開して、動的な地域政治が場所の可用性とコストに与える影響を考慮できるようにすることを計画しています。
彼らの管理および運用チームは世界中に配置されており、データコンシューマー間で多対多の関係を構築し、システムで提供しています。慎重に検討した結果、彼らはパブリッククラウドが彼らのニーズをサポートするのに最適な環境であると判断しました。
ソリューションコンセプト
MJTelcoは、ラボで成功した概念実証(PoC)プロジェクトを実行しています。彼らには2つの主要なニーズがあります:
* PoCをスケーリングおよび強化して、50,000を超えるインストールに増加したときに生成される大幅に多くのデータフローをサポートします。
*機械学習サイクルを改善して、トポロジ定義の制御に使用する動的モデルを検証および改善します。
MJTelcoは、開発/テスト、ステージング、本番の3つの個別の動作環境も使用して、実験の実行、新機能の展開、本番の顧客へのサービス提供のニーズに対応します。
ビジネス要件
*最小限のコストで本番環境をスケールアップし、予測不可能な分散型通信ユーザーコミュニティで必要なときに必要な場所でリソースをインスタンス化します。
*独自のデータのセキュリティを確保して、最先端の機械学習と分析を保護します。
*分散した研究者からの分析のためのデータへの信頼できるタイムリーなアクセスを提供します
*顧客に影響を与えることなく、機械学習モデルの迅速な反復をサポートする分離された環境を維持します。
技術要件
テレメトリデータの安全で効率的な転送と保存を保証します
インスタンスを迅速にスケーリングして、それぞれ複数のフローを持つ10,000〜100,000のデータプロバイダーをサポートします。
約1億レコード/日を保存する最大2年間のデータを追跡するデータテーブルに対する分析とプレゼンテーションを可能にします。テレメトリフローと本番学習サイクルの両方でのデータパイプラインの問題の認識に焦点を当てた監視インフラストラクチャの迅速な反復をサポートします。
CEOの声明
私たちのビジネスモデルは、特許、分析、動的な機械学習に依存しています。当社の安価なハードウェアは信頼性が高くなるように構成されているため、コスト面で有利です。信頼性と容量のコミットメントを満たすには、大規模な分散データパイプラインを迅速に安定させる必要があります。
CTOステートメント
当社のパブリッククラウドサービスは、宣伝どおりに動作する必要があります。データを拡張して安全に保つリソースが必要です。
また、データサイエンティストがモデルを注意深く研究し、迅速に適応できる環境も必要です。
データの処理は自動化に依存しているため、反復しながら機能する開発環境とテスト環境も必要です。
CFOステートメント
プロジェクトが大きすぎて、データと分析に必要なハードウェアとソフトウェアを維持できません。また、運用チームにこれほど多くのデータフィードを監視する余裕がないため、自動化とインフラストラクチャに依存します。 Google Cloudの機械学習により、定量的研究者は、データパイプラインの問題ではなく、価値の高い問題に取り組むことができます。
これで、MJTelcoのGoogle Cloud Dataflowパイプラインは、50,000のインストールからデータの受信を開始する準備が整いました。
CloudDataflowが必要に応じて計算能力をスケールアップできるようにする必要があります。どのCloudDataflowパイプライン構成設定を更新する必要がありますか?

  • A. ゾーン
  • B. ワーカーあたりのディスクサイズ
  • C. 労働者の数
  • D. 労働者の最大数

正解:A


質問 # 177
......

更新された公式認定はProfessional-Data-Engineer日本語認証済みのProfessional-Data-Engineer日本語問題集でPDF:https://jp.fast2test.com/Professional-Data-Engineer-JPN-premium-file.html


弊社を連絡する

我々は12時間以内ですべてのお問い合わせを答えます。

我々の働いている時間: ( GMT 0:00-15:00 )
月曜日から土曜日まで

サポート: 現在連絡 

English Deutsch 繁体中文 한국어