Databricks Certified Data Engineer Associate Exam (Databricks-Certified-Data-Engineer-Associate日本語版) - Databricks-Certified-Data-Engineer-Associate日本語무료 덤프문제 풀어보기
データエンジニアは毎日ステートメントを実行し、前日の売上をテーブルtransactionsにコピーします。各日の売上は、「/transactions/raw」という場所にある個別のファイルに保存されます。
今日、データ エンジニアは次のコマンドを実行してこのタスクを完了します。

今日コマンドを実行した後、データ エンジニアはテーブル トランザクション内のレコード数が変更されていないことに気付きました。
次のどれが、ステートメントがテーブルに新しいレコードをコピーしなかった理由を説明していますか?
今日、データ エンジニアは次のコマンドを実行してこのタスクを完了します。

今日コマンドを実行した後、データ エンジニアはテーブル トランザクション内のレコード数が変更されていないことに気付きました。
次のどれが、ステートメントがテーブルに新しいレコードをコピーしなかった理由を説明していますか?
정답: B
설명: (Fast2test 회원만 볼 수 있음)
オートローダーがデータを段階的に処理する際に使用するツールは次のどれですか?
정답: E
설명: (Fast2test 회원만 볼 수 있음)
データエンジニアが、複数のタスクを含むジョブを毎晩実行しています。クラスターの起動に時間がかかるため、各タスクの実行速度が遅くなっています。
ジョブに使用されるクラスターの起動時間を改善するために、データ エンジニアが実行できるアクションは次のどれですか。
ジョブに使用されるクラスターの起動時間を改善するために、データ エンジニアが実行できるアクションは次のどれですか。
정답: E
설명: (Fast2test 회원만 볼 수 있음)
「DESCRIBE HISTORY students」コマンドを使用すると、「students」テーブルのデルタトランザクションログが表示されます。データエンジニアは、ログに記載されているUPDATE操作が行われる前のテーブルの状態をクエリする必要があります。

データエンジニアは、これを実現するためにどのコマンドを使用すべきでしょうか?(2つ選択してください。)

データエンジニアは、これを実現するためにどのコマンドを使用すべきでしょうか?(2つ選択してください。)
정답: B,C
チームは、ジョブ、リソース、および依存関係を宣言するYAMLマニフェストを作成し、Databricks CLIを使用してそれらをDatabricksにデプロイします。デプロイは成功します。
彼らはどの機能を使っているのですか?
彼らはどの機能を使っているのですか?
정답: C
설명: (Fast2test 회원만 볼 수 있음)
次のコマンドのうち、member_id 列の null 値の数を返すものはどれですか。
정답: D
설명: (Fast2test 회원만 볼 수 있음)
開発者は、BronzeテーブルのレコードをSilverテーブルに処理するデータパイプラインを構築しています。Bronzeテーブル(bronze_events)には、上流の取り込みシステムからの少なくとも1回の配信保証のため、重複レコードが含まれています。開発者は、次のPySparkコードを記述します。
deduped_df = df.dropDuplicates()
deduped_df.summary("count", "mean", "stddev").show()
from pyspark.sql.functions import approx_count_distinct
deduped_df.select(approx_count_distinct("user_id")).show()
引数なしで dropDuplicates() を実行した後、event_timestamp 列のみが異なる行がいくつか残ります。開発者は、user_id と event_type のみに基づいてレコードの重複を削除し、これら 2 つの列の一意の組み合わせごとに 1 つの行を残したいと考えています。
どのコード変更によって、この重複排除の要件が満たされますか?
deduped_df = df.dropDuplicates()
deduped_df.summary("count", "mean", "stddev").show()
from pyspark.sql.functions import approx_count_distinct
deduped_df.select(approx_count_distinct("user_id")).show()
引数なしで dropDuplicates() を実行した後、event_timestamp 列のみが異なる行がいくつか残ります。開発者は、user_id と event_type のみに基づいてレコードの重複を削除し、これら 2 つの列の一意の組み合わせごとに 1 つの行を残したいと考えています。
どのコード変更によって、この重複排除の要件が満たされますか?
정답: C
Auto Loaderはどのような種類のワークロードに対応していますか?
정답: D
データ エンジニアが単一ノード クラスターを使用するシナリオを説明しているのは次のどれですか。
정답: E
설명: (Fast2test 회원만 볼 수 있음)
データ エンジニアは、データ パイプラインの一部として Delta テーブルを使用する必要がありますが、適切な権限があるかどうかがわかりません。
データ エンジニアがテーブルに対する権限を確認できるのは次のどの場所ですか。
データ エンジニアがテーブルに対する権限を確認できるのは次のどの場所ですか。
정답: E
설명: (Fast2test 회원만 볼 수 있음)
データエンジニアは、拡張子が異なるファイルを含むディレクトリから、pngファイルのみを解析する必要があります。このタスクを実行するために、データエンジニアはどのコードを使用すべきでしょうか?
정답: C
ある組織は、ACIDトランザクションとスキーマ強制をサポートする最適化されたストレージレイヤーを探しています。この組織はどのテクノロジーを使用すべきでしょうか?
정답: D
データエンジニアは、以下のスキーマを持つevents_dfという名前のPySpark DataFrameを持っています。
event_id 文字列、
デバイス構造<
id: 文字列、
モデル: STRING、
場所: STRUCT<
緯度: ダブル、
経度: ダブル
>
>,
イベントタイムスタンプ
エンジニアは、イベント識別子とタイムスタンプを保持したまま、ネストされたすべてのデバイスフィールドをルートレベルの列にフラット化する必要があります。
この要件を満たすPySpark式はどれですか?
event_id 文字列、
デバイス構造<
id: 文字列、
モデル: STRING、
場所: STRUCT<
緯度: ダブル、
経度: ダブル
>
>,
イベントタイムスタンプ
エンジニアは、イベント識別子とタイムスタンプを保持したまま、ネストされたすべてのデバイスフィールドをルートレベルの列にフラット化する必要があります。
この要件を満たすPySpark式はどれですか?
정답: B