Google Cloud Professional Data Engineer(PDE)备考指南:数据管道与分析

GCP-PDE 备考指南:梳理数据系统设计、数据摄取处理、存储、分析准备及工作负载运维五个领域。

Professional Data Engineer(PDE)考查如何设计、构建和运营数据平台,让数据能安全、可靠地支持分析和业务决策。题目会让你在批处理与流处理、存储产品、治理、性能和成本之间作选择。

GCP-PDE 是本站简称,官方认证名称为 Professional Data Engineer。本文依据官方认证页和现行考试指南整理;请在考试前核对指南版本。

考试领域与权重

官方领域 主要内容 权重
Designing data processing systems 安全、可靠、迁移与架构设计 约 22%
Ingesting and processing the data 批流数据管道、转换、编排 约 25%
Storing the data 存储选型、数据仓库/湖和数据平台 约 20%
Preparing and using data for analysis BI、AI/ML 数据准备与数据共享 约 15%
Maintaining and automating data workloads 优化、容量、自动化和故障恢复 约 18%

五个领域怎么学

设计数据处理系统

从安全、合规、数据驻留、治理、可靠性和迁移目标推导架构。把业务需求转成数据源、数据消费者、处理时效和恢复目标,再规划迁移验证。

摄取与处理

比较 Pub/Sub、Dataflow/Apache Beam、Dataproc/Spark、BigQuery 和 Cloud Data Fusion。区分批处理与流处理,并理解窗口、迟到数据、转换、清洗和编排。

存储与分析

按访问模式选择 BigQuery、BigLake、Cloud Storage、Spanner、Bigtable、Cloud SQL 或 Firestore。复习仓库建模、湖的数据治理、分区/聚簇、查询性能、BI Engine,以及为特征工程或 RAG 准备数据。

运维与自动化

掌握 Cloud Composer、Workflows、CI/CD、BigQuery 容量与预留、监控、配额、故障恢复和费用控制。建立能重复运行、可观测且能处理失败的数据工作流。

容易混淆: Dataflow 面向托管式流/批处理,Dataproc 适合 Spark/Hadoop 生态;Pub/Sub 负责消息传递,不负责完整的数据转换。先识别处理模型和运维要求,再选工具。

备考顺序与自查

按“架构—管道—存储—分析—运营”顺序学习。针对每种场景记录数据规模、延迟、格式、访问模式、治理要求、恢复目标和预算,并亲手搭建至少一个批处理和一个流处理流程。

  • 能按时效和数据特征选择批处理或流处理架构。
  • 能说明 Dataflow、Dataproc、Pub/Sub 与 BigQuery 的职责。
  • 能按访问模式选择存储并解释成本和性能取舍。
  • 能设计治理、监控、调度、重试和恢复机制。

继续练习

通过数据场景题练习从数据源和时效要求推导管道、存储与分析方案。开始 GCP-PDE 练习。

微信小程序

IT知习小程序码

微信搜索:IT知习