Google Cloud Professional Data Engineer(PDE)备考指南:数据管道与分析
GCP-PDE 备考指南:梳理数据系统设计、数据摄取处理、存储、分析准备及工作负载运维五个领域。
Professional Data Engineer(PDE)考查如何设计、构建和运营数据平台,让数据能安全、可靠地支持分析和业务决策。题目会让你在批处理与流处理、存储产品、治理、性能和成本之间作选择。
GCP-PDE 是本站简称,官方认证名称为 Professional Data Engineer。本文依据官方认证页和现行考试指南整理;请在考试前核对指南版本。
考试领域与权重
| 官方领域 | 主要内容 | 权重 |
|---|---|---|
| Designing data processing systems | 安全、可靠、迁移与架构设计 | 约 22% |
| Ingesting and processing the data | 批流数据管道、转换、编排 | 约 25% |
| Storing the data | 存储选型、数据仓库/湖和数据平台 | 约 20% |
| Preparing and using data for analysis | BI、AI/ML 数据准备与数据共享 | 约 15% |
| Maintaining and automating data workloads | 优化、容量、自动化和故障恢复 | 约 18% |
五个领域怎么学
设计数据处理系统
从安全、合规、数据驻留、治理、可靠性和迁移目标推导架构。把业务需求转成数据源、数据消费者、处理时效和恢复目标,再规划迁移验证。
摄取与处理
比较 Pub/Sub、Dataflow/Apache Beam、Dataproc/Spark、BigQuery 和 Cloud Data Fusion。区分批处理与流处理,并理解窗口、迟到数据、转换、清洗和编排。
存储与分析
按访问模式选择 BigQuery、BigLake、Cloud Storage、Spanner、Bigtable、Cloud SQL 或 Firestore。复习仓库建模、湖的数据治理、分区/聚簇、查询性能、BI Engine,以及为特征工程或 RAG 准备数据。
运维与自动化
掌握 Cloud Composer、Workflows、CI/CD、BigQuery 容量与预留、监控、配额、故障恢复和费用控制。建立能重复运行、可观测且能处理失败的数据工作流。
容易混淆: Dataflow 面向托管式流/批处理,Dataproc 适合 Spark/Hadoop 生态;Pub/Sub 负责消息传递,不负责完整的数据转换。先识别处理模型和运维要求,再选工具。
备考顺序与自查
按“架构—管道—存储—分析—运营”顺序学习。针对每种场景记录数据规模、延迟、格式、访问模式、治理要求、恢复目标和预算,并亲手搭建至少一个批处理和一个流处理流程。
- 能按时效和数据特征选择批处理或流处理架构。
- 能说明 Dataflow、Dataproc、Pub/Sub 与 BigQuery 的职责。
- 能按访问模式选择存储并解释成本和性能取舍。
- 能设计治理、监控、调度、重试和恢复机制。
继续练习
通过数据场景题练习从数据源和时效要求推导管道、存储与分析方案。开始 GCP-PDE 练习。