Data Governance Engineer 面试准备指南:Data Quality、Lineage、Catalog、Observability 怎么讲
面向北美华人候选人的 Data Governance Engineer 面试准备指南:拆解 data governance、data quality policy、Alation、Monte Carlo、data catalog、lineage、ownership、data observability、privacy 和 production data platform 面试回答框架。
Data Governance Engineer 是一个越来越常见、但很多候选人不会准备的岗位。它不像传统 Data Engineer 只考 SQL、Spark、Airflow,也不像 Analytics Engineer 只看 dbt 和 metrics layer。Data Governance 更关心数据是否可信、可追踪、可管理、可审计,以及谁对数据负责。
能源、金融、医疗、保险、零售和大厂数据平台团队,都可能招聘 Data Governance Engineer、Data Quality Engineer、Data Platform Governance Engineer 或 Data Stewardship Engineer。面试题往往很实际:你怎么制定 data quality policy?你用过什么 catalog?如何做 lineage?如何发现上游 schema change?如何让业务团队真的遵守 governance?
这篇文章会系统拆解 Data Governance Engineer 面试该怎么准备。
这个岗位到底考什么
Data Governance Engineer 面试通常会覆盖:
- daily work / past project deep dive
- data catalog:Alation、Collibra、DataHub、Amundsen
- data quality policy
- data validation tools
- data observability:Monte Carlo、Great Expectations、自建 checks
- lineage:table、column、pipeline、dashboard lineage
- ownership:dataset owner、SLA、incident process
- privacy / compliance:PII、access control、retention
- stakeholder communication
它不是单纯工具问答。面试官想知道你能不能把“数据治理”从口号变成工程流程。
Data Quality Policy 怎么回答
如果面试官问:“How do you plan policy for data quality?” 不要只说 row count check。
一个完整回答可以分成 6 层:
- Define critical data elements:哪些表、字段、指标最关键。
- Define quality dimensions:freshness、completeness、validity、uniqueness、consistency、accuracy。
- Define ownership:谁是 dataset owner,谁响应 incident。
- Define checks:每个 critical table 应该有什么 automated checks。
- Define SLA:延迟、错误率、修复时间。
- Define escalation:报警、ticket、runbook、postmortem。
你可以举例:
“对于订单 fact table,我会检查每日 row count 是否异常、primary key 是否重复、order_status 是否在允许枚举里、event_time 是否晚于 ingestion_time、核心金额字段是否为负、上游延迟是否超过 SLA。”
这比泛泛说“我会保证数据准确”更有说服力。
Data Observability:Monte Carlo 之外要讲原理
有些面试官会问你是否用过 Monte Carlo、Datadog Data Observability、Great Expectations、Soda、dbt tests。即使你没正式用过,也可以讲清楚你理解的问题。
Data observability 关注的是:
- freshness:数据是否按时到
- volume:数据量是否异常
- schema:字段是否变化
- distribution:数值分布是否漂移
- lineage:上游变化影响哪些下游
- incidents:如何发现、通知、修复、复盘
如果没有用过商业工具,可以讲自建方案:
- Airflow task 完成后记录 row count
- 对关键字段做 null rate / unique count / min-max check
- 用历史窗口检测异常波动
- schema snapshot 做 diff
- 写入 data quality result table
- 报警到 Slack / PagerDuty
- 生成 dashboard 给 owner 看
关键是你要说明 check 不是越多越好,而是要围绕业务风险。
Data Catalog:不只是文档库
Alation、Collibra、DataHub、Amundsen 这类工具常被问到。很多候选人只会说“用来查表”。这太浅。
Data catalog 在 governance 里的价值是:
- dataset discovery:业务方知道该用哪张表
- ownership:每张表有 owner
- glossary:指标定义统一
- lineage:知道上下游影响
- certification:标记 trusted dataset
- access workflow:申请权限和审批
- usage analytics:知道哪些表没人用或被大量使用
面试里可以说:
“我不会把 catalog 当成静态文档。它必须和 pipeline metadata、warehouse query logs、dbt models、BI dashboard、ownership system 连接起来。否则很快就会过期。”
这能体现你不是在背工具名。
Lineage:Table-level 不够,关键字段要 Column-level
Data lineage 常见追问:
- 如果上游字段改名,会影响哪些 dashboard?
- 如果某个 KPI 算错了,如何定位源头?
- 如果要删除 PII 字段,如何知道下游在哪里使用?
- 如果一个 pipeline 出错,如何判断 impact radius?
回答时区分:
- table-level lineage:表和表之间依赖
- column-level lineage:字段如何被转换和传递
- job-level lineage:Airflow / Spark / dbt task 的依赖
- dashboard lineage:指标和报表依赖哪些表
如果面试官问实现,你可以讲从 SQL parser、dbt manifest、warehouse query history、Airflow DAG metadata 和 BI metadata 中抽取 lineage,再存到 metadata graph。
Governance 和工程交付如何结合
很多公司 data governance 做不好,是因为它变成了文档和会议。好的 Data Governance Engineer 要能把规则嵌进开发流程。
可以主动提:
- data contract:producer 和 consumer 约定 schema、SLA、语义
- CI checks:PR 阶段检查 schema change 和 breaking change
- dbt tests / Great Expectations:pipeline 内置质量检查
- ownership required:没有 owner 的 dataset 不能标记 production
- certification workflow:trusted table 需要满足质量和文档要求
- incident process:质量报警后有明确 owner 和 runbook
这会让你的回答更像能落地的工程方案。
常见面试问题和回答方向
Tell me about your daily job
不要流水账。按 data lifecycle 讲:ingestion、transformation、quality check、catalog、lineage、stakeholder support、incident response。
What tools do you use to validate data quality?
可以讲 SQL checks、dbt tests、Great Expectations、Monte Carlo、Airflow sensors、自建 anomaly detection。重点说你如何选 check,不是列工具。
How do you deal with data governance?
从 policy、ownership、catalog、lineage、quality、access、incident 六个维度答。
How do you handle stakeholders?
举例说明你如何和 data producer、consumer、analytics、security、legal 或业务团队对齐定义和 SLA。
两周准备计划
第 1-3 天:补 data quality 基础
准备 freshness、completeness、validity、uniqueness、consistency、accuracy 的定义和例子。
第 4-6 天:补工具和实现
梳理 Alation / Collibra / DataHub、Monte Carlo、Great Expectations、dbt tests、Airflow metadata。
第 7-9 天:练案例
练订单表异常、IoT 数据延迟、PII 字段下线、dashboard 指标错误、schema drift。
第 10-14 天:项目 deep dive
准备一个治理项目,一个数据质量 incident,一个跨团队推动标准化的故事。
相关阅读
- Data Engineer SQL + Python 面试准备指南:补 DE technical screen
- Data Engineer 面试准备指南:完整 DE 准备路径
- Data Engineer SQL 高频题全解析:补 SQL 基础
- 数据质量监控系统设计案例:练 data quality system design
需要 Data Governance / DE 面试辅导?
Data Governance Engineer 面试最难的是把工具、流程和业务风险讲成一个完整系统。Interview Coach Pro 可以帮你准备 data quality policy、catalog / lineage、data observability、stakeholder communication 和 DE technical mock。
相关面试辅导
如果你正在准备类似面试,可以直接从下面的专项辅导开始。