Data Engineer • SQL • Pipeline Design

DE 面试:SQL、ETL 和 Pipeline Design 准备顺序

DE 面试不只是 SQL。本文整理数据工程候选人准备 SQL、数据建模、调度、质量监控和回填问题的路线,含 pipeline 追问与 48 小时冲刺重点。

DE 面试:SQL、ETL 和 Pipeline Design 准备顺序 备考指南与高频考点分析
DE 面试:SQL、ETL 和 Pipeline Design 准备顺序 备考指南与高频考点分析

💡 核心要点 (Key Takeaways)

  • SQL 题要和业务口径一起练,不能只刷语法。
  • Pipeline design 的核心是稳定性、数据质量、回填和消费方契约。
  • 项目深挖要讲出成本、延迟、准确性和事故处理。

免费获取轮次诊断正在备战 Data Engineer (DE) 面试?免费获取轮次诊断:发你的当前轮次与倒计时,我们先定位卡点,再决定下一步。

先练 SQL,但不要只练 SQL

窗口函数、去重、留存、漏斗、归因、递归和 sessionization 是常见题型。但 DE 面试会继续追问数据来自哪里、是否 late arrival、如何保证幂等、怎么回填历史和如何发现数据质量问题。

Pipeline design 的高频追问

一个合格的回答需要覆盖 source、ingestion、storage、transform、orchestration、quality check、serving 和 observability。只说 Airflow + Spark + warehouse 不够,面试官会继续看你是否真正负责过生产链路。

  • 迟到数据:watermark、重算窗口、业务口径变化。
  • 数据质量:schema check、volume anomaly、null ratio、referential integrity。
  • 回填:分区、幂等、资源隔离、下游通知。
  • 消费方契约:指标定义、SLA、数据变更公告。

项目深挖的表达方式

把项目讲成一个具体问题的解决过程:原来的数据链路有什么痛点,你做了哪些设计,遇到哪些失败,最后用什么指标证明改进。工具名只是背景,工程判断才是核心。

SQL 题如何上升到业务口径

DE SQL 题最容易被低估。面试官不是只看你会不会 window function,而是看你是否会先定义事实表、维表、时间窗口、去重规则和指标口径。例如留存题里,注册日按用户时区还是 UTC,重复登录是否去重,机器人账号是否过滤,late event 是否回补,这些决定了 SQL 是否可信。

  • 先问口径:指标定义、时间窗口、唯一键、是否排除测试数据。
  • 再写查询:CTE 分层,先 dedup,再 join,再 aggregate。
  • 最后验证:行数变化、NULL 占比、重复率和 sample user trace。

💡 如果目标就是 Data Engineer (DE) 岗,按岗位整理的题型分布、轮次路线与准备清单在这里。

Data Engineer (DE) 面试辅助 →

Pipeline design 的评分点

一个成熟回答要覆盖正常路径和失败路径。正常路径包括数据如何进来、如何落 raw、如何清洗到 staging、如何建 mart、如何被消费;失败路径包括上游延迟、schema 变更、重复事件、回填冲突、质量报警和成本爆炸。越能把失败说清楚,越像真正 owner 过生产链路。

  • Raw 层保留原始 payload,方便回放和审计。
  • Staging 层处理类型转换、去重、时区和标准字段。
  • Mart 层暴露业务口径,并标记指标版本和 owner。
  • Observability 覆盖 freshness、volume、null、duplicate 和 lineage。

48 小时冲刺重点

临近面试时,不建议再扩展新工具。更有效的做法是准备 2 个 SQL 题、1 个 pipeline design、1 个项目深挖故事。每个题都要能讲“口径、方案、失败模式、验证方式”。如果你能把这四件事讲顺,Airflow、Spark、dbt、Snowflake 这些工具名自然会变成支撑,而不是答案本身。

失败演练:迟到数据、回填与 schema 变更

这三个话题在 pipeline design 里最容易被深挖,练法是做「失败演练」:挑一张你真正处理过的表(订单、事件、日志都行),依次模拟三种失败——迟到数据在窗口关闭后到达、上游 schema 变更、重复事件被上报。每种失败用 10 分钟写出三件事:怎么发现(哪个 check 或报警会触发、多久能发现)、怎么处理(重算哪个分区、写入是否幂等、要不要资源隔离)、怎么通知(哪些下游受影响、怎么公告、SLA 是什么)。写满三次之后,面试里的 pipeline 追问大多是这三种换了外衣,你答的是框架而不是新知识。写不出来就说明项目里没真正处理过这类失败,那就换成你处理过的最接近的场景,并如实说明差别,不要硬套没做过的流程。

规模与成本追问怎么答

面试官问「数据量涨 10 倍怎么办」时,不要直接跳去分片。可靠的回答是四步:第一问约束——量涨多少、SLA 变没变、预算是否固定;第二讲分区与存储策略——分区键怎么选、冷热数据怎么存、是否分层;第三讲计算——batch 和 streaming 怎么分、回填和例行任务怎么资源隔离、怎么避免回填挤占例行调度;第四讲成本——监控哪些成本(计算、存储、查询)、报警怎么设、超了怎么调。成本一步如果记不住具体数字,先答框架,再举一个自己项目里的真实成本场景,比空谈通用指标可信。答不出某一步时不要编,可以说「我的经验里主要做到前两步」,再补上推理。DE 面试里承认经验边界比编一个完整方案更可信,面试官追问的正是边界之外你怎么想。

Editorial & Verification

📋 资料来源与审校说明

本文由教研团队重新审校,完善了面试复盘动作与各环节重点说明。 近期教研更新:新增失败演练练法、规模成本追问答法两个 section。

  • 公开面经信号和岗位能力模型:用于归纳题型和常见追问,不复刻候选人私人信息。
  • Interview Support Pro 模拟面试复盘:用于总结候选人在表达、项目深挖和 follow-up 中的高频卡点。
DW
Data Engineering
David Wang·前 Netflix / Databricks Staff DE

8 年+数据工程经验,曾在 Netflix 数据平台团队和 Databricks 担任 Staff DE,主导过日处理 TB 级数据的基础设施项目,擅长把抽象的 DE 面试题拆解为 pipeline 设计、容量估算、容错策略等可训练动作。

累计辅导 500+ 数据工程候选人Stanford, CS 硕士
本文由 David Wang 审校与整理

📚 推荐延伸阅读 (Related Guides)

PayPal DE 面经 2026:SQL、Pipeline 和 Fraud Data

PayPal DE 面经 2026:拆解 SQL(对账口径、金额精度)、数据工程 Coding 与 Pipeline / Fraud Data System Design 考点,附 VO 4 轮结构、常见挂点和 7/14/30 天准备路线。

DE 面试考什么 2026:SQL、Pipeline、Data Modeling 全轮次拆解

回答「DE 面试考什么 2026」:SQL、Pipeline Design、Data Modeling 与 DE Coding 的题型方向与核心方法,常见挂点与 7/14/30 天准备路线,适合 Data Engineer、Analytics Engineer 等数据岗位候选人。

Google Data Engineer 面试题目合集 | 10+ 道真实面经

Google Data Engineer 面试攻略 2026:SQL 约占题库一半(窗口函数、BigQuery 方言是硬门槛)、Google 级 pipeline 系统设计与 Googleyness 轮,附 6 周训练计划。

💼 完整服务与价格我们提供 OA 代写($199 起)VO 辅助($299 起)VO 代面($499 起)30 分钟免费咨询:按目标岗位、公司与轮次匹配具备相关经验的导师,覆盖 Coding、System Design、ML Design 与 BQ;具体导师与背景以接单前书面确认为准。

查看服务详情 →
已复制微信号!