DE 面试考什么 • DE • SQL • Pipeline Design • Data Modeling • 2026

DE 面试考什么 2026:SQL、Pipeline、Data Modeling 全轮次拆解

回答「DE 面试考什么 2026」:SQL、Pipeline Design、Data Modeling 与 DE Coding 的题型方向与核心方法,常见挂点与 7/14/30 天准备路线,适合 Data Engineer、Analytics Engineer 等数据岗位候选人。

💡 核心要点 (Key Takeaways)

  • DE 面试主轴是 SQL(业务口径)+ DE Coding + Pipeline / Data Modeling Design + Behavioral / 项目深挖四块,部分公司加 take-home;四块是同一条生产数据链路,不是四个孤立知识模块。
  • SQL 考的是口径不是语法:留存、漏斗、归因、late event 和重复事件是高频追问点,先讲口径再写查询,讲不出表怎么来、怎么增量基本等于没做过生产数据。
  • Pipeline Design 考的是失败路径:迟到数据、回填、schema 变更、成本要主动交代,只报「Airflow + Spark + warehouse」工具名不够。
  • 不要漏掉 Coding 轮:Databricks / Snowflake 的 coding 轮是标准算法,部分公司第一面也是 coding,先确认目标公司题型簇再决定刷题时间分配。
  • 7 / 14 / 30 天三档路线:7 天保 SQL 口径 + pipeline 失败路径下限,14 天补回填专项与标准算法,30 天加目标公司雷达和真人 mock。

免费获取轮次诊断正在备战 Data Engineer (DE) 面试?免费获取轮次诊断:发你的当前轮次与倒计时,我们先定位卡点,再决定下一步。

这篇适合谁:先回答「DE 面试考什么」

这篇写给准备 2026 年北美科技公司 Data Engineer(DE)面试的候选人,覆盖 Analytics Engineer、Data Platform、Data Infra 等方向,级别以 3-5 年经验的中级为主(大致对应 L4 / L5),NG / Intern 的结构差异会在流程部分说明。文章基于 2026 年公开面经信号和站内已有 DE 专题整理,不同公司、团队、级别的轮次结构会有出入,以实际收到的面试邀请为准。

先给「DE 面试考什么」一个直接答案:主轴是 SQL(数据提取 + 业务口径)、Data Engineering Coding(事件流处理、窗口聚合、带 DE 味的算法题)、Pipeline / Data Platform System Design(含 Data Modeling)三块技术方向,外加 Behavioral 和项目深挖;部分公司会加一轮 1-2 周的 take-home,配比因公司和 team 而异。DE 面试和 SWE / DS 最大的区别在于「追问链」——一道 SQL 题会追到表从哪来、late event 怎么处理、历史怎么回填;一道 pipeline 题会追到失败路径、回填幂等和成本。准备的关键不是把四块当孤立知识模块刷,而是把它们当成同一条生产数据链路来练。

读完这篇你会带走:全流程轮次地图、6 个高频题型方向的可执行方法、4 个代表题型的答题骨架、中国 / 海外候选人各自的常见挂点,以及 7 / 14 / 30 天准备路线。DE 岗位的整体备战路线和题型雷达,可以配合 DE 岗位指南 一起看。

整体框架:2026 年 DE 面试的全轮次结构

DE 的主线流程一般是:简历筛选 → Recruiter Screen → OA(部分公司)→ Phone / Technical Screen → Onsite loop → HM / Team Match → offer。轮次结构因公司、团队、级别而异,以下是 2026 年公开信号归纳出的「典型区间」,不是对某一家公司的精确描述。

  • Recruiter Screen / OA:30-45 分钟电话沟通。OA 部分公司必考(NG 和 Intern 基本都有,社招多数情况可跳过直接进 Phone)。DE 的 OA 常见 1-2 道 SQL 题加 1 道 medium coding 题,限时作答,读题要完整——题面经常带业务背景,边读边写容易漏口径条件。
  • Phone / Technical Screen:约 30-45 分钟,通常 1 道 SQL 题 + 1 道偏基础的 Coding 题(部分公司第一面就是纯 coding,DE 和 SWE 一样考),外加背景与动机沟通。考的是你能不能在无提示下把口径讲清、把代码写对,很多候选人死在这轮「小题大做」或口径漏讲。
  • Onsite loop:通常 4-5 轮、45-60 分钟一轮,常见组合是 1-2 轮 SQL + 1-2 轮 DE Coding + 1 轮 Pipeline / Data Modeling Design + 1 轮 Behavioral 或项目深挖;部分 team 会把技术方向混进每轮(一轮里 SQL + coding + 一串 pipeline 追问)。可以一天面完,也可以拆两天。
  • 公司差异明显Google / Meta / LinkedIn / Amazon / Microsoft 的组合接近上述典型结构,SQL 占比高(GoogleSQL 约占题库一半);Databricks 是两轮标准算法的 CoderPad coding + 数据建模 / API design + HM,多位候选人明确指出 design 轮不要求分布式 scale;Snowflake 的算法强度明显高于一般 DE 岗位;Netflix 最常加 1-2 周 take-home;PayPal / Uber 偏事件、fraud 和业务对象。
  • HM / Team MatchOnsite 通过后不再考技术,重点是确认方向、level、location 和双向预期;部分公司(如 Meta)的 HM 也是价值观故事面试,DE 的证据要偏数据——跨团队口径对齐、数据质量修复、事故复盘、成本与 SLA 改进。
  • 时间线:从投递到 offer 典型区间 4-10 周,NG 高峰期偏慢;每轮反馈典型 3-10 个工作日,超过 2 周没消息可以主动问 recruiter。
  • 2026 年的变化:越来越多公司在 SQL 轮明示是否允许 AI 工具辅助,评分重心从「能不能写出来」转向「能不能讲清口径、能不能 review 代码和结果」;take-home 岗位考的是「能不能像真工程师一样交付」——README、假设清单、测试、backfill 与质量方案都会被评分,不是只交能跑的代码。

高频题型与核心方法:6 个方向,每个都有可执行动作

以下按出现频率展开 2026 年公开信号里反复出现的 6 个方向。每个方向给一个可执行动作,不空谈。

  • SQL 业务口径题(最高频,多数公司占 1-2 轮):不考语法点,考业务口径——留存(cohort、day 1 / day 7、event time、时区)、漏斗(步骤顺序、同一用户多次触发、session 定义)、归因(attribution window、last / first touch、late event)、实验(bucket 表、曝光口径、跨组污染)。可执行动作:按留存 / 漏斗 / 归因 / 实验四个场景各做 1-2 道 SQL 题,每道先口头讲表结构、去重逻辑、时间窗口和脏数据处理,再写查询。深入方法见站内 SQL、ETL 和 Pipeline Design 准备顺序
  • Data Modeling(Design 轮高频):fact / dimension、star schema、SCD、主键、分区、clustering、增量更新和 metrics layer。核心是「从使用场景出发,不是从画表出发」:先明确业务实体和查询模式,再决定分层(raw / staging / mart),再讨论建模风格(维度建模 vs 规范化)和分区生命周期。可执行动作:给「为什么不建大宽表」「上游迟到 / 缺失怎么办」「怎么验证数据质量」「这个 pipeline 在延迟谱系里位于哪」四个追问各准备一句标准答案,mock 时练到 60 秒内答完。展开见 DE SQL / Data Modeling 面试
  • Pipeline / Data Platform System Design(社招必考):一个稳的回答覆盖 source → ingestion → raw → staging → mart → quality → serving → observability 八层,并主动交代失败路径:迟到数据(watermark、重算窗口)、回填(分区、幂等 merge、资源隔离、下游通知)、schema 演进(契约和监控)、成本(计算、存储、查询)。可执行动作:做一轮「失败演练」——挑一张你真正处理过的表,模拟迟到数据、schema 变更、重复事件三种失败,每种 10 分钟写出「怎么发现、怎么处理、怎么通知」。
  • DE Coding(1-2 轮,最容易被低估):不是 LeetCode 式纯算法,而是带数据味的题——事件流去重、sliding window 聚合、sessionization、top k、DAG 遍历、回填任务调度;但 Databricks / Snowflake 的 coding 轮是标准算法(2D BFS、Dijkstra、前缀和 + 二分、二分答案 + 贪心),难度不能低估。可执行动作:做 2 道事件流题 + 1 道 sliding window 聚合题,每道必须能讲清 event time vs processing time、去重键、复杂度和取舍;目标公司属于算法密集型的话,再加 3-5 道 medium 标准算法。
  • 回填与数据质量(Design 轮高频追问):口径变更之后历史怎么回填、怎么保证幂等、质量检查做哪四个(行数波动、主键唯一、空值率、分布漂移)、下游怎么通知(SLA、公告、lineage)。可执行动作:基于一次真实回填经历写一页「回填 SOP」——分区范围、资源隔离、校验方式、下游通知、回滚方案,用它回答所有回填类追问。
  • 项目深挖 / Behavioral(穿插或单独 1 轮):DE 的证据要偏 owner 视角——原来链路有什么痛点、你决定了什么、拒绝了什么、数据质量 / SLA / 成本怎么改进的、下游团队因此受益了什么。可执行动作:准备 2 个项目各一页纸(范围、角色、质量机制、SLA 和监控、事故复盘、业务影响),外加 5-6 个 STAR 故事(一次口径冲突、一次生产事故、一次主动补位),每个能接两层追问。

💡 如果目标就是 Data Engineer (DE) 岗,按岗位整理的题型分布、轮次路线与准备清单在这里。

Data Engineer (DE) 面试辅助 →

代表题型:4 个高频骨架(只归纳题型,不复刻原题)

以下是公开信号里反复出现的题型和答题骨架,只归纳题型方向,不复刻任何候选人的私人原题。

  • 类型一:多步留存 / cohort 计算(SQL:「算上个月各渠道新用户的 day 1 / day 7 留存」。骨架:先定义新用户(首次事件时间)和留存(第 N 天有活跃事件)→ 建 cohort 表 → 处理时区和迟到事件 → 按渠道 × cohort 周输出留存率。常见 follow-up:换口径(活跃 = 打开 vs 活跃 = 下单)、重复事件如何去重、机器人账号是否过滤。
  • 类型二:事件流 sliding window 聚合(DE Coding):「给一条事件流(user_id, event_time),输出每个窗口内的活跃用户数 / 订单金额」。骨架:先澄清窗口语义(tumbling 还是 sliding、event time 还是 processing time)→ 选结构(排序 + 双指针 / 堆 / hash map)→ 处理乱序和重复事件(去重键、迟到阈值)→ 讲复杂度与取舍(内存 vs 重算)。常见 follow-up:数据量涨 10 倍、窗口从 1 小时缩到 1 分钟、增量输出怎么做。
  • 类型三:端到端 Pipeline Design:「从 raw clickstream 搭 T+1 报表 + 实时监控」。骨架:source 与量级估算 → ingestion(batch / stream 选择,raw 层保留原始 payload)→ staging(类型转换、去重、时区)→ mart(业务口径、指标版本和 owner)→ 质量检查与报警 → serving(dashboard / API,展示数据截至时间)→ 回填与变更公告 → 成本。关键:主动交代两条失败路径(上游延迟、schema 变更),别等面试官问。
  • 类型四:Pipeline 资源优化题(算法密集型公司):「预算有限,给 pipeline 各阶段分配算力,使整条链路的最小吞吐量最大」。骨架:识别为瓶颈最优化问题 → 二分答案(猜一个最小吞吐量,贪心验证可行性)→ 讲复杂度(O(n log max))和边界条件(单阶段独占、预算不足)。这类「算法 + 数据场景」题是 Databricks / Snowflake 信号里的高频真题,考的是算法能力和数据语境的结合。

常见挂点:中国 / 海外候选人最容易失分的地方

把公开面经里的挂因信号和模拟面试复盘对照,DE 的失分点集中在以下几处,中国 / 海外候选人各有各的坑:

  • SQL 写对但讲不清口径:查询能写出来,但「重复事件怎么办」「时间窗口怎么定」「时区按哪个算」答不上,面试官会判断你没处理过真实数据。对策:每次练习先强制口头讲 1 分钟口径再动笔。
  • 只报工具名,没有 owner 视角:「Airflow + Spark + Snowflake」是项目的全部内容,被问「昨天移动端事件晚到 6 小时,重算哪个分区」就发散。工具只是背景,工程判断才是核心。
  • 失败路径答不出:只讲 happy path,late arrival、重复事件、schema 变更、回填冲突一追问就断片。规模、幂等、回填、下游通知这四样要主动交代,别等问。
  • Coding 轮没准备:以为「DE 只考 SQL」不刷算法,结果 Databricks / Snowflake 的 coding 轮是标准算法,或第一面也是 coding 时直接卡壳。准备前先确认目标公司属于哪个题型簇(算法密集 / 建模密集 / 事件实验),再决定时间分配。
  • 中国候选人常见:不主动给假设:面试官期望你主动声明假设和取舍(数据缺失怎么办、口径选哪个、分区键怎么选),国内候选人习惯等被问到再说。对策:每题开场主动说出 2-3 个关键假设。
  • 海外候选人常见:口径概念不对齐:不同公司、不同地区对曝光、归因窗口、cohort、business day 的定义差异不小,直接用前司口径回答容易被判「没有 sense」。对策:回答前先用一句话确认「这道题里 X 的定义是……对吗?」
  • 节奏与表达:45 分钟一轮,前 10 分钟读题澄清占掉 8 分钟,后面必然赶工。DE 面试看重「边想边说」——为什么这么拆层、为什么选这个分区键、为什么这个检查能抓住这类错误,闷头写不说话是减分的。

准备路线:7 天 / 14 天 / 30 天

按距 Onsite 的天数选路线。三档共同原则:SQL 口径和 pipeline 失败路径永远优先,DE Coding 次之(按目标公司调整),Behavioral 最后,最后两天只留 mock 和状态调整,不学新东西。

  • 7 天(保下限版):D1-D2 按留存 / 漏斗 / 归因 / 实验四个场景做 5 道 SQL 题,练「先讲口径再写」;D3 做 2 道数据建模题(SCD、「为什么不建大宽表」追问)+ 1 次失败演练(迟到 / schema 变更 / 重复事件);D4 做 2 道 DE coding 题(事件流去重、sliding window 聚合),每道讲清复杂度和取舍;D5 写 2 个项目深挖一页纸 + 5 个 STAR 故事,英文口述录音回听;D6 完整 mock 一场(SQL + pipeline design + 10 分钟 Behavioral,60 分钟),录音复盘;D7 列出 3 个扣分点各补一段,缓冲日。
  • 14 天(标准版):在 7 天基础上——D8-D9 补 2 道 pipeline design 标准层题(含成本和回填),每道练到 45 分钟讲完;D10 回填专项:基于真实回填写一页 SOP,补三个追问(怎么校验、怎么回滚、怎么通知下游);D11 把 D1-D2 的 SQL 题重做一遍,强制接住换口径、加维度的 follow-up;D12 目标公司属于算法密集型的话加 3 道 medium 标准算法;D13 完整 mock(含 1 个 15 分钟项目深挖);D14 缓冲日,检查设备日程,早睡。
  • 30 天(系统版):在 14 天基础上——D15-D18 目标公司雷达:每个目标公司查 2-3 篇最近的面经信号,确认它的轮次组合和题型簇(算法密集 / 建模密集 / 事件实验),按高频方向各补 1 道;D19-D22 弱项专项:从最近两次 mock 的扣分点里选 3 个,每个补 2 道同类题;D23-D25 故事库扩到 6-8 个,练三层追问(approach → 细节 → reflection);D26-D28 连续两场完整 mock(尽量真人),重点看追问接没接住、表达节奏;D29 复盘两场 mock,把断片点各补一段;D30 缓冲日。
  • 只有 1 周且是社招:优先做目标公司雷达 + 1 场 mock——这个阶段「知道对方怎么出题」比泛刷更值。

FAQ:关于「DE 面试考什么」的 5 个高频问题

Q1:DE 面试考什么 2026?各占多少?
主轴是三块技术方向:SQL(业务口径)、DE Coding、Pipeline / Data Modeling Design,外加 Behavioral / 项目深挖。典型 Onsite 是 4-5 轮:1-2 轮 SQL、1-2 轮 Coding、1 轮 Design(pipeline 或建模)、1 轮 Behavioral;部分 team 把技术方向混进每轮。少数公司加 take-home。配比因公司和 team 而异,正文的「典型区间」供参考,以实际邀请为准。

Q2:DE 面试几轮?时间线多久?
简历 → Recruiter Screen → OA(部分)→ Phone(SQL + Coding)→ Onsite(4-5 轮)→ HM / Team Match → offer。从投递到 offer 典型 4-10 周,NG 高峰期偏慢;每轮反馈典型 3-10 个工作日。超过 2 周没消息可以主动问 recruiter。

Q3:DE 面试考算法 / coding 吗?
比 DS 考得多,比 SWE 少,但绝对不能漏。FAANG 的 DE coding 轮多为带数据味的 medium 题(事件流、窗口聚合、去重、top k);Databricks / Snowflake 的 coding 轮是标准算法(BFS、Dijkstra、DP、二分答案),难度明显高于一般 DE 岗位;部分公司第一面也是 coding。先查目标公司的题型簇再决定刷多少算法,不要按「DE = 只考 SQL」准备。

Q4:DE 面试考 SQL 考多深?
第一考点是口径不是语法:留存、漏斗、归因、rolling metric、sessionization、top k、递归、SCD 是高频题型,窗口函数、去重、方言(如 BigQuery)是硬门槛。真正考的是追问:这张表怎么生成、是否增量、主键是什么、late event 怎么处理、口径变更后怎么回填、怎么验证结果。「讲得出口径 + 讲得清表设计 + 讲得动增量计算」才算完整答案。

Q5:公开面经(一亩三分地等社区)有用吗?怎么读?
有用,读法决定价值:按「年份 + 级别 + 岗位」筛选,只看最近的 2-3 篇;找共识,两到三篇独立帖子提到同一轮次结构才可信;只提取「轮次结构 + 题型方向 + 挂点」,忽略剧情。本站内容只归纳公开信号,不复刻任何人的逐字面经,也不与任何面经社区存在合作或转载关系。

Editorial & Verification

📋 资料来源与审校说明

2026-09-06 更新:为「整体框架」「高频题型与核心方法」「代表题型」章节补充了 3 个可核验来源(Databricks 官方面试准备说明、PostgreSQL 官方文档与窗口函数教程),并核对了正文中的公司特例表述(如 Databricks / Snowflake 的 coding 轮为公开信号归纳),区分行业共性与公司特例。本篇是 2026 年 DE 面试「考什么」的全轮次总览,覆盖流程框架、6 个高频题型方向与核心方法、4 个代表题型、常见挂点、7/14/30 天准备路线与 FAQ。

  • Databricks 官方面试准备说明:Databricks 官方面试流程说明(含 coding 与数据建模 / API design 轮)。正文「整体框架:2026 年 DE 面试的全轮次结构」与「高频题型与核心方法」章节以它作为 DE 岗位官方面试流程样本;正文中 Databricks 的轮次描述(CoderPad coding + 数据建模)以该页面为准。
  • PostgreSQL 官方文档:PostgreSQL 官方文档(SQL 语法、数据类型与查询语义)。正文「高频题型与核心方法:6 个方向」(SQL 业务口径题)章节以它作为 SQL 语法与语义口径的参照。
  • PostgreSQL 官方文档:窗口函数教程:PostgreSQL 官方窗口函数教程(row_number / rank / dense_rank、lag / lead 等)。正文「代表题型:4 个高频骨架」(留存 / cohort、事件流 sliding window)章节以它作为窗口函数语义与用法的参照。
  • DE 面试:SQL、ETL 和 Pipeline Design 准备顺序:站内已有文章,本篇正文引用其 SQL 口径与 pipeline 追问结论,不重复展开。
  • DE SQL / Data Modeling 面试:窗口函数、增量表和指标层:站内已有文章,本篇正文引用其数据建模、metrics layer 与高频追问答法,不重复展开。
DW
Data Engineering
David Wang·前 Netflix / Databricks Staff DE

8 年+数据工程经验,曾在 Netflix 数据平台团队和 Databricks 担任 Staff DE,主导过日处理 TB 级数据的基础设施项目,擅长把抽象的 DE 面试题拆解为 pipeline 设计、容量估算、容错策略等可训练动作。

累计辅导 500+ 数据工程候选人Stanford, CS 硕士
本文由 David Wang 审校与整理

📚 推荐延伸阅读 (Related Guides)

Netflix DE 面经 2026:Pipeline、Spark 和 Data Platform

Netflix DE 面经 2026:拆解 SQL(metric 口径、去重迟到事件)、数据工程 Coding 与 Pipeline / Data Platform SD 考点,附 take-home 交付要求和常见挂点。

PayPal DE 面经 2026:SQL、Pipeline 和 Fraud Data

PayPal DE 面经 2026:拆解 SQL(对账口径、金额精度)、数据工程 Coding 与 Pipeline / Fraud Data System Design 考点,附 VO 4 轮结构、常见挂点和 7/14/30 天准备路线。

Snowflake Data Modeling:Warehouse 和 Metrics Layer

Snowflake Data Modeling 深度准备指南,覆盖 raw/staging/mart、SCD、schema evolution、指标层、查询成本、权限和数据质量。

💼 完整服务与价格我们提供 OA 代写($199 起)VO 辅助($299 起)VO 代面($499 起)30 分钟免费咨询:按目标岗位、公司与轮次匹配具备相关经验的导师,覆盖 Coding、System Design、ML Design 与 BQ;具体导师与背景以接单前书面确认为准。

查看服务详情 →
已复制微信号!