💡 核心要点 (Key Takeaways)
- ML Design 的答案 = System Design 骨架 + 三个额外必答项:标签从哪来、指标怎么定、线上收益怎么验证——只讲服务架构只算讲了一半。
- 2026 年三大场景家族:推荐(多阶段漏斗 + 反馈闭环)、搜索(query 理解 + 混合检索 + LTR)、LLM 系统(RAG / agent / serving 成本),骨架相同、展开重点不同。
- LLM 相关设计题从偶发变成高频,但经典推荐 / 排序仍是基本盘;准备顺序默认 推荐 > 搜索 > LLM,AI 团队把 RAG 与 LLM serving 提权。
- 最高频挂点:只讲模型不讲漏斗、LLM 题没有评估和 guardrail、全程没有数字(规模 / 延迟 / 成本)、只答 happy path。
- 7 / 14 / 30 天三档路线:7 天保推荐题 + 指标卡下限,14 天补 LLM 系统与失败路径,30 天 8 道题 + 追问专项 + 两场完整 mock。
免费获取轮次诊断正在备战 MLE 面试?免费获取轮次诊断:发你的当前轮次与倒计时,我们先定位卡点,再决定下一步。
这篇适合谁
这篇写给准备 ML Design(也叫 ML System Design)面试、但还没把「推荐、搜索、LLM 系统」这几类题拆开的候选人——MLE、Applied Scientist、AI Engineer,以及目标团队带 ML 属性(搜索、增长、数据平台、AI 应用)的 SWE / DS 候选人。和站内按公司拆的题库不同,这篇是场景级的「ML Design 面试详解」:不按公司拆,而是按场景拆——你面哪家公司、哪个 team,核心题面基本都落在这几类场景里。轮次结构基于 2026 年公开面经信号聚合和站内 MLE 专题整理,因公司、级别、地区会有出入,以你实际收到的邀请为准。
一句话定位:ML Design 考的不是「会不会训模型」,而是「能不能在 45-60 分钟里把一个 ML 系统设计成端到端可上线、可评估、可回滚的东西」。2026 年的变化是 LLM 相关场景(RAG、agent、LLM serving)从偶发变成高频,但经典推荐 / 搜索 / 排序题仍是基本盘。
读完你能带走六样东西:① ML Design 在 MLE 全流程里的位置和典型时间线;② 一套跨场景通用的答题骨架,以及三大场景各自的展开重点;③ 五个高频方向的「今天就能做」动作清单;④ 四个代表题型的走查骨架与追问落点;⑤ 六个最容易失分的挂点;⑥ 7 / 14 / 30 天三档准备路线。MLE 岗位的整体能力模型见 MLE 岗位解构,场景无关的答题骨架和追问方法见 ML System Design 专题。
整体框架:ML Design 在流程里的位置,和 45 分钟讲什么
先定位:2026 年 MLE 的典型全流程是 简历筛选 → Recruiter Screen → Phone Screen(多为 1 道 ML Coding 或基础算法题,约 45 分钟)→ Onsite(通常 4-5 轮,其中 1-2 轮 ML Design、1-2 轮 Project Deep Dive / ML Coding、1 轮 BQ,部分公司把 ML 理论并入其中)→ HM / Hiring Committee → Offer。从投递到 offer 的典型区间是 4-6 周,快的三周、慢的两个多月,用区间做预期。ML Design 通常出现在 onsite 的前中段,45-60 分钟一轮:面试官给一个场景让你现场设计,再按追问层层深入。它和 SWE 的 System Design 最大的区别是:除了服务架构,还必须回答三个 SWE 设计题很少问的问题——标签从哪来、指标怎么定、线上收益怎么验证。
答题骨架跨场景通用,按这个顺序推进:目标与约束 → 数据与标签 → 召回/检索 → 模型与训练 → Serving 架构 → 评估与实验 → 监控回滚与迭代。三大场景的差异不在骨架,而在「哪一段要展开」:
- 推荐 / 排序(基本盘,出现率最高):展开「召回 → 粗排 → 精排 → 重排」多阶段漏斗和反馈闭环,每一段给候选集规模和延迟预算。具体模型结构(双塔、深度排序这类)一句话带过,重点讲为什么这么分层。
- 搜索:展开「query understanding → 检索(倒排 + 向量混合)→ 排序(LTR + rerank)」,从『用户到底在找什么』开始,而不是从『用哪个向量库』开始。
- LLM 系统(2026 上升最快):展开三件事——模型在系统里扮演什么角色(分类 / 生成 / agent)、怎么评估(human eval + LLM-as-judge 的口径)、怎么 guardrail(幻觉、越权、成本)。RAG、agent、LLM serving 是三个高频子场景。
- 时间分配建议:5 分钟澄清目标与约束(规模、延迟预算、数据可得性)→ 10 分钟数据与标签 → 10 分钟核心链路(召回/检索/模型)→ 10 分钟 serving 与延迟 → 10 分钟评估与实验 → 留 5 分钟应对追问。时间不够时压缩模型结构细节,数据和监控两段不能省——通用切法见 ML System Design 专题。
高频题型与核心方法:五个方向,每个都有可执行动作
按 2026 年公开面经信号的出现频率排序,ML Design 轮的五类高频方向如下。每个方向给一个今天就能开始的动作:
- 推荐系统设计(最高频,基本盘):题面通常是『设计一个短视频 / 电商 / 内容推荐系统』。考点是能不能把系统讲成多阶段漏斗:candidate generation(万级到十万级候选)→ pre-ranking(缩到百级)→ ranking(精排十到五十级)→ re-ranking(多样性、新鲜度、业务规则)。反馈闭环(用户行为 → 训练样本 → 再训练)是区分『知道推荐』和『做过推荐』的分界线。动作:找一道短视频推荐题,按漏斗画四张卡片,每张写『候选集规模、延迟预算、模型类型、指标』,练到 20 分钟讲完主路径。
- 搜索系统设计:题面是『设计一个电商 / 代码 / 文档搜索』。考点是 query understanding(意图识别、纠错、同义词、实体)→ 检索(BM25 倒排 + 向量混合)→ 排序(learning-to-rank + LLM rerank)→ 长尾 query 和冷启动。动作:把『混合检索为什么比纯向量检索稳』讲成一页纸——BM25 管精确词命中、向量管语义泛化、rerank 管精排,各给一个它赢的例子和一个它输的例子。
- LLM 应用系统(2026 上升最快):三个子方向——RAG(文档解析、chunking、embedding、混合检索、rerank、引用与拒答)、agent(工具调用、记忆、多步规划的失败恢复)、LLM serving(continuous batching、KV cache、量化、成本与延迟的取舍)。动作:准备一个『LLM 设计题三问』标准答案模板:模型扮演什么角色、怎么评估(human eval + LLM-as-judge 的口径)、怎么 guardrail(幻觉率怎么测、越权怎么挡、超成本怎么降级到小模型)。
- 评估与实验设计(每道 design 题的暗线考点):面试官几乎必问『你怎么知道它变好了』。考点是 offline 指标(AUC、NDCG、hit rate 各适用什么场景)、online 指标(CTR、GMV、留存、时延)、A/B 实验设计(分流、样本量、guardrail 指标、分层分析)。动作:给推荐 / 搜索 / LLM 三大场景各写一张『指标卡』——1 个 primary + 2 个 guardrail + 1 个重点 slice,练到 30 秒内说出来。
- 数据与标签闭环(最容易被追问、也最容易被漏掉):标签延迟(用户行为要多久才回来)、选择偏差(训练样本来自旧策略的决策)、冷启动(新用户 / 新内容没有行为)、特征缺失与漂移。动作:每个场景固定准备 4 句话——标签口径与延迟、样本偏差与修法、冷启动策略(exploration / 规则兜底)、特征一致性校验,每句必须落到具体机制,不停在名词。
💡 如果目标就是 MLE 岗,按岗位整理的题型分布、轮次路线与准备清单在这里。
MLE 面试辅助 →代表题型:2026 信号里反复出现的 4 类
以下是 2026 年公开面经信号里反复出现的题『类型』,只归纳题型、走查骨架和考点,不复刻任何人的具体原题:
- 『设计一个短视频推荐系统』(推荐经典,出现率第一):走查骨架:澄清(DAU 量级、内容供给量、p99 延迟预算、优化目标是时长还是互动)→ 数据(曝光点击序列、负采样口径、内容多模态特征)→ 漏斗(召回双塔 / i2i,粗排轻量模型,精排深度模型,重排规则 + 多样性)→ 冷启动(新内容 exploration 流量、新用户兴趣引导)→ 评估(离线 NDCG / hit rate + 在线时长与留存)→ 监控(点击率漂移、内容供给质量、bad case 回流)。追问大概率落在:负样本怎么采、冷启动怎么平衡探索和利用、线上收益怎么验证。
- 『设计一个电商 / 代码搜索』(搜索经典):走查骨架:query 理解(意图、纠错、同义词、实体)→ 混合检索(倒排管精确、向量管泛化,两路结果如何合并)→ 排序(LTR 特征 + 交叉特征,LLM rerank 的延迟与成本怎么控)→ 无结果 / 少结果策略(query 改写、放宽条件、兜底推荐)→ 评估(NDCG、MRR、人工评测、按 query 分层看长尾)。追问大概率落在:混合检索怎么融合(RRF vs 加权分数)、长尾 query 覆盖差怎么办、LLM rerank 超延迟预算怎么办。
- 『设计一个 RAG 企业知识问答系统』(2026 LLM 经典):走查骨架:文档解析与权限(谁能查什么)→ chunking 策略(按语义切还是按结构切、chunk 大小与 overlap)→ embedding 与索引(增量更新、多语言)→ 混合检索 + rerank → prompt 与上下文预算(塞多少 chunk、引用怎么带)→ 幻觉控制(强制引用、拒答阈值、答案与证据一致性校验)→ 评估(faithfulness、answer relevance、human eval 抽样)→ 成本(每次查询调几次模型、缓存策略)。追问大概率落在:怎么衡量幻觉率、文档更新了索引怎么同步、成本超预算怎么降级(小模型兜底 / 缓存 / 减少 rerank 层数)。
- 『用 LLM 改进现有排序 / 做内容安全审核』(LLM 融入传统漏斗,新高频):题面通常是给一个已有的规则或小模型系统,问怎么引入 LLM 提升效果且成本可控。考点是 LLM 在漏斗里的位置判断(放召回层不现实、放精排或重排层更合理)、蒸馏路线(LLM 打标签 → 训小模型上线)、延迟与成本预算、效果评估(和 baseline 的 A/B 怎么设计)。追问大概率落在:LLM 推理成本比小模型高两个数量级怎么摊、蒸馏后效果损失怎么监控、线上 LLM 服务挂了怎么降级。
常见挂点:中国 / 海外候选人最易失分的 6 个地方
把公开挂因信号和模拟面试复盘对照,ML Design 轮的失分点集中在这 6 个:
- 只讲模型、不讲漏斗:推荐题上来就『双塔 + DIN』,被问『召回层给精排多少候选、延迟多少』就卡住。面试官听不到系统,只听到论文摘要。对策:先画漏斗再谈模型,每一段都带『规模 + 延迟预算』两个数字。
- 把搜索题答成推荐题:跳过 query understanding 直接『embedding + 向量库』,等于默认『用户输入的都是规范 query』。对策:搜索题的前 5 分钟必须花在『用户到底在找什么』上,query 侧的信号(改写、纠错、无结果率)是搜索题的区分度所在。
- LLM 题没有评估、没有 guardrail:RAG 流程讲得顺,但『怎么知道答案质量在变好』『模型胡说怎么办』答不出。2026 年这几乎是 LLM 题的必问点。对策:每个 LLM 设计都主动给出评估口径(faithfulness / relevance / human eval 抽样)和三条 guardrail(引用强制、拒答阈值、成本熔断)。
- 只答 happy path:冷启动、标签延迟、特征缺失、延迟超预算、上游数据断供——不主动交代就断片。对策:每个场景的走查里固定留 5 分钟讲失败路径,把『规模、缓存、降级、冷启动』四样当主动项,别等面试官问。
- 全程没有数字:规模(QPS、item 数、数据量)、延迟预算(p99 多少)、成本(每次查询花多少)全说『看情况』,面试官无法给你定位 level。对策:为三大场景各备一套『典型数字』(如推荐端到端 p99 100ms 内、精排候选 50 个、RAG 每次查询 2-3 次 LLM 调用),敢用数量级说话,并能解释数字怎么来的。
- 节奏失控:闷头设计或只问不做:两种典型——前 10 分钟全在澄清需求,后面赶工只讲了个开头;或者 3 分钟就开始讲、从不确认面试官想听哪段。中国候选人更常见的是前者,外加表达偏『论文汇报』而非『设计对话』。对策:澄清压缩到 5 分钟内(最多 3-4 个关键问题),讲的过程中每 10 分钟主动问一次『这段要不要展开』,把追问权交出去。
准备路线:7 天 / 14 天 / 30 天
按你距 onsite 的天数选路线。三个版本的共同原则:推荐基本盘和评估指标卡永远优先,搜索次之,LLM 系统按目标团队调整权重(AI 应用 / 基础模型团队把 LLM 提前),最后两天只留 mock 和状态调整,不学新东西。
- 7 天(保下限版):D1-D2 短视频推荐题按漏斗走查到 45 分钟能讲完(召回 → 粗排 → 精排 → 重排,每段带规模和延迟);D3-D4 搜索题 + RAG 题各练到 30 分钟主路径;D5-D6 写三大场景的指标卡(1 primary + 2 guardrail + 1 slice)+ 数据闭环 4 句话(标签 / 偏差 / 冷启动 / 特征),英文口述录音回听;D7 完整 mock 一场 ML Design(推荐或 LLM 任选),录音复盘。这个版本只保下限:漏斗讲得动、指标说得清、失败路径有交代。
- 14 天(标准版):在 7 天基础上——D8-D10 LLM 系统专项:agent 系统(工具调用 + 失败恢复)+ LLM serving 成本延迟题各一道,重点练『LLM 三问』模板;D11-D12 把 D1-D4 的三道题重做一遍,这次强制自己每道题最后 5 分钟只讲失败路径(冷启动、延迟超预算、成本、数据断供);D13 mock 一场完整 onsite 片段(ML Design + 10 分钟项目深挖);D14 缓冲日,检查设备日程,早睡。
- 30 天(系统版):在 14 天基础上——D15-D20 四大题型各做 2 道(推荐、搜索、LLM 应用、LLM 融入漏斗),每道产出一页复盘卡(指标 / 数据 / 延迟 / 监控 / 回滚);D21-D24 追问专项:每道题补 5 个高频追问(冷启动、标签延迟、延迟超预算、成本、线上收益验证),各给方案 + 取舍;D25-D26 项目深挖联动:把自己的项目改写成设计叙事(数据 → 标签 → 评估 → serving → 失败复盘),方法见 Google MLE 项目深挖专题——ML Design 和项目深挖经常是同一批面试官连着问;D27-D28 连续两场完整 mock,重点看追问接没接住、数字有没有、失败路径主不主动;D29 复盘两场 mock,断片点各补一段;D30 缓冲日。
FAQ:ML Design 面试详解的 5 个高频问题
Q1:ML Design 面试详解和 System Design 详解到底差在哪?
同一个系统,SWE 的 SD 轮问『架构怎么搭、延迟怎么扛』,ML Design 轮多问三件事:标签从哪来(定义、延迟、偏差)、指标怎么定(offline 和 online 各是什么)、线上收益怎么验证(A/B 设计、guardrail、slice 分析)。所以 ML Design 的答案 = SD 骨架 + 数据闭环 + 评估验证,缺后两段只算讲了一半。场景无关的骨架见 ML System Design 专题,本篇是场景级的展开。
Q2:推荐、搜索、LLM 三类场景,先准备哪个?
默认顺序:推荐 > 搜索 > LLM 系统 > 广告。推荐是基本盘,几乎所有 MLE / AI 团队面试都会出现;搜索看目标团队(电商、内容、开发者工具团队高频);LLM 看团队属性——目标团队是 AI 应用 / 基础模型方向,把 RAG 和 LLM serving 提到和推荐同优先级。准备深度标准统一:每个场景一道题能讲 45 分钟 + 接住 5 个追问。
Q3:LLM 相关 design 题是新出现的吗?要准备多少?
2026 年公开信号里,RAG、agent、LLM serving 类设计题在 AI 团队和 FAANG MLE 面试里已经是高频,不再是偶发;但经典推荐 / 排序仍是基本盘,不会退场。最低准备量:一道 RAG 题 + 一道 LLM 成本 / 延迟题 + 一套『LLM 三问』模板(角色、评估、guardrail)。时间紧的话,优先保推荐基本盘,LLM 题保主路径能讲完。
Q4:ML Design 要背数字吗?
要,但背的是『数量级』不是精确值。三类数字:规模(DAU / QPS / 候选集大小 / 数据量)、延迟预算(端到端 p99、每层预算)、成本(每次查询的 LLM 调用次数、推理成本)。面试里用数量级说话(『十万级候选进召回、缩到 50 个进精排』比『大概几千』可信得多),被追问时能解释数字怎么来的(业务目标 → 延迟预算 → 反推每层规模)。
Q5:我是 SWE / DS 候选人,需要准备 ML Design 吗?
看目标团队:搜索、增长、推荐、数据平台、AI 应用团队的 SWE / DS 岗位经常有 ML Design 或 data modeling 轮;纯 backend / infra 团队一般没有。判断方法:JD 里出现 recommendation、search ranking、LLM、ML pipeline 任一关键词,就按『会考』准备。一道推荐题的准备成本约 2-3 天,是性价比很高的保险。MLE 岗位的整体准备策略见 MLE 岗位解构。
📋 资料来源与审校说明
2026-09-06 更新:补充了 3 个可核验外部来源(Hugging Face 官方课程、Google 官方招聘流程说明、Amazon 官方面试指南),分别对应「代表题型」「整体框架」「常见挂点」章节;移除了无法提供链接的「公开面经信号聚合」条目;正文题型归纳均为行业共性,未把单一公司流程写成通用结论。 首版:明确本篇定位为「ML Design 面试详解」的场景级深度指南,覆盖推荐、搜索、LLM 三大高频场景的答题框架、代表题型、常见挂点与 7/14/30 天准备路线。
- Hugging Face 官方学习课程(Hugging Face Learn):Hugging Face 官方课程系列(LLM、RAG、agent 实践)。正文「代表题型:2026 信号里反复出现的 4 类」(RAG 企业知识问答、LLM 系统)与「常见挂点」(LLM 评估与 guardrail)章节以它作为 LLM 系统概念与评估方法的公开教育参照。
- Google 官方招聘流程说明(Our hiring process / How we hire):Google 官方招聘流程页面(onsite loop 通常 4 轮 45 分钟面试)。正文「整体框架:ML Design 在流程里的位置,和 45 分钟讲什么」章节以它作为「45 分钟一轮」时间盒口径的官方参照。
- Amazon 官方面试指南(About Amazon):Amazon 官方面试指南(loop 结构与 Leadership Principles 评估)。正文「常见挂点:中国 / 海外候选人最易失分的 6 个地方」(失败路径追问、只讲模型不讲漏斗)章节以它的 LP 式深挖与失败路径追问风格作为参照。
- MLE ML System Design 专题:站内场景无关的 ML System Design 答题骨架、45 分钟时间切法与追问方法,本篇引用其框架并按场景展开,不重复复述。
- Google MLE 项目深挖专题:站内项目深挖与 ML Coding 方法,本篇准备路线(30 天版 D25-D26)引用其项目叙事改写方法。
- MLE 岗位解构:站内 MLE 岗位策略,用于说明 ML Design 轮在 MLE 全流程中的位置与能力模型。
💼 完整服务与价格我们提供 OA 代写($199 起)、VO 辅助($299 起)、VO 代面($499 起) 与 30 分钟免费咨询:按目标岗位、公司与轮次匹配具备相关经验的导师,覆盖 Coding、System Design、ML Design 与 BQ;具体导师与背景以接单前书面确认为准。
