Topic Guide

ML System Design 面试辅导:推荐、RAG 与 LLM Serving

ML System Design 面试辅导:覆盖传统推荐系统、LLM / RAG 与 LLM Serving 三类题型的分流与准备路线,讲清数据、特征、训练、评估、serving、监控与回滚,附 MLE 模拟面试复盘模板,适合 MLE、AI Engineer 候选人。

Topic Routing

题型分流:先判断你面的是哪一类题

ML System Design 的题目先分两大流派:传统推荐 / 排序系统,和 GenAI 系统(RAG、LLM Serving、Agent 后端)。两者的评分重点不同,准备路线应该分开走,不要混着背一套模板。

传统推荐 / 排序系统

这类题的信号

  • 推荐 feed、广告排序、搜索相关性、召回 + 排序链路
  • 高频追问:曝光偏差、延迟反馈、负样本、A/B 实验、冷启动

准备重点

  • 链路要讲全:retrieval → ranking → re-ranking,每一层说明目标函数和特征
  • 训练数据要处理曝光偏差、延迟反馈、负样本构造和重复推荐
  • 上线讲 A/B test 设计、guardrail 指标、online-offline skew 和 rollback
  • 评估要能讲清 offline metric(AUC / NDCG)和 online metric(CTR / 留存)的关系
GenAI 系统(RAG / LLM Serving / Agent)

这类题的信号

  • RAG 问答、LLM 推理服务、Agent 工具调用、embedding 检索
  • 高频追问:TTFT 延迟、token 成本、缓存、权限、安全过滤、eval

准备重点

  • 链路要讲全:query 理解 → retrieval → rerank → generation → logging,每层说清延迟和成本
  • serving 重点讲 batching、缓存、timeout、fallback 到小模型或规则,以及限流
  • 评估要讲 golden set、LLM-as-judge 的风险、human eval 和线上 guardrail
  • 安全要覆盖 prompt injection、权限控制(ACL)、内容过滤和数据隔离

Drills

这一类题型先练什么

先把训练动作具体化,再去看文章和公司攻略,否则容易停留在概念层。

训练 01

设计首页推荐系统

设计一个 food / content homepage recommendation system,目标是提升长期留存,同时不能牺牲点击质量和商家 / 创作者生态。

参考思路

  • 先定义目标和 guardrail:CTR、conversion、retention、hide / report、diversity、latency。
  • 链路分 retrieval、ranking、re-ranking,分别说明召回源、特征和排序目标。
  • 训练数据要处理曝光偏差、延迟反馈、负样本、冷启动和重复推荐。
  • 上线讲 A/B test、feature freshness、online-offline skew、bad case review 和 rollback。

面试官主要看:你是否把推荐当成线上系统,而不是只说 two-tower / ranker。

训练 02

线上效果下降排查

一个已上线排序模型 offline AUC 稳定,但线上转化率下降 5%。请给出排查路径和恢复方案。

参考思路

  • 先确认 metric 口径、实验分流、流量分布、版本发布时间和是否有外部因素。
  • 分层排查数据、特征、模型、serving、实验、产品 UI 和用户群体变化。
  • 重点查 online-offline skew、feature freshness、label delay、bad case 和 latency。
  • 恢复方案包括 rollback、降级到 baseline、缩小 ramp、修复特征后重跑验证。

面试官主要看:排查是否系统化,是否能区分模型问题、数据问题和线上系统问题。

训练 03

设计 LLM / Embedding Retrieval

设计一个语义搜索系统,用户输入自然语言 query,系统返回相关文档或商品,需要兼顾相关性、延迟、成本和安全过滤。

参考思路

  • 链路拆成 query understanding、embedding、ANN retrieval、rerank、filter、logging。
  • 索引需要处理增量更新、版本、召回质量、冷启动和向量漂移。
  • 评估要有 offline relevance、human eval、online CTR / success rate 和 guardrail。
  • serving 重点讲缓存、batching、fallback、timeout、权限和安全过滤。

面试官主要看:是否能把 LLM / embedding 讲成可上线、可评估、可回滚的系统。

Audience

适合谁

适合 MLE、Applied Scientist、AI Engineer 候选人,尤其是目标公司明确会考推荐或 LLM 系统的人。

Data PipelineFeatureTrainingEvaluationServingMonitoring

Deep Links

继续深入看这些内容

每个题型页都连接到可继续阅读的博客、可直接使用的资源模板、相关公司攻略和岗位路线。

Why It Matters

为什么这一类题型会影响面试评价

题型页的目标不是罗列概念,而是帮助候选人理解面试官在这一轮真正观察什么: 你是否能澄清问题、组织结构、处理边界、解释取舍,并在压力下保持可复盘的沟通节奏。

评价信号

面试官听到的是推理过程,不只是最终答案

每个模块都需要能讲清前置假设、选择依据、失败路径和复杂度,才能避免“会做但讲不稳”。

训练产出

每次练习都应该留下可复用的复盘材料

建议记录题型、卡点、错误原因、边界测试、follow-up 版本和下一次训练重点。

临场目标

把不确定题目变成有结构的推进过程

真正的冲刺价值,是让候选人遇到变体时仍能稳定澄清、拆解、实现和复盘。

Common Risks

常见失分风险

先识别风险,再决定训练顺序。

风险

只讲模型结构,不讲数据闭环和线上约束。

风险

offline metric 和 online metric 关系说不清。

风险

线上 skew、freshness、latency、rollback 缺少方案。

Training Plan

建议辅助训练路径

每条路径都可以按目标公司、岗位和面试日期继续细化。

01

把个人项目改写成端到端 ML 系统故事。

02

训练推荐、广告排序、LLM inference、batch service、embedding retrieval 等题型。

03

准备线上问题排查和实验失败复盘。

Mock Output

一次合格训练结束后应该拿到什么

如果训练后只知道"这题怎么做",说明复盘还不够。更好的结果是形成下一轮能直接使用的表达和检查清单。

答题流程

一套能重复执行的开场、澄清、推进和收尾顺序

风险清单

3-5 个最容易扣分的习惯,以及下一次如何避免

追问素材

可展开的项目证据、边界测试、trade-off 和失败复盘

FAQ

关于 ML System Design 面试辅导 的常见问题

常见问题

ML System Design 面试辅导和 SWE 的系统设计辅导有什么不同?

核心链路不同。SWE 系统设计看的是数据流、一致性和容量;ML System Design 在这之上还要看数据闭环:特征怎么产出、标签怎么回流、offline 和 online 指标怎么对齐、模型更新怎么灰度和回滚。训练时建议把项目改写成端到端 ML 系统故事,而不是只讲模型结构。

常见问题

MLE 模拟面试一般覆盖哪些内容?

常见组合是:一道 ML System Design(推荐 / RAG / LLM Serving 任选)加项目深挖。模拟 45-60 分钟后,复盘会覆盖数据链路完整性、评估方案、上线风险控制(skew、freshness、rollback)和追问应对。如果目标是 MLE 或 AI Engineer,建议先做 1 次完整 MLE 模拟定位短板,再做 1-2 次专项(推荐链路或 LLM serving)。

常见问题

推荐系统题和 RAG / LLM 题准备起来差异大吗?

差异很大,不要混着准备。推荐系统题的评分核心是链路完整性(retrieval / ranking / re-ranking)、数据偏差处理(曝光偏差、延迟反馈、负样本)和 A/B 实验设计;RAG / LLM 题的评分核心是延迟与成本(TTFT、token cost、缓存)、评估方法(golden set、LLM-as-judge 风险)和安全(prompt injection、ACL、内容过滤)。建议按目标公司的公开面经判断更可能考哪类,优先准备对应链路。

常见问题

怎么练习 ML System Design 面试辅导 题型?

先从 Data Pipeline、Feature、Training 入手,每个模块至少做 5-10 道题目,记录卡点和 follow-up 版本。再做 2-3 次模拟面试,确保表达流畅、逻辑清晰。

常见问题

面试官在这一轮最看重什么?

面试官关注的是你的推理过程、前置澄清、复杂度评估、边界测试和 follow-up 处理。不仅仅是最终答案,更是整个解题过程的沟通质量。

常见问题

这一类题型的常见失分点有哪些?

只讲模型结构,不讲数据闭环和线上约束。;offline metric 和 online metric 关系说不清。;线上 skew、freshness、latency、rollback 缺少方案。。建议每次训练后做复盘,记录扣分点和改进方向。

需要针对这一轮做 mock 或复盘?

添加微信 interview_coach_pro,发送目标公司、岗位、轮次和当前卡点。

返回题型库
已复制微信号!