Anthropic 面试 • Anthropic 面经 2026 • AI 公司面试 • MLE • LLM 系统 • System Design • 北美科技面试

Anthropic 机器学习工程师面试题汇总 | 147 道真实面经

Anthropic MLE 真实面经 147 题:Coding 29、Design 14、BQ 104,覆盖 55 分钟电面 5 选 1 题型、LLM Inference API 设计与 ML Take Home,附高频题清单。

Anthropic MLE 面试 147 道真题分布图 — Coding 29、Design 14、Behavioral 104,标注电面 5 选 1 与 4-5 小时 Take Home 两个关键环节
Anthropic MLE 面试 147 道真题分布图 — Coding 29、Design 14、Behavioral 104,标注电面 5 选 1 与 4-5 小时 Take Home 两个关键环节

💡 核心要点 (Key Takeaways)

  • 电面 55 分钟且可以 5 选 1:Coding / ML Programming / Coding & Design / 分布式 / Agents,官方建议选你最能 shine 的方向
  • Coding 在 CodeSignal 上进行,明确禁止 AI 工具,但允许查 Google 和 Stack Overflow
  • Design 高频是 LLM Inference API:请求 combine 成 batch 发 GPU(一个 GPU 同时只处理一个 batch),follow-up 会追 KV Cache、10MB+ 长 prompt、成本感知
  • 4-5 小时 ML Take Home:探索性研究 + 训练评估基础模型,之后 40 分钟 live review 含 10 分钟 presentation
  • Agents 方向考写 agent loop:给 starter code 只支持单次 tool call,要扩到多步推理 + 多 tool call,再优化回合数
  • Culture 硬门槛:AI Safety、坚持原则不做你认为错的事、humility(不喜欢 hero engineer)
  • 分两天的 VO 如果前几轮表现一般,最后一轮可能直接不给面——每一轮都要过线,不是平均分

免费获取轮次诊断正在备战 Anthropic MLE 面试?免费获取 Anthropic MLE 轮次诊断:发你的当前轮次与倒计时,我们先定位卡点,再决定下一步。

Anthropic 面试全攻略 →

一、Anthropic MLE 面试流程 — 电面可以 5 选 1

Anthropic 的 MLE 流程和 SWE 最大的区别在电面:官方邮件明确说「we'd love to offer you a choice between the following interviews (all conducted in Python)」,并且建议「pick an interview you might shine at」。真实出现过的 6 个选项是: 1. Coding problem-solving — 纯编程,「not quite Leetcode」,强调 execution 和 problem-solving velocity,用 Python 标准库解 multi-stage 问题 2. ML Programming — 约 40 分钟编程题 + 配套短 ML 问题,官方明说熟悉 sequence models 和 QKV attention 有帮助,鼓励会 einsum、能读数学公式 3. Coding & Design — 用 Python 写代码的 coding + design 混合练习,推荐 Google Colab;「we don't specifically test your LLM knowledge here. We'll give you all the context you need」 4. Coding / Distributed systems — 考 distributed systems 的效率思维:parallel computation、network efficiency、map-reduce 这类 pattern 5. Agents/Coding — 用 LLM 作为 building block 写代码、prompting 造 agent,要求概念上熟悉 Tool Use 和 Agents;open-book,提供 starter code,不需要背 API 语法 选型的策略:你的短板方向绝对不要选——电面挂了后面都免谈。ML 背景强但 system 弱,选 ML Programming;engineering 背景强,选 Coding & Design 或 Distributed;对 agent 开发有真实项目经验,选 Agents(open-book 对熟手是优势)。技术轮「都是原题,很多帖子也都提到了」,所以选题后按该方向把经典题吃透。 Onsite 阶段,infra 方向的 design 是 55 分钟独立一轮。EM 岗位(General EM)则没有传统 design,是 design review,轮次结构是 Execution and Leadership、Technical Presentation、People、Design Review、Culture Fit。 流程节奏上有两个信号值得注意:一位候选人 12 月海投后很快被 recruiter 联系并直接安排电面(同时收到 OA 但没做);另一位 1 月中旬电面、三天后拿到 VO。另一个更重要的信号:有候选人反馈 HM 轮是中间隔一天单独面的,「听说这种分两天的前几轮面的不好最后一轮直接不给面」——Anthropic 的轮次是门槛制,不是平均分制,任何一轮掉线都可能直接终止流程。

  • 电面 55 分钟,5(-6)选 1,官方建议选最能 shine 的方向
  • ML Programming 考 QKV attention / sequence models / einsum
  • Agents 方向 open-book + starter code,不考背 API
  • EM 岗位:EL / Tech Presentation / People / Design Review / Culture Fit
  • 轮次是门槛制:分两天的 VO 前几轮不好,最后一轮可能直接取消

二、Coding 轮:高频题清单与环境规则

环境规则先说清楚,因为 Anthropic 的 coding 环境限制比一般公司多:平台默认 CodeSignal(Python 3.10),可能要求 Google Meet 共享屏幕——官方 prompt 专门提醒「很多人遇到浏览器权限问题,建议面试前先自己开一个 meet 测试屏幕共享」。AI 工具明确不允许,但 Google、Stack Overflow 允许。这条规则意味着:所有「背下来」的东西(标准库 API、常见 pattern)必须是真的会,不能靠工具补。 高频 coding 题(2026 年信号):

  • batchstring(list<string> input) → list<string> — GPU batch 处理字符串,follow-up 考 cpu bound vs io bound、怎么扩展到分布式
  • Dedup(去重)— 截至 2025.9 仍是 Q2 高频,follow-up 同上
  • Tokenize — longest match 分词,考两轮优化(最大词长剪枝、合并连续 UNK)
  • Web Crawler — crawl(startUrl, htmlParser),BFS 爬取(queue = deque([startUrl]))
  • Agent Loop — 用 tools 回答股票价格计算问题,starter code 只支持单次 tool call,要扩到多步推理 + 多次 tool call,第二部分优化回合数
  • ML 短问题 — 配合 ML Programming 方向:QKV attention 手推、einsum 表达、sequence model 结构

三、两道真题详解 — batchstring 与 Agent Loop

1. batchstring — 一道披着 batch 外衣的 GPU 调度题 输入一组字符串,要求 batch 处理返回结果。表面是字符串处理,真实考点在 GPU 行为模型:有候选人总结「GPU 和 CPU 的运行原理不太一样,比如 GPU 是 memory bound,大部分时间花在 load model into memory,所以处理 10 strings 和处理 100 strings 时间差不多」。面试中要能主动讲出这层:小 batch 的开销主要在 model load 和 kernel launch,所以 batching 的收益来自摊薄固定开销——这直接衔接 design 轮的 batching 设计。follow-up 链:cpu bound vs io bound 怎么判断?这个 batch 逻辑放到分布式系统怎么实现(分片、结果聚合、失败重试)? 2. Agent Loop — 从单次 tool call 到多步推理 题目让你写一个 claude agent loop,用 tools 回答关于股票价格计算的问题。提供的 starter code 只支持单次 tool call 就能回答的简单 query,你要写一个 agent loop 让 agent 处理需要多步推理或多次 tool call 的复杂问题。考察点:(a) 理解 LLM 输出里的 tool call 结构、执行结果怎么回填进对话;(b) loop 的终止条件(agent 不再请求工具、达到最大步数、错误处理);(c) 多步推理中 context 怎么管理。第二部分要求优化 agent 减少回答问题所需的回合数——这部分涉及 prompt engineering(比如让 agent 一次请求多个数据源)和结构优化。候选人建议:提前读 Claude 官方文档里 tool call 和 agent loop 的部分,虽然 open-book,但现场翻文档的时间是有限资源。

  • batchstring 的真实考点:GPU memory bound、model load 固定开销、batching 摊薄逻辑
  • follow-up 固定链:cpu/io bound 判断 → 分布式扩展
  • Agent Loop 三考点:tool call 回填、终止条件、context 管理
  • 优化回合数 = prompt engineering + 结构优化,提前读官方文档

四、Design 轮:LLM Inference API 是绝对主角

2026 年 Anthropic MLE/infra 的 design 信号高度集中在一条线上:LLM Inference 基础设施核心题:Design an LLM API。真实出现过的题目描述:「design LLM API,需要 combine API request 发给 backend GPU,一个 GPU 只能 process 一个 batch at a time」。这道题的完整考察链:请求接入 → 动态 batching(哪些请求可以合并成一个 batch)→ 调度到 GPU → 响应拆分回各请求。一个候选人复盘说「自我觉得啥都考虑到了,从 service 内部实现到不同 level 的 routing、load balancing、race condition,面试官面的时候都说好,完了给我拒了」——说明这道题的 bar 在于细节的严谨性(比如 batch 内请求长度差异对 padding 成本的影响、超时请求的抢占策略),而不是覆盖面。 固定 follow-up 三件套(多位候选人遇到): - 有哪些 core entities,之间的关系,怎么 index - 特别长的 prompt(10MB+)怎么处理 - 用户开了很多窗口、每个都是特别长的 prompt、client 本地性能不好,如何提升 UX 高频考点清单(从面经信号直接提取):Throughput vs Latency 的取舍、GPU 利用率、KV Cache(跨请求复用、显存预算)、Batching / Micro-batching、Prefill / Decode 分阶段动态 batch、请求拆分 + 合并、成本感知($/token)。 另一条线:Experiment Design。有候选人 onsite 考到「如何设计 controlled experiment 去理解怎么样训练 LLM」——这是 MLE 区别于 SWE 的题型,要能讲清楚实验假设、控制变量、评估指标和置信度,而不是只讲系统架构。 回答框架:clarify(QPS、延迟 SLA、模型规模)→ 请求生命周期(ingest → batch → schedule → GPU → response)→ batching 策略与 trade-off → KV Cache 与显存 → 失败与重试 → 成本与监控。最后 5 分钟主动讨论瓶颈和扩展路径。

  • 核心题:LLM API — combine requests 成 batch,GPU 一次一个 batch
  • bar 在细节严谨性:padding 成本、超时抢占、batch 内异构长度
  • 固定 follow-up:core entities/index、10MB+ 长 prompt、多窗口 UX
  • 考点:Throughput vs Latency、KV Cache、Micro-batching、Prefill/Decode、$/token
  • MLE 专属:Experiment Design(controlled experiment 理解 LLM 训练)

💡 Anthropic 的完整准备路线:OA / Phone / VO 各轮考什么、怎么练,公司攻略页整理成了清单。

Anthropic 面试全攻略 →

五、ML Take Home:4-5 小时 + 现场 Presentation

ML Take Home 是 Anthropic MLE 流程里最重的一环。官方 prompt 信息量很大,逐条拆: 时长与环境:官方 prompt 标题写的是「ML Take Home (~5 hours)」,正文则明确 4 小时工作时长——按 5 小时上限准备;用本地环境(Colab 或本地 IDE 都行),材料在工作期开始时发放。Open-book:可以查代码文档,但「please don't look up the whole problem, and ensure all work is your own」——整题搜答案直接出局。 内容:「mostly coding work, but pen and paper could be useful. The problem will involve doing some exploratory research, obtaining results and showing them numerically」。要求 comfortable training and evaluating basic models,pandas / numpy / matplotlib 要熟。AI Safety Fellow 的 in-home 更明确:「designing and running machine learning experiments on a small model using PyTorch and writing results and conclusions」。 交付:4 小时结束后紧接 40 分钟 live review:先 10 分钟 presentation 讲你的结果(slides 或 notebook 都行,「as long as your results are clear and presentable」),然后面试官 Q&A。SWE 侧的 Performance 岗位 take-home 是 2 小时 kernel 优化、允许 AI;MLE 侧明确没写允许 AI,默认按不允许准备。 准备要点:(1) 练 2-3 次「5 小时做完一个小实验 + 10 分钟讲清楚」的完整流程,presentation 结构和时间分配是独立技能;(2) 结果要 numerically 呈现——表格、曲线、before/after 数字,不要只有定性描述;(3) 明确写出 limitations 和 next steps,这本身就是评分点;(4) 时间盒:研究 60%、实验 30%、写作 10%,写不完实验就砍实验。

  • 工作时长 4 小时(prompt 标题 ~5 小时),本地环境或 Colab,材料开工时发放
  • Open-book 但禁止搜整题答案,所有工作必须是自己做的
  • 探索性研究 + 数值化结果 + 训练评估基础模型
  • 紧接 40 分钟 live review:10 分钟 presentation + Q&A
  • 时间盒:研究 60% / 实验 30% / 写作 10%

六、Behavioral 与 Culture — AI Safety + Humility

Anthropic 的 culture 考察在 MLE 侧的信号和 SWE 侧一致,但有 MLE 特有的侧重。 高频问题(真实出现过的问法): - 「Culture: AI Safety、坚持原则不做你认为错的事、conflict」 - 你认不认同 AI safety?从工程师和研究者的角度,实现 AI safety 的步骤? - 如果 Anthropic 做什么项目,因为不认同价值观,你会马上辞职吗? - HM 轮:Project Deep Dive、最困难的技术挑战、以及不少 collaboration 相关 BQ——「准备几个和 product collaborate 的故事」 候选人总结的文化关键词:强调 Humility,不喜欢「hero engineer」,非常看重对风险的敬畏。这和 ML 工作的性质有关——模型风险、部署决策的不可逆性——所以讲 project 时要体现「我知道这个系统哪里可能出问题,我做了哪些防护」,而不是「我做了一个很厉害的东西」。 HM 轮的 Project Deep Dive 是 MLE 候选人的主战场:准备 1-2 个能讲 20 分钟的项目,结构是 问题定义 → 你的技术方案和取舍 → 实验设计(怎么证明有效)→ 线上结果 → 失败和教训。最困难的技术挑战要有一个「当时卡住 → 怎么定位 → 怎么解决」的完整弧线。 流程信号:有候选人 EM 轮「感觉面的都不错已经是最大准备了,特别是 culture 例子都是非常 personal related,对方不断点头,不知道哪轮挂了」——感觉良好不等于过线Anthropic 的门槛在 signal 累计,单轮优秀不能补其他轮的弱。

  • AI Safety + 坚持原则 + conflict 是 culture 三件套
  • Humility:对风险的敬畏 > hero engineer 叙事
  • HM 轮备 2 个 product collaboration 故事
  • Project Deep Dive:问题 → 取舍 → 实验证明 → 结果 → 教训,20 分钟弧线
  • 单轮优秀不能补其他轮,signal 是累计制的

七、常见挂因复盘

2026 年 Anthropic MLE 候选人的失败案例集中在四类。 1. Design 覆盖面够但细节不严谨。「啥都考虑到了,routing、load balancing、race condition 都讲了,面试官都说好,完了给我拒」——LLM API 这类题的区分度在细节:batch 内请求长度差异怎么处理、KV cache 显存不够时淘汰什么、长 prompt 的 prefill 超时怎么办。覆盖广度是入场券,细节严谨性才是分数。 2. 电面选错方向。5 选 1 是机会也是陷阱:选了不熟的题型等于主动放弃。官方话术「pick an interview you might shine at」的意思是——这一轮决定你后面所有的轮次。 3. 门槛制流程里的单轮失手。分两天的 VO,前几轮「体验好」但 HM「uninterested」,最后一轮可能直接取消。每一轮都按「可能决定生死」来准备,不要有「这轮随便混混下轮再发力」的心态。 4. Take-home 只完成实验没完成叙事。5 小时做了一堆结果,但 presentation 没有清晰的主线(假设 → 实验 → 数字结论 → 局限),或者没留时间写 results,Q&A 被问住。presentation 是独立评分项,10 分钟要能独立站住。

  • Design 挂因:覆盖面够、细节不严谨(padding、KV 淘汰、长 prompt 超时)
  • 电面 5 选 1 选错方向 = 主动出局
  • 门槛制流程:任何一轮掉线可能直接终止
  • Take-home:presentation 是独立评分项,主线要清晰

八、4 周训练计划

按 MLE 流程权重排:电面选型方向 > design LLM infra > take-home > culture。 Week 1 — 锁定电面方向并吃透。先做 3 次自测(一道纯 coding、一道 ML programming、一道 agent loop),确定 5 选 1 里你的最强方向。然后该方向每天 1-2 题:ML 方向就手推 QKV attention、写 einsum、刷 sequence model 结构题;coding 方向就 Python 标准库 multi-stage 题。同时把 CodeSignal 环境、Google Meet 屏幕共享测试一遍。 Week 2 — LLM Inference Design 专项。每天 1 小时 design 练习,全部围绕 LLM API:动态 batching 策略(length-aware、continuous batching)、KV cache 管理与显存预算、prefill/decode 分离、throughput vs latency 取舍、$/token 成本建模。每次练习按「clarify → 请求生命周期 → batching → cache → 失败恢复 → 成本监控」六段展开,最后 5 分钟专门讲瓶颈。把「10MB+ prompt」「多窗口 UX」「core entities/index」三个 follow-up 的标准答案写出来。 Week 3 — Take-home 完整模拟。做 2 次完整的 5 小时 take-home(自己找小模型实验题,比如复现一个 fine-tuning 对比实验),严格执行时间盒,最后 10 分钟 presentation 录像回看。重点练:numerically 呈现结果(表格 + 曲线)、明确 limitations、被 Q&A 追问时不慌。 Week 4 — Culture 故事库 + Experiment Design + 模拟。写 3 个故事:AI safety 立场 + 具体行动、和 product 的 collaboration 冲突、最困难技术挑战的完整弧线。补 Experiment Design:用 30 分钟讲清楚「怎么设计实验判断 LLM 训练策略 A 是否优于 B」(假设、控制变量、指标、样本量、置信度)。最后 2 天全流程模拟。

  • Week 1:自测锁定 5 选 1 方向 + 环境测试
  • Week 2:LLM API design 六段框架 × 7 天
  • Week 3:2 次完整 5 小时 take-home 模拟 + 录像回看
  • Week 4:3 个 culture 故事 + Experiment Design + 全流程模拟

九、如果时间紧迫

如果距面试不足两周:电面方向只保最强的一路,design 只背六段框架 + 三个固定 follow-up 的标准答案,take-home 只做 1 次完整模拟(重点练 presentation),culture 故事压缩到 2 个。Anthropic 的流程末端周期不短,时间紧的时候把 signal 集中,不要同时铺开太多公司。 如果希望有人按 Anthropic 的真实题型帮你做一轮 LLM API design 追问(包括 batching 细节和 KV cache 压力问),可以预约 30 分钟免费咨询,我们会评估你当前距离各轮 bar 的差距,再决定投入哪个环节。 相关文章:
Anthropic 面试备考指南 · Anthropic 软件工程师面试题汇总 | 84 道真实面经 · MLE 面试全解析 · 面试辅助服务

  • 不足两周:保电面强项 + design 六段框架 + 1 次 take-home 模拟
  • Presentation 是 take-home 的独立评分项,不能省
  • 30 分钟免费咨询可评估 LLM API design 的真实差距
Editorial & Verification

📋 资料来源与审校说明

首次发布,提供 Anthropic MLE 面试流程、电面 5 选 1 题型详解、147 道真题清单、Design 高频考点与 Take Home 准备策略

  • 近期候选人面试经历:基于 2026 年候选人 Anthropic MLE / EM / infra 岗位面试经历整理
KZ
Machine Learning Engineering
Kevin Zhang·前 Google / Anthropic Senior MLE & Staff

9 年+机器学习工程经验,曾在 Google(Search / Ads)和 Anthropic(基础模型团队)担任 Senior MLE / Staff,参与过大语言模型训练项目,擅长帮候选人准备 ML 系统设计和 coding + ML 混合轮面试。

累计辅导 800+ 机器学习候选人CMU, CS 博士
本文由 Kevin Zhang 审校与整理

📚 推荐延伸阅读 (Related Guides)

Anthropic 软件工程师面试题汇总 | 84 道真实面经

Anthropic SWE 真实面经 84 题:Coding 28、Design 8、BQ 48,覆盖 take-home kernel 优化与 Safety 文化面,附高频题清单与 4 周计划。

ML Design 面试详解 2026:推荐、搜索、LLM 系统怎么设计

2026 ML Design 面试详解:按推荐、搜索、LLM 三大场景拆解答题框架、高频题方向、代表题型走查、常见挂点与 7/14/30 天准备路线,适合 MLE / Applied Scientist / AI Engineer 候选人。

OpenAI 软件工程师面试题汇总 | 30 道真实面经

基于 2026 年 OpenAI 软件工程师岗位真实面试信号整理的 30 道面试题合集:Coding 18 道、Design 12 道。覆盖 60/75 分钟三档 coding、GPU credit、IP iterator、Toy Language 类型系统、JS refactor 与 multi-tenant CI/CD、payment system、webhook 高频 design,附三道真题详解、挂因复盘与 4 周训练计划。

🏢 公司面试全攻略

公司攻略

Anthropic 面经与面试全攻略 2026

查看 Anthropic 的 OA / Phone / VO / 系统设计全流程准备路线 →

代面服务

Anthropic 代面(代面试)服务

Anthropic 代面(对口型)$499/轮 起,多轮连面有打包价。

💼 完整服务与价格我们提供 OA 代写($199 起)VO 辅助($299 起)VO 代面($499 起)30 分钟免费咨询:按目标岗位、公司与轮次匹配具备相关经验的导师,覆盖 Coding、System Design、ML Design 与 BQ;具体导师与背景以接单前书面确认为准。

查看服务详情 →
已复制微信号!