OpenAI 面经 • OpenAI AI Infra 面试 • AI Infra • SWE • LLM Serving • Batch Service • Eval • System Design • 2026

OpenAI AI Infra 面经 2026:LLM Serving、Batch Service、Eval

OpenAI AI Infra 面经 2026:拆解 LLM Serving(KV cache、continuous batching)、Batch Service 与 Eval 体系三大主轴,附高频题、挂点与 7/14/30 天路线。

OpenAI AI Infra 面经 2026 大模型推理集群与评测流水线指南
OpenAI AI Infra 面经 2026 大模型推理集群与评测流水线指南

💡 核心要点 (Key Takeaways)

  • OpenAI AI Infra 面试三主轴:LLM Serving(prefill / decode、KV cache、continuous batching、TTFT / TPOT、GPU 调度)+ Batch Service(job scheduler、任务队列、重试与幂等、成本账)+ Eval(golden set、LLM-as-judge、human eval、回归与 bad case 闭环);评分看你能不能量化讲清推理链路和 failure handling,不看模型训练深度。
  • System Design 高频落在 LLM serving 系统和 batch inference 服务:容量估算要算到 GPU 张数 / 队列深度 / 任务时长,failure handling(节点挂掉、队列积压、模型 OOM)是必答项,只罗列组件等于没设计。
  • ML Depth 轮是 AI Infra 和 SWE 的最大差异点:eval 体系搭建(golden set 怎么建、LLM-as-judge 的坑、bad case 闭环)和模型上线(canary、监控、rollback)要准备成固定叙事,只谈 accuracy 等于没准备。
  • 公开面经信号比泛 SWE 少、噪音更大——不少标着 AI Infra 的帖子实际是泛 SWE 或 MLE,先看题目内容(有没有 serving / batch / eval 内容)再读轮次,以 2-3 篇共识判断结构。
  • OpenAI 流程不标准化(CoderPad、re-interview、换组、HM 改期都常见),要主动推进流程,出结果通常 4-8 周;「为什么 OpenAI」要落到具体推理 / 产品 / 研究方向,HM 面前单独再练一轮。

免费获取轮次诊断正在备战 OpenAI SWE 面试?免费获取 OpenAI SWE 轮次诊断:发你的当前轮次与倒计时,我们先定位卡点,再决定下一步。

OpenAI 面试全攻略 →

这篇适合谁

这篇写给准备 OpenAI AI Infra(AI 基础设施 / 推理平台 / serving 工程)岗位面试的候选人,级别以社招中高级(大致对标 Google L4-L5 / Meta E4-E5,以 JD 和实际沟通为准)为主,覆盖 Recruiter Screen、OA(部分岗位)、Phone Screen、Onsite / VO 和 HM / Team Match 各轮结构。文章基于 2026 年公开面经信号整理,各团队、地区、级别的轮次结构会有出入,以实际收到的邀请为准。

一句话定位:OpenAI AI Infra = LLM Serving(推理链路:prefill / decode、KV cache、continuous batching、TTFT / 吞吐、GPU 调度)+ Batch Service(离线批量推理:job scheduler、任务队列、重试与幂等、成本账)+ Eval(offline eval、golden set、LLM-as-judge、回归与 bad case 闭环)+ AI Infra System Design + mission fit BQ。本篇的切入视角就是这三根最能区分 AI Infra 候选人的主轴——它们决定整场面试的下限。如果你同时投的是泛 SWE 岗位,高频题单和流程细节看 OpenAI SWE 面经 2026(Systems Coding + Debug 视角)和 OpenAI SWE 2026 面试全攻略;MLE 的完整题型看 OpenAI MLE 面试题目合集,公司级信号卡片见 OpenAI 公司页

  • 适合准备 OpenAI AI Infra(推理平台 / serving / batch service / eval infra 方向)社招中高级面试的候选人(大致对标 Google L4-L5 / Meta E4-E5)
  • 三主轴:LLM Serving + Batch Service + Eval,外加 AI Infra System Design 和 mission fit BQ
  • 评分重点:推理链路的量化表达(TTFT / TPOT / 吞吐 / 成本)+ failure handling 的完整闭环,不是模型训练深度
  • 本篇聚焦 AI Infra 岗位视角;泛 SWE 题单向内容见站内 SWE 面经页与 8 月全攻略页,MLE 准备见 MLE 合集页

面试流程:OA / Phone / VO / HM / Team Match 各轮是什么

OpenAI 的流程比 Google / Meta 标准化程度低,不同团队、不同 recruiter 的版本会有出入,公开信号里的主线是:投递 / 内推 → Recruiter Screen → OA(部分岗位)→ Phone Screen → Onsite / VO(3-5 轮)→ HM → Team Match → offer。线上工具是 CoderPad(部分团队是带 CMake 项目结构的工程环境)。AI Infra 岗位各轮的侧重点如下:

  • Recruiter Screen(30 分钟):不考技术,聊动机、背景、级别、地点和「为什么 OpenAI」。AI Infra 候选人建议这轮就明确说出「我想做推理平台 / serving / batch service」,这会直接影响后面的 Team Match 匹配方向。
  • OA(部分岗位,限时):部分岗位有 online assessment,公开信号指向 CoderPad 式限时 coding,AI Infra 团队偏小系统味题目(任务队列、rate limiter、cache),而不是纯算法题。没有 OA 的岗位直接进 phone screen,以实际收到的邀请为准。
  • Phone Screen(45-60 分钟):1 道 coding,两种画风:经典 medium DSA 或小系统题(任务队列 / job scheduler / rate limiter / streaming parser)。AI Infra 团队偏 systems 味;考点是动手前能否声明假设、第一版能否跑通、复杂度能否讲清,follow-up 常见「数据量 10 倍」「加并发」「变成分布式」这类约束升级。
  • Onsite / VO(3-5 轮,每轮 60-75 分钟,通常背靠背一天面完):AI Infra 岗位的常见结构是 2 轮 Coding(含小系统实现)+ 1-2 轮 System Design(LLM serving 系统、batch inference 服务)+ 1 轮 ML Depth / Tech Deep Dive(serving 指标、eval 体系、监控与回滚)+ 1 轮 BQ / HM。OpenAI 的一个显著特点是 re-interview 常见:组别招满换组、某一轮信号弱补面,要做好多轮的心理准备并主动推进日程。
  • HM(Hiring Manager Call)VO 通过后与 hiring manager 聊方向、level、comp 和 mission fit,不再考技术。公开信号里「onsite feedback positive 但 HM 说背景不 match」是真实存在的路径,HM 面前值得把「为什么这个团队」单独再准备一轮。
  • Team MatchOpenAI 团队多(Sora / ChatGPT / 基础模型 / 推理平台 / 核心 infra / 安全等),AI Infra 岗位通常匹配到推理平台、核心平台或数据 infra 方向。重点是把项目经历映射到目标团队的具体方向(做 serving 的讲 serving,做 eval 的讲 eval),主动说出「我希望进做 XX 方向的团队」是加分项。出结果通常 4-8 周,日程上留好余量。

题型雷达:Coding、System Design、ML Design、SQL、BQ 各占多少

按 AI Infra 岗位把题型按出现频率排个雷达图,最区分人的三根轴是 LLM Serving / Batch Service 方向的 System Design、ML Depth(eval 与上线)和小系统 Coding:

  • System Design(必考,1-2 轮):高频场景是 LLM 推理 serving 系统(GPU 调度、continuous batching、KV cache、TTFT / TPOT、failure handling)和 batch inference 服务(百万级任务队列、优先级、重试、幂等、成本)。考点是 goal → 规模 → 瓶颈 → 一致性 / 延迟 / 成本取舍 → failure handling 和监控降级的完整闭环,容量估算要算到 GPU 张数 / 队列深度 / 任务时长。
  • ML Depth / ML Design(1 轮,AI Infra 特有):和泛 SWE 岗位不同,AI Infra 几乎必有一轮专门深挖或深度 follow-up:offline eval 体系怎么建(golden set 构建、LLM-as-judge 的偏差与校准、human eval 采样、回归测试与 bad case review)、模型版本上线怎么做(canary、监控指标、回滚条件)。考点是「模型上线后的工程闭环」,不是模型原理。
  • Systems Coding(高频,phone 1 轮 + onsite 2 轮):job scheduler、任务队列、rate limiter、KV cache、streaming parser、worker pool——「先可运行、再加并发、再谈分布式」的实现题。评分看第一版的接口设计和 follow-up 的演进路径,每版说清改了什么、复杂度怎么变。
  • 经典 DSA(中低频):phone screen 和 OA 可能出现经典 medium,作用是过线,不是区分点;AI Infra 候选人不必在 hard 题上花时间。
  • SQL(低频):一般没有独立 SQL 轮;如果 team 偏数据平台,可能带一道轻 SQL(join、window、dedup),口径讲清即可。
  • BQ / mission fit(1 轮 + 穿插每轮):为什么 OpenAI(几乎必问,AI Infra 候选人要落到推理 / 产品 / 研究的具体方向)、失败项目、跨团队分歧、不确定性下的优先级判断。准备 4-6 个 STAR 故事,每个有 measurable impact 且能接两层追问。

高频题目:7 个代表题型和考点

以下是 2026 年公开面经信号里反复出现的题「类型」,只归纳题型和考点,不复刻任何人的具体原题:

OpenAI AI Infra 3 大主轴系统架构与指标要求

  • System Design:LLM 推理 serving 系统(SD 最高频):设计一个在线 LLM serving 系统,支持流式输出和高并发。考点:prefill / decode 阶段差异、continuous batching 与 static batching 的取舍、KV cache 管理与显存估算、TTFT / TPOT 的定义和优化路径、GPU 调度(节点挂掉怎么办、队列积压怎么办)、降级策略(模型降级、排队提示、部分失败)。
  • System Design:batch inference 服务:设计一个处理百万级请求的离线批量推理服务(类似 OpenAI Batch API 的形态)。考点:任务队列与优先级、worker pool 调度、重试与幂等(同一个任务执行两次怎么办)、结果存储与取回、成本优化(吞吐换延迟、spot 资源使用)、进度追踪和部分失败处理。
  • 小系统:job scheduler / 任务队列:实现一个支持优先级、超时、重试的调度器。考点:第一版可运行 → 并发安全 → 分布式(队列分片、leader 选举)三层演进,每层说清数据结构、复杂度和失效模式。
  • 小系统:rate limiter / KV cache:滑动窗口限流、支持 KV 和淘汰策略的缓存。考点:数据结构选型、并发安全、淘汰策略取舍(LRU / LFU / TTL)、corner case 处理。
  • ML Depth:offline eval 体系搭建:怎么搭一个模型评估 pipeline,覆盖 golden set、LLM-as-judge、human eval。考点:golden set 怎么构建和维护、LLM-as-judge 的偏差与校准方法、human eval 的采样与标注一致性、回归测试自动化、bad case review 闭环。
  • ML Depth:模型版本上线:新版本模型怎么上生产。考点:canary 比例怎么定、核心监控指标(延迟、错误率、质量代理指标)、回滚条件和执行路径、bad case 的快速收集。
  • Debug / Deep Dive:推理延迟劣化排查:serving 系统 p99 延迟飙升,给日志或指标定位根因。考点:指标分层(TTFT / TPOT / GPU 利用率 / batch 效率 / 队列深度)、假设与验证、最小复现、重试与超时的副作用分析。

💡 OpenAI 的完整准备路线:OA / Phone / VO 各轮考什么、怎么练,公司攻略页整理成了清单。

OpenAI 面试全攻略 →

公开面经信号怎么读

一亩三分地、Blind、Glassdoor 等社区是 OpenAI 面试信息最集中的公开来源,但 AI Infra 岗位的公开信号有两个特点:量比泛 SWE 少,噪音反而更大——不少标题写着「AI Infra」的帖子实际是泛 SWE 或 MLE。读法比内容更重要,几个原则:

先区分岗位,再读轮次结构。按题目内容而不是标题判断:帖子里出现 serving 指标、KV cache、任务队列、eval 体系的,才是真 AI Infra 信号;全是网格模拟、经典 DSA 的,是泛 SWE 信号,别拿来准备 AI Infra 面试。再按「年份 + 级别 + 团队方向」筛选,只看最近半年到一年的帖子——流程本身在变(ML Depth 是独立轮还是深 follow-up、Debug 是否独立),旧帖的轮次结构会误导你。

找共识,不信个例。多篇独立帖子都提到「SD 考 LLM serving / batch 系统」「ML Depth 问 eval 和上线」「re-interview 常见」,这个结构才可信。单篇面经说的轮次数量、题目难度不能当结论;面经作者有幸存者偏差(过的人爱写,挂的人少写),整体难度感知会偏乐观。

提取「轮次结构 + 题型方向 + 挂点」,忽略剧情。每篇面经真正有用的信息密度就这三样:每轮考什么类型、follow-up 追问到多深、作者觉得过 / 挂在哪。故事细节、情绪、对面试官的评价都不需要带进你的准备里。

不搬运、不暗示合作。本站所有 OpenAI 面经内容都只归纳公开信号,不复制任何候选人的逐字面经,也不代表与一亩三分地或任何面经社区有合作或转载关系。你读到的公开帖子请以原作者发布的内容为准。

常见挂点:OpenAI AI Infra 独有的失分方式

把公开面经里的挂因和模拟面试复盘对照,AI Infra 岗位特有的失分点集中在这几个:

  • Serving 指标讲不量化:TTFT / TPOT / 吞吐 / 每 token 成本讲不出来,或者说不清 continuous batching 为什么比 static batching 快。AI Infra 的 SD 和 deep dive 轮都从指标开始,指标讲不出来,后面全塌。
  • SD 没有 failure handling 和成本账:GPU 调度 / 任务队列题全程没有节点挂掉、队列积压、模型 OOM、成本取舍。AI Infra 的 SD 面试官明显在听「节点挂了怎么办、队列积压怎么办」,只罗列组件等于没设计。
  • 把 batch service 当「排队」:没有优先级、没有重试幂等、没有部分失败处理、没有成本优化。batch service 题的 follow-up 几乎都指向「同一个任务执行两次怎么办」「worker 挂了任务没做完怎么办」「百万级任务怎么降成本」。
  • Eval 只谈 accuracy:golden set 怎么建、LLM-as-judge 有什么坑、回归和 bad case 怎么闭环都答不上来。ML Depth 轮问 eval 考的是「工程闭环」,只回答「跑个 eval 比一下分数」直接失分。
  • 会训练不会推理:背景是预训练 / 微调,但 serving 链路(prefill / decode、KV cache、batching)讲不清楚,「为什么这么设计」的 follow-up 一追就断。训练背景的候选人必须提前补推理链路叙事。
  • CoderPad / CMake 环境不熟:log 是 append 到最后的、indentation 处理、CMake 项目结构——公开信号里有人把时间耗在工具操作上。面试前至少完整跑一遍 CoderPad + CMake 的题。
  • 「为什么 OpenAI」答泛泛:答不出具体产品 / 研究 / 安全方向,HM 面直接判 mission misfit。AI Infra 候选人要把「我想做推理平台的 XX 方向」说具体,HM 面前单独再练一轮。
  • 流程被动等待OpenAI 流程不标准化(换组、改期、re-interview 都常见),被动等 recruiter 的候选人在公开信号里普遍走到更晚。主动跟进、主动约时间,是流程本身的一部分。

准备路线:7 天 / 14 天 / 30 天

按你距 VO 的天数选路线。三个版本的共同原则:LLM serving 和 batch service 两道 SD 的 failure / 成本 trade-off 永远优先,ML Depth 的 eval / 上线固定叙事保下限,小系统 coding 的 follow-up 链保下限,BQ 故事保下限,最后两天只留 mock 和状态调整,不学新东西。

  • 7 天(保下限版):D1 LLM serving 叙事:把 prefill / decode、KV cache、continuous batching、TTFT / TPOT、吞吐和成本的完整叙事整理一遍,然后白板上讲一遍 LLM serving 系统 SD,强制 failure handling + 成本账两段,录音回听;D2 batch service SD:白板讲 batch inference 服务(队列、优先级、重试、幂等、成本),强制回答「任务执行两次」「worker 挂了」「百万级成本」三个 follow-up;D3 小系统:1 道 job scheduler + 1 道 rate limiter / KV cache,练「可运行 → 并发 → 分布式」三层演进话术;D4 ML Depth:eval 体系(golden set / LLM-as-judge / human eval / 回归 / bad case)和模型上线(canary / 监控 / 回滚)两条固定叙事,各练到 2 分钟讲完;D5 完整 mock 1 场(SD + 10 分钟 BQ),录音复盘;D6 缓冲日,完整跑一遍 CoderPad + CMake 环境,检查设备日程,早睡。
  • 14 天(标准版):在 7 天基础上——D7-D8 DSA 补线:2 道经典 medium(phone / OA 过线用),不追 hard;D9 重做两道 SD,每道练到 50 分钟讲完,容量估算强制落到 GPU 张数 / 队列深度 / 任务时长;D10 项目深挖:resume 上 2 个主项目各写三层答案(概述 2 分钟 → 规模与取舍 5 分钟 → 反思与结果 3 分钟),AI Infra 候选人要把每个项目映射到 serving / batch / eval 三主轴之一,数字做速查表;D11 GPU 与推理基础补课:GPU 显存结构、batch 效率、prefill / decode 的算力特征、spot 资源使用,每个概念能讲 2 分钟;D12-D13 BQ 故事库扩到 5-6 个(为什么 OpenAI、失败项目、跨团队分歧、拦下线上问题、主导项目),英文口述各过一遍;D14 缓冲日。
  • 30 天(系统版):在 14 天基础上——D15-D18 SD follow-up 专项:给两道 SD 题各补三类追问(规模 10 倍、全 failure 场景、成本减半),每类给出方案 + 取舍;D19-D21 eval 专项:完整搭一遍 eval 体系的口述(golden set 构建 → LLM-as-judge 校准 → human eval 采样 → 回归自动化 → bad case 闭环),外加分布式一致性基础(幂等、重试、最终一致性);D22-D24 Debug 专项:推理延迟劣化排查题 2 道,把「指标分层 → 假设 → 最小复现 → 验证 → 防复发」练成固定话术;D25-D28 连续 2-3 场完整 mock(找真人或录音),重点看 follow-up 接没接住、SD 的 failure 段全不全、前 10 分钟提问质量;D29 复盘 mock,把断片点写下来各补一段;D30 缓冲日。

FAQ:OpenAI AI Infra 面试 5 个高频问题

Q1:OpenAI AI Infra 面经怎么读?重点看什么?
公开面经(一亩三分地、Blind、Glassdoor 等社区)重点读三样:轮次结构(几轮、每轮什么类型、有没有 re-interview)、题型方向(SD 是不是 LLM serving / batch 系统、ML Depth 是独立轮还是深 follow-up、coding 偏不偏 systems 味)、挂点(作者觉得过 / 挂在哪)。AI Infra 的公开信号比泛 SWE 少且噪音大,先按题目内容(有没有 serving / batch / eval 内容)判断是不是真 AI Infra 信号,再按年份 + 级别 + 团队方向筛选最近半年的帖子,以多篇共识为准,单篇个例不当结论。本篇的轮次结构、题型雷达和挂点就是按这个共识整理出来的。

Q2:OpenAI AI Infra 面试几轮?
社招公开信号里的主线是:Recruiter Screen(30 分钟,不考技术)→ OA(部分岗位,限时 coding)→ Phone Screen(45-60 分钟,1 道 coding,AI Infra 团队偏 systems 味)→ Onsite / VO 3-5 轮(每轮 60-75 分钟,常见 2 轮 Coding + 1-2 轮 System Design + 1 轮 ML Depth + 1 轮 BQ)→ HM → Team Match。流程不标准化,re-interview、换组、改期都常见,轮次数量以实际收到的邀请为准;出结果通常 4-8 周,从第一次联系到 offer 做好 5-10 周的心理预期。

Q3:OpenAI AI Infra 考什么?难度如何?
三主轴:LLM Serving(推理链路:prefill / decode、KV cache、continuous batching、TTFT / TPOT、GPU 调度、failure handling)、Batch Service(job scheduler、任务队列、重试与幂等、成本优化)、Eval(golden set、LLM-as-judge、human eval、回归与 bad case 闭环)。外加 Systems Coding 小系统题(job scheduler、rate limiter、KV cache)和 mission fit BQ(「为什么 OpenAI」几乎必问)。整体难度:coding 不难于 LeetCode hard,难在 follow-up 链;SD 和 ML Depth 才是真正区分人的轮次。

  • Q4:OpenAI AI Infra 和 SWE 的面经有什么区别?
    轮次结构相似(都是 Recruiter Screen → OA(部分)→ Phone → VO 3-5 轮 → HM → Team Match),差异在题型重心:SWE 主轴是 Systems Coding 多 part 题 + Debug(ML 代码找 bug / 分布式排障),SD 场景更泛(视频生成系统、支付系统);AI Infra 主轴是 LLM Serving / Batch Service 方向的 System Design + ML Depth(eval、上线),coding 也偏 systems 味。如果你找的是 OpenAI SWE 面经——面试几轮、考什么——看站内 OpenAI SWE 面经 2026(Systems Coding + Debug 视角)和 OpenAI SWE 2026 面试全攻略(高频题单);本篇只覆盖 AI Infra 视角。两个岗位都投的话,用 SWE 篇打底,再叠加 serving / batch / eval 三条叙事。
  • Q5:AI Infra 和 MLE 的准备怎么区分?
    MLE 主轴是 ML System Design(千卡训练、推理 serving、RAG、eval 平台)+ 实验严谨性(baseline / ablation / reproducibility),coding 有实战型和纯 DSA 两种画风;AI Infra 主轴是 serving / batch / eval 的工程实现和系统设计,ML 知识是背景要求(熟悉模型特性即可,不需要推导训练过程)。MLE 的完整题型见 OpenAI MLE 面试题目合集,公司级信号卡片见 OpenAI 公司页
Editorial & Verification

📋 资料来源与审校说明

本文全面整理了 OpenAI AI Infra 岗位面试全流程指南,覆盖 LLM Serving、Batch Service、Eval 三大主轴的面试流程、题型雷达、高频题型、公开面经信号读法、常见挂点、7/14/30 天准备路线与 FAQ

AC
Software Engineering
Alex Chen·前 Meta / Stripe Senior SWE & Tech Lead

10 年+北美 SWE 经验,先后在 Meta(FAIR / Infra)和 Stripe 担任 Senior SWE 和 Tech Lead,主导过多项高并发系统架构设计,前 FAANG 面试官,累计面试 1000+ 候选人,熟悉 Meta / Google / Stripe 面试评分标准。

累计面试 1000+ 候选人UC Berkeley, CS 硕士
本文由 Alex Chen 审校与整理

📚 推荐延伸阅读 (Related Guides)

OpenAI SWE 面经 2026:AI Infra、Systems Coding、Debug

OpenAI SWE 面经 2026:拆解 Systems Coding 多 part 题(可运行→并发→分布式逐层升级)、AI Infra System Design 与 Debug 轮方法论,附常见挂点和 7/14/30 天冲刺路线。

OpenAI SWE / AI Infra 面试全攻略 2026:Coding、System Design、ML Coding 高频题

基于大量近期真实面试经历,整理 OpenAI 最新面试流程、高频 Coding 题目(Plant Infection、Social Media、Chess)、System Design(Design Sora)、ML 专项考察,以及常见挂因和准备策略。

大厂面试准备指南 2026:时间规划、轮次策略、常见挂点

回答「大厂面试怎么准备 2026」:从投递到 offer 的时间线与各轮次考什么,SWE / MLE / DS / DE 高频题型方向与核心方法,中国/海外候选人常见挂点,以及 7/14/30 天准备路线,适合准备 Google、Meta、Amazon 等技术面的候选人。

🏢 公司面试全攻略

公司攻略

OpenAI 面经与面试全攻略 2026

查看 OpenAI 的 OA / Phone / VO / 系统设计全流程准备路线 →

代面服务

OpenAI 代面(代面试)服务

OpenAI 代面(对口型)$499/轮 起,多轮连面有打包价。

💼 完整服务与价格我们提供 OA 代写($199 起)VO 辅助($299 起)VO 代面($499 起)30 分钟免费咨询:按目标岗位、公司与轮次匹配具备相关经验的导师,覆盖 Coding、System Design、ML Design 与 BQ;具体导师与背景以接单前书面确认为准。

查看服务详情 →
已复制微信号!