Harvey Interview Guide

Harvey 面试辅助:LLM 高亮 citation 题与 RAG 系统设计

面向 Harvey(法律 AI,SF 起家)SWE、Frontend 与 AI 方向候选人的面试准备攻略。基于同学提供的面经梳理技术店面高频的 LLM 输出高亮与 citation 题、vault 文件系统实现题,以及昂赛的 RAG、权限校验系统设计与 project deep dive 准备重点。

Related Articles

Harvey 相关文章

继续查看这个公司的岗位拆解、题型复盘和专项准备文章,按自己的轮次选择阅读。

Harvey 面经 • SWE • Frontend • AI 法律 • Phone Screen • System Design • 2026

Harvey SWE / Frontend Coding 面经

Harvey SWE 面经 2026:Phone 多 part coding(working code 优先、题库换新快),Onsite 覆盖 AI 产品 SD、项目深挖与 RAG Coding,附 7/14/30 天路线。

阅读全文

Question Radar

Harvey 高频必考题型

先看题型方向,再用下面的代表题目判断自己是否真的会拆题、会解释、会处理 follow-up。

必备

高亮与 citation 两问的完整实现:word level 匹配、重叠合并、标签同层闭合、来源索引按总频次降序与索引升序、空输入与无命中输入的返回。

必备

vault / 文件夹系统题:路径的添加与读取、重名文件在扩展名前加序号后缀、目录层级遍历与返回顺序、trie 或前缀树思路的取舍。

必备

System Design 三套骨架:法务文档检索的 RAG 链路、Google Drive 式 ACL 权限校验、按规则评分的 agent 及其与人工复核的分工。

必备

AI 方向的简易检索实现:embedding 生成、相似度召回、top-k 输出,以及 recall、hit rate、MRR 等 eval 指标的定义与优化手段。

必备

长题面阅读与澄清:把题面里的假设(字符集、空格、大小写、是否允许修改输入)逐条确认,避免在边界条件上返工。

必备

反冷场表达:在没有反馈时按「先讲思路与复杂度、再写代码、写完自测一个反例」的固定节奏推进。

Company Signals

Harvey 近期面试信号

从本地面经汇总里抽取高频信号,帮助你先判断该补 coding、设计、项目还是表达。

信号

同学提供的面经样本里技术店面出现频率最高的是同一道两问式 coding 题:给一段语言模型输出文本和一组 source 字符串,要求把命中的 source 用高亮标签包起来,第二问在每个合并后的高亮后面补上来源索引,并按各 source 全文出现次数降序排列、次数相同按索引升序。

信号

这道题的题面留了很多坑:要求 word level 匹配(例如 network 不应该匹配到 networking 内部)、要处理多个 source 重叠后合并成一个高亮、高亮必须在同一层级闭合,并且明确说不要求最优复杂度、只要 working code。

信号

2026 年出现换题与扩题的迹象:有样本遇到同一句子的匹配高亮新题,也有样本遇到内存版 vault 文件目录系统(add_file / get_files,第二问处理重名文件加后缀),还有样本用 trie 做文件系统题、前端岗考同一道题的前两问再追问上线生产要做哪些优化。

信号

昂赛结构在不同样本里为三轮上下:coding + system design + project deep dive / values;system design 出现过「文档库 + prompt 检索」的 RAG 产品题、以 ACL 为重点的 Google Drive 题、以及按规则给文件打合格与不合格并给修改建议的 agent 题。

信号

AI 相关岗位会考简易实现题:在 Colab 里写一个简化版 embedding 与检索流程,最后一问转向如何优化 eval,例如 recall 与 hit rate 这类指标。

信号

招聘节奏整体偏快:多份反馈提到店面当天或一天后就通知进入下一轮;同时也普遍反映面试官互动很少,出现过面试官全程基本不说话、甚至在忙自己事情的情况。

Sample Questions

Harvey 代表题目清单

这些不是让你背答案,而是把公司常见考法翻译成可练习的具体题目和 follow-up 场景。

Coding

给一段语言模型输出文本和一组 source 字符串,把命中的 source 用高亮标签包起来;要求 word level 匹配、重叠区域合并为同一个高亮、标签在同一层级闭合,不要求最优复杂度。

Coding

在高亮题基础上补 citation:在每个合并后的高亮后面追加来源索引,若一个高亮由多个 source 合并而成,则按各 source 在全文出现次数降序排列,次数相同按索引升序。

Coding

实现内存中的 vault 文件目录系统:第一问提供 add_file 与 get_files,第二问处理重名文件——新文件名与已有文件冲突时在扩展名前加序号后缀表示副本。

System Design

为用户发 prompt、系统从 vault 的大量文档中返回相关信息的检索产品做设计,重点是 LLM 加 RAG 的链路、召回与重排、引用回链以及无命中时的兜底。

System Design

设计一个类似 Google Drive 的文件系统,重点讨论 ACL 权限模型:角色与资源、权限继承与覆盖、共享链接、鉴权在检索链路上的位置以及权限变更后的索引一致性。

ML / AI

在 Colab 里写一个简化版 embedding 与检索流程,并回答如何优化评估——例如 recall 与 hit rate 的定义、离线评测集怎么构造、召回变差时先查哪一环。

Depth Notes

Harvey 专项深挖

把题型清单继续拆成面试官会追问的能力证据,避免只停在关键词层面。

店面主频题

高亮与引用两问怎么拆

Harvey 店面最高频的一道题可以拆成三层,同学提供的面经样本里几乎都是这个骨架。第一层是匹配与高亮:输入一段文本和一组 source,要求把命中的 source 用高亮标签包住,默认只含字母数字、单词之间只有一个空格,且必须按 word level 匹配——面试官明确举例说 network 不应该匹配到 networking 中间,所以实现时要先把文本按空格切词,再用词序列比对,而不是直接做子串查找。第二层是重叠合并:多个 source 可能互相覆盖,例如某段话既属于长 source 也属于短 source,题目要求把连续被覆盖的区域合并成一个高亮,并且标签必须在同一层级闭合,不能出现嵌套的高亮标签;实现上通常是先算出每个词是否被覆盖,再把连续覆盖的词合成区间。第三层是 citation:在每个合并后的高亮后面补上来源索引,如果这个合并区间对应多个 source,就把它们的索引全部列出,排序依据是各 source 在整段文本里出现的总次数降序,次数相同时按索引升序。这三层里真正拉分的是边界:文本首尾的空格与标点、source 出现零次、两个 source 完全重合、以及合并区间跨越标点的情况。题面还给了两条减负信息——只要求 working code 不要求最优复杂度,且假设字符都是字母数字、只有单个空格;抓住这两条就不要浪费时间去优化复杂度,把自测用例写全更划算。

换题迹象

vault 文件系统新题

Harvey 的题库在 2026 年出现明显变化,同学提供的面经样本里可以看到三条新线索,准备时不能只盯着高亮题。第一条是同一主题的变体:有样本遇到给定 sentence 与 matches 数组、按 matches 把原句高亮的新题,候选人自述之前只准备了 spreadsheet 类题,遇到新题直接失控,这提示单纯背一道题的答案风险很高。第二条是 vault 文件目录系统:背景是用户把文件上传到 vault 并用文件夹组织,要求实现内存中的目录系统,第一问提供 add_file(path) 与 get_files(path),第二问处理错误场景——新文件名与已有文件重名时,在扩展名前加序号后缀表示副本。这道题的核心是路径解析与去重规则,同学提供的面经样本里有候选人提到自己用 trie 处理,也有候选人卡在第二问的更新逻辑上。第三条是 spreadsheet / gsheets 类题:题面通常分多问递进,其中一问是 update cell,有候选人因为在这一问里写了 bug、调试过久而没能见到第三问而挂掉,也有候选人在店面阶段反复练过这道题后顺利通过。把这三条线索放在一起看,最稳的准备方式不是死记某一题的代码,而是把「路径与命名的字符串处理」「状态更新与回滚」「区间合并与排序」这三类通用能力各练到能现场写出来,这样遇到变体也有可迁移的骨架。

昂赛设计

RAG 与权限两类设计

Harvey 昂赛的 system design 同学提供的面经样本集中在两个方向。第一个方向是法务文档检索类产品:面试官描述他们有个 review table 形态的产品,用户发 prompt,vault 里存了大量文档,服务需要根据 prompt 从文档中返回相关信息,这一轮的重点是 LLM 加 RAG 的完整链路。候选人自述因为完全没接触过 RAG 而当场懵掉,这说明对该方向岗位来说 RAG 不是加分项而是门槛。准备时要把链路讲成可评审的组件图:文档接入与切分策略、embedding 与索引选型、召回与重排、上下文拼装与引用回链、以及无命中时的兜底与拒答策略;再补上评估与迭代闭环,例如离线评测集、召回率与命中率指标、以及上线后如何用日志回流改进切分与排序。第二个方向是权限:有样本的题目是设计 Google Drive,面试官重点追问 ACL,需要讲清角色与资源模型、继承与覆盖规则、共享链接与外部协作者的边界、以及鉴权在检索链路上的位置(先过滤还是先召回),还有权限变更后的索引一致性。另一份样本考的是按规则给文件打分并给出修改建议的 agent,追问集中在多个 agent 同时改同一份文件时如何避免冲突。这三类题的共同评分点是:先澄清使用场景与规模,再给组件划分与数据模型,最后主动讲失败路径与运维成本。

面试互动

沉默面试官下的节奏控制

关于 Harvey 的面试互动,同学提供的面经里负面描述相当集中,而且都指向同一件事:面试官几乎不给你反馈。有候选人描述面试官是个年轻华裔、全程基本没说几句话,让人无法判断自己的表达是否被接受;也有候选人说面试官全程在忙自己的事情,问问题还要让候选人重复才知道在问什么;还有候选人明确写到每个部分都做出来了却在之后收到挂掉的通知。这类反馈对准备策略有两个直接影响。第一,不能依赖面试官的表情或追问来判断自己是否答对,必须建立自检机制:写完一段先口头过一遍输入输出与边界,再主动补一个反例自测,最后用一句话总结复杂度,把评估材料喂给面试官。第二,要在开场确认规则:题目是否只要求 working code、是否允许用标准库、时间如何分配、有没有后续追问,这些在同学提供的面经样本里都是题面自己写清楚的,主动问一遍能省下大量返工。另一个值得注意的细节是招聘节奏,多份样本提到当天或一天后就有结果通知,说明评价很依赖当场的记录,而不是事后补交材料;因此把关键设计决策讲出口,比埋头把代码写到完美更重要。最后,这一家的挂经比例在同学提供的面经样本里偏高,遇到没有解释的拒绝时不必过度归因于自身能力,更实用的做法是把当场的题面与自己的卡点记录下来,用于下一家的准备。

Prep Plan

建议准备路线

先定位轮次,再决定优先补题型、项目、设计还是表达。

01

把高亮与 citation 两问写成可直接复用的模板:先做 word level 的词边界切分,再用二维布尔或区间合并处理 overlap,最后按出现次数排序输出索引列表,并把 tag 闭合层级与非法输入的返回口径一起固化。

02

准备一道同构的「字符串区间合并」题:句子加 matches 数组输出高亮字符串、vault 路径解析与重名加后缀,练到能在没有提示的情况下 20 分钟内交付第一问。

03

按岗位分流补 system design:SWE 与 AI 岗重点准备 RAG 检索链路(切分、召回、重排、引用回链)与文档权限模型;Frontend 岗准备生产化清单(状态管理、渲染性能、错误边界、可观测性)。

覆盖岗位

Harvey 常见目标岗位

SWEFrontendAI
覆盖轮次

建议重点模拟这些轮次

Recruiter / HR 电话技术店面(Coding)VO / 昂赛 CodingSystem Design(RAG / 权限 / Agent)Project Deep Dive + BQ

代面服务

Harvey 代面(代面试)服务

针对 Harvey 的轮次结构定制:技术轮老师现场作答、你露脸对口型,项目深挖与 BQ 提前准备到位。

Harvey 的公开流程多是 recruiter 或 HR 主动联系之后先走技术店面,通过后再进 VO 或昂赛;店面高频是 LLM 输出高亮与 citation 两问。代面(对口型)由技术老师现场作答,coding 与 system design 两类轮次都可以覆盖。

  • 店面 Coding:高亮与 citation 两问、vault 文件目录实现题,老师现场按面试官给定的提问节奏作答
  • System Design:RAG 文档检索、Google Drive 式权限校验、按规则给文件打分的 agent,事前把设计骨架与追问口径备好
  • AI 方向:Colab 上写简易 embedding 与检索,并追问 recall、hit rate 等 eval 指标,由老师接住追问环节

$499/轮 起 · 多轮连面有打包价 · 建议面试前 3-5 天准备

实时辅助

Harvey SWE 辅助(实时)

面试官提问后 0.5-1 秒出答案,你露脸照着念。按 Harvey 的题型和节奏给话术。

Harvey 的题偏「长题面 + 多问递进」,且面试官常常话很少。实时辅助把每一问的结构、边界与复杂度提示给你,你边写边讲,避免在沉默环境里丢节奏。

  • 高亮题:overlap 合并、word level 匹配、tag 闭合层级的边界实时提示
  • citation 排序:合并高亮后的索引列表按总出现次数降序、次数相同按索引升序的口径实时校对
  • vault 文件系统:路径解析、重名加后缀规则、get_files 返回顺序等细节实时提示

$299/轮 起 · 建议面试前 2-3 天准备并做一次模拟

OA 代写

Harvey OA 代写

收到 OA 但没时间刷题?发过来,按你收到的具体 OA 题型报价。

同学提供的面经样本里 Harvey 的 OA 信息非常少,绝大多数反馈都是直接进入技术店面。如果你收到 OA,请以邀请邮件里的平台、题量与时限为准,再确定辅助方式,不要套用第三方流传的题型。

$199 起 · 提前 1 天准备 · 限时窗口内交付

Company Comparisons

常被一起比较的公司攻略

如果你同时投递多家公司,可以用这些相邻攻略比较轮次、题型和评分重点,避免用一套准备方法硬套所有公司。

FAQ

Harvey 面试常见问题

常见问题

Harvey 面试流程一般有几轮?

Harvey 的面试流程通常包括 OA / Phone Screen、VO / Onsite 多轮技术面、Behavioral 面和 Hiring Manager 面。具体轮次取决于岗位和 Level,建议提前了解目标岗位的标准流程并针对性准备。

常见问题

Harvey 最常考什么题型?

根据同学提供的面经信号,Harvey 最常考的题型包括 高亮与 citation 两问的完整实现:word level 匹配、重叠合并、标签同层闭合、来源索引按总频次降序与索引升序、空输入与无命中输入的返回。、vault / 文件夹系统题:路径的添加与读取、重名文件在扩展名前加序号后缀、目录层级遍历与返回顺序、trie 或前缀树思路的取舍。、System Design 三套骨架:法务文档检索的 RAG 链路、Google Drive 式 ACL 权限校验、按规则评分的 agent 及其与人工复核的分工。、AI 方向的简易检索实现:embedding 生成、相似度召回、top-k 输出,以及 recall、hit rate、MRR 等 eval 指标的定义与优化手段。。建议先从高频题型入手,再做项目深挖和模拟面试。

常见问题

Harvey 面试需要准备多久?

建议至少提前 7-14 天开始冲刺准备。如果还在投递期,可以先做题型地图和岗位定位,拿到面试邀约后集中做模拟面试和表达训练。

常见问题

Harvey SWE 岗位最难的是什么?

Harvey 的面试以严格的 Hiring Bar 著称。最常见的失分点包括:前置澄清不充分、边界测试缺失、系统设计只背模板、项目深挖无法体现 ownership。针对性模拟可以有效降低这些风险。

常见问题

Harvey 面经应该怎么看?

同学提供的面经适合用来判断 Harvey 高频题型、轮次和常见挂点,但不要只背原题。更稳的做法是把面经拆成 OA / Coding / Design / Behavioral / HM 五类信号,再按目标岗位和 level 做限时训练。

常见问题

Harvey 代面、面试辅助、OA 代写多少钱?

Harvey 代面(对口型)$499/轮起,多轮连面有打包价;SWE 辅助(实时)$299/轮起;OA 代写 $199 起,提前 1 天交付。最终价格按岗位、轮次和具体面试情况浮动,添加微信 interview_coach_pro 先聊 30 分钟免费咨询再报具体价格。

AC
Software Engineering
Alex Chen·前 Meta / Stripe Senior SWE & Tech Lead

10 年+北美 SWE 经验,先后在 Meta(FAIR / Infra)和 Stripe 担任 Senior SWE 和 Tech Lead,主导过多项高并发系统架构设计,前 FAANG 面试官,累计面试 1000+ 候选人,熟悉 Meta / Google / Stripe 面试评分标准。

累计面试 1000+ 候选人UC Berkeley, CS 硕士
本文由 Alex Chen 审校与整理

需要按 Harvey 的具体岗位做冲刺计划?

添加微信 interview_coach_pro,发送岗位、level、轮次和日期,我们先判断最该补的环节。

查看服务与价格 →查看其他公司
✓已复制微信号!