金融工程硕士生第一次量化面试的准备误区

一句话总结

大多数MFE学生的面试准备方向从一开始就错了——他们把面试当成一场学术汇报,而不是一场决策模拟。量化面试官不是在找最聪明的人,而是在找最不可能在实盘中炸掉组合的人。你背熟的Ito引理推导和Black-Scholes偏微分方程,在交易台前只占不到三成的权重。剩下的七成,考的是你在信息不完备、时间压力下的判断质量。这恰恰是金融工程项目里从来不会教的东西。

纠正这个认知偏差,比你多刷300道绿皮书题更有用。因为刷题只能提升你答对的能力,而改变认知才能让你明白为什么答对了还是被拒。


适合谁看

这篇写给正在准备第一次量化面试的金融工程硕士生——尤其是那些GPA 3.8以上、绿皮书刷了两遍、但每次面完总觉得“聊得不错却没有下一轮”的人。也适合刚入学、以为学好随机微积分就能稳进Citadel的MFE新生。

如果你已经拿了三个onsite但全部被拒,这篇文章会告诉你面试官在debrief里到底怎么评价你。如果你还没开始面试,这篇文章会在你浪费第一个月刷错方向之前告诉你什么才是真正的优先级。如果你来自非目标项目的MFE,这篇文章的价值更大——因为你在简历筛选中已经处于劣势,面试容错率比MIT MFin的人低得多,你经不起方向性错误。

这篇文章不适用于已经有两年以上量化研究经验的人。你们的问题不是“第一次面试”,而是“如何跳槽到更好的fund”。这两件事的逻辑不一样。


为什么MFE课程里的东西在面试里大半没用

绝大多数MFE项目的课程设计服务于一个假设:学生毕业后进入卖方,做衍生品定价,服务结构化产品台。这个假设在2008年以前成立。现在不成立了。现在MFE毕业生最大的去向是买方量化研究、量化交易、以及prop shop的alpha research。但课程体系没有跟上这个迁移。

随机微积分,你学了一整年。面试里可能被问到一次——而且大概率是让你手写一个dXt = μdt + σdWt的Euler离散化,不是让你证明Girsanov定理。时间序列分析,你学了一个学期ARIMA和GARCH。面试官问的是:给你一分钟的tick数据,你怎么判断有没有predictability?不是让你写模型,而是让你做判断。

这不是说课程没用。而是说课程教的是工具的原理,面试考的是工具的取舍。原理可以推导,取舍依赖经验。你没有经验,所以你必须用另一种方式展现判断力。

面试官心里有一个隐含的评分维度:学术成熟度。它不是看你懂多少定理,而是看你知不知道每个工具的边界在哪。坏的回答是:“我用Lasso做特征选择。

”好的回答是:“Lasso在高维共线性下不稳定,我试了ridge和elastic net,最终用recursive feature elimination加walk-forward validation来确定特征集,因为我不信任单次回测的稳定性。”这两句话的区别不是技术,而是你在告诉面试官:我知道这东西在什么地方会炸。


> 📖 延伸阅读兼职AI负责人 vs AI顾问:医疗公司如何选择?

为什么你觉得自己答对了所有题,还是被拒了

2019年芝加哥一家prop shop的debrief会上,三个面试官在讨论一个MFE候选人。技术轮的表现是满分。概率题答得干净利落,coding轮用Python写了一个order book imbalance的实时计算,bug free。

但最后全票reject。原因只有一个:候选人在回答一个关于策略回撤的behavioral问题时候说,“我会调整参数使Sharpe回到2以上。”

这句话让坐在角落的PM抬头看了一眼。PM后来在debrief里说了一句话:“这个人会在实盘里overfit到死。他的第一反应不是问‘策略逻辑是否还成立’,而是直接调参数。这种思维方式在真实交易中会害死我们。”

这就是典型的高GPA陷阱。你被训练成所有问题都有一个正确答案,你只需要找到它。但量化交易中,大多数问题没有正确答案,只有代价不同的错误。面试官在技术轮之后增加的behavioral问题,考的不是你的经历,而是你的决策框架。

“你做过的项目中,哪个失败了,为什么?”这不是让你展示如何从失败中学习。这是让你展示你能不能准确归因——是模型假设错了,还是数据质量有问题,还是执行层面出了偏差。错归因比不归因更可怕。一个知道自己为什么失败的人,在下一次决策中会避开那个特定类型的坑。一个把失败归咎于“市场不好”的人,下一次还会栽在同一个地方。

不是你的答案不对,而是你的思考路径暴露了你的风险。面试官在意的不是这道题你有没有答对,而是你面对下一个从未见过的市场场景时,会不会做同样危险的事。


为什么刷题刷到能背答案,反而降低你的通过率

Citadel的量化研究面试里有一道经典题:估计一个不均匀硬币的正面概率,你扔了10次,8次正面。你的点估计是多少?

标准答案不是0.8。是Beta分布的后验均值,取决于你选什么先验。大部分刷过绿皮书的人会直接说:“用Beta(1,1)作为无信息先验,后验均值是9/12=0.75。

”这个回答能让你及格,但不能让你脱颖而出。因为面试官接下来会问:“为什么选Beta(1,1)而不是Jeffreys prior Beta(0.5,0.5)?”如果你答不上来,面试官就知道你只是在复述答案。

更糟的是,有些候选人会直接跳到Beta(α,β)的公式,试图用数学推导来掩盖自己对先验选择的理解不足。这在面试官眼里是减分项——你在用技术复杂性逃避一个判断问题。不是你不会数学,而是你不知道什么时候数学重要,什么时候判断重要。

Jane Street的面试官有一个技巧:当候选人给出一个教科书般的完美答案时,他们会追问一个看似简单但是故意模糊的问题。比如:“你的模型说这个期权被低估了。你买还是不买?”候选人如果开始讲鞅定价理论,就已经出局了。正确的回答是:“我需要知道流动性。如果bid-ask spread吃掉了定价误差的一半,这个信号就没有执行价值。”

这不是在考你知不知道spread的影响。这是在考你在得到理论答案之后,有没有习惯性地追问一句:“现实中有什么会让这个答案失效?”这个习惯,刷题刷不出来。


> 📖 延伸阅读转行PM简历ATS vs 传统简历:格式对比

量化面试到底在面什么——拆解每一轮的隐含评分维度

一个标准的买方量化研究面试通常有四到五轮。每一轮都有一个你不会在邮件里看到的评分维度。

第一轮是HR screen或coding OA。这一轮看的是基础能力底线。不是看你有多强,而是看你有没有明显的短板。OA里那道动态规划题,不是你写出O(n²)就过,O(n log n)就优。而是你写出来的代码有没有考虑边界条件。一个忘记处理空数组的候选人,在面试官眼里等于一个在实盘里忘记处理缺失数据的quant。这是致命缺陷。

第二轮是技术电面,考概率和统计。重点不是答案正确性,而是你的推导过程是否暴露了结构化思维。一道题卡住了,你怎么办?是沉默30秒然后猜一个方向,还是先界定已知条件和未知变量,再提出两个可能的路径并比较可行性?后者叫结构化思维,前者叫瞎猜。面试官在电话那头记的不是你的答案,而是你卡壳时的反应模式。

第三轮是coding+math onsite或superday的第一部分。这一轮开始有“压力测试”属性。面试官会故意在你写代码的时候打断你,问一个无关的问题——比如你正在实现一个Kalman filter,他突然问:“你为什么要用Kalman而不是简单的EMA?

”这不是在考知识点,这是在考你在被打断后能不能迅速切换context,并且不被情绪影响。量化研究的工作就是不断被打断:行情变化、风险报警、PM走过来问一个完全不相干的问题。你在这轮的表现直接映射到你未来在交易台前的稳定性。

第四轮是case study或research presentation。这是权重最高的一轮,也是MFE学生最容易翻车的一轮。因为这一轮考的不是你会什么,而是你知不知道什么重要。给你一个数据集,让你找一个预测信号。不是你能找到多少信号,而是你如何判断一个信号是真实的还是噪音。

面试官在看:你有没有做multiple testing correction?你有没有考虑样本外衰减?你有没有检查信号的换手率是否在扣除成本后仍然盈利?任何一个“没有”,都是拒信。

最后一轮是PM或partner面。这一轮不考技术,考的是信任。PM在判断一件事:如果下个月市场波动率飙升40%,这个人能不能在凌晨两点独自做决策?不是决策多英明,而是决策多稳健。一个在压力下会panic的quant,对组合的破坏力超过十个平庸的模型。


准备清单

  1. 重新排序你的优先级。把70%的时间花在概率直觉、coding速度和case study的实战演练上,30%的时间维护学术知识。不是反过来的70%学术、30%面试技巧。面试技巧本身就是量化研究能力的一部分。
  1. 用真实市场数据做至少一个端到端的alpha research项目。不是用教授给的干净数据集,而是自己去WRDS或者Quandl拉数据,自己清洗,自己处理survivorship bias,自己写回测框架。面试官问“你做过什么项目”时,你要能说出数据源、清洗步骤、回测设计、失败原因,而不是只报一个Sharpe。
  1. 训练自己被打断后15秒内恢复状态。找同学模拟,在你做题时突然插一个问题,练到你的心率和回答质量不受影响。量化面试的手册里通常会有具体的压力面试模拟脚本,照着练比随机mock有效得多。
  1. 准备三个“失败案例”的详细复盘。每个案例必须包含:当时的判断、判断的依据、为什么错了、如果重来会改什么。不是讲故事,而是展示归因框架。PM面试官听的不是你失败的经历,而是你分析失败的方式。
  1. 把绿皮书里的每道概率题都追问自己一个“然后呢”。你算出了理论答案。然后呢?这个答案在真实交易中意味着什么?它的敏感性假设是什么?如果假设不成立,误差方向是偏保守还是偏激进?这个习惯会让你在面试中自然说出面试官想听的东西。
  1. 了解你面试的每一家公司的策略类型。不是知道“他们是做市商”就完了,而是知道他们赚的是什么钱。Citadel Securities赚的是flow的bid-ask spread,Two Sigma赚的是统计套利的alpha decay,DE Shaw赚的是多策略低相关的组合收益。

你的回答应该反映你理解他们的风险偏好——一家做市商对drawdown的容忍度和一家多策略fund完全不同。这一点在PM面试手册的买方分类框架里有详细拆解,搞清楚这些再进面试。

  1. 准备一段“你能为我们做什么”的回答,控制在90秒以内。不是你的技术栈列表,而是你能带来的具体能力:“我擅长在高噪声环境下识别均值回归信号,过去一年我在课程项目里用order book数据做了一个reversion predictor,样本外R²是0.02,但换手率足够低,扣除成本后年化超额4%。

我知道贵司的期权做市业务需要这种补充信号来优化对冲成本。”这就是PM想听的——不是你能学什么,而是你已经能做什么。


常见错误

错误一:把面试当成学术答辩

BAD版本。面试官问:“你对Black-Scholes假设有什么看法?”候选人答:“BS模型假设波动率恒定、无交易成本、连续交易。这些假设在现实中不成立,所以BS定价存在系统性偏差。我可以推导一下波动率微笑的形成机制。”然后开始写偏微分方程。

GOOD版本。候选人答:“BS最大的问题不是假设不现实——所有模型都有不现实的假设。BS的问题是它给出的delta在尾部事件中是错的。

我做过一个测试,用SPX期权数据对比BS delta和market-implied delta,在OTM put上差异可以超过15%。这意味着如果你用BS做风险管理,你会在市场暴跌时低估对冲需求。所以实践中我更信任local vol或者直接看market skew来调整greeks。”

区别不在于技术深度。BAD版本在展示知识,GOOD版本在展示判断。面试官要找的是第二个人,因为第一个人会在实盘里因为模型信仰而亏钱,第二个人知道模型什么时候不能用。

错误二:不会说“我不知道”

BAD版本。面试官问了一个你不熟悉的领域:“你怎么估计一个illiquid corporate bond的fair value?”候选人开始泛泛而谈:“可以用同行业可比债券的yield spread进行插值,考虑duration匹配和信用评级差异……”但每一个词都在暴露他不真正理解。

面试官追问:“如果可比债券的流动性也很差呢?”候选人开始慌乱,试图用更复杂的术语掩盖。

GOOD版本。候选人说:“坦白说,我没有做过illiquid bond的定价。但如果我现在必须解决这个问题,我的思路是:先用流动性较好的CDS或者ETF隐含的信用spread作为基准,然后加一个liquidity premium。

这个premium怎么定我不知道,但我会拉出同评级债券在流动性事件前后的spread变化来估算。这是我的第一性原理思路,具体执行可能需要请教有经验的人。”

这个回答之所以好,不是因为他诚实,而是因为他在不知道的情况下依然展示了结构化思维和边界意识。面试官不在乎你不知道什么,面试官在乎你不知道的时候会不会硬撑。硬撑的quant在实盘里会隐瞒模型的缺陷,这比模型有缺陷本身危险十倍。

错误三:过度优化技术细节,忽略业务逻辑

BAD版本。面试官给了一个tick级别的价格序列,问:“你怎么找交易信号?”候选人开始讲:“我会用wavelet decomposition提取不同频率的成分,然后用LSTM做多步预测,配合attention mechanism捕捉长程依赖……”这是典型的MFE学生答案——直接跳到最复杂的工具,没有先问业务问题。

GOOD版本。候选人说:“在建模之前,我想先搞清楚几个事。第一,这个品种的典型交易量和spread是多少,这决定了我的信号能不能覆盖成本。第二,什么时间段有流动性,什么时间段我应该避开。

第三,这个品种是trending还是mean-reverting主导——我可以先跑一个简单的Hurst exponent或者方差比检验来判断。如果Hurst接近0.5,我就不会浪费时间做均值回归策略。在这些问题有答案之前,我不选模型。”

面试官听完第二个回答,心里想的是:这个人上交易台不会第一天就亏钱。第一个回答的候选人,可能连手续费都没算过。不是技术不行,而是优先级错了。量化研究80%的时间在问问题和清洗数据,20%的时间在建模。面试里反过来的候选人,到了实盘也会反过来——然后发现自己的模型在样本外一塌糊涂。


FAQ

Q:我是MFE在读,GPA不高,是不是没希望进好的买方?

判断标准不是GPA的绝对值,而是GPA低的原因。如果你随机微积分拿了B但独立做了一个可展示的alpha research项目,面试官会选你而不是那个全A但只会复述讲义的人。买方不在意你学得有多快,在意你能不能用。

有一个真实案例:USC MFE的一个毕业生,GPA 3.2,但他在课程之外自己爬了SEC的EDGAR数据,做了一个基于管理层语气的情感分析策略,回测结果有实盘参考价值。他在面试时直接展示了这个项目,拿到了一个multi-manager platform的offer,base $150K加performance bonus,总包第一年超过$300K。

GPA只在简历筛选时有用,进了面试之后没有任何面试官会看你的成绩单。他们看的是你带进房间的那个东西——你的项目、你的判断、你的思维习惯。如果你GPA不高,就把所有赌注押在项目上。一个能跑赢基准的项目,比一个4.0的GPA有说服力一百倍。

Q:我应该投prop shop还是multi-manager还是single manager fund?

这不是一个“哪里更好”的问题,而是一个“哪里更适合你的风险偏好和成长曲线”的问题。Prop shop(如Jane Street、Citadel Securities、Optiver)做市业务为主,base通常$175K-$225K,bonus与desk P&L直接挂钩,第一年总包可以到$350K-$500K。但你的工作高度流程化,你更像一个系统的维护者和优化者,而不是自由探索者。

Multi-manager platform(如Citadel Global Equities、Millennium、Balyasny)base $150K-$200K,bonus取决于你的book的表现,第一年总包范围极大,从$200K到$600K都有。你会被分配到一个PM下面,学习曲线极陡,但风险也高——如果你的PM走了或者book被砍了,你大概率也得走。

Single manager fund(如DE Shaw、Two Sigma、Renaissance)base $150K-$250K,总包$300K-$700K,更稳定,更研究导向,自由度更高,但进去的难度也最大,而且你的影响力在初期很小。选择的本质不是哪家给钱多,而是你能否承受multi-manager那种一年换三次组的不确定性。如果你需要稳定来深耕一个研究方向,去single manager。

如果你相信自己的适应力和抗压能力,去multi-manager的回报曲线更陡。不要因为名字响亮就选,因为名字不帮你付房租,你的P&L才帮你付。

Q:面试时被问到完全没见过的题怎么办?

第一步不是想答案,而是控制反应。面试官在看的就是这一秒。不要慌张地开始瞎猜,不要说“这个我没学过”。你应该做的第一件事是复述你对题目的理解:“让我确认一下我理解对了——你问的是给定一个非平稳的时间序列,我如何检验两个变量之间是否存在虚假回归?

”这一步有两个作用:一是确认你真的理解了问题(有时候你以为是没见过的题,其实是熟悉的题换了包装),二是给自己争取15秒的思考时间。第二步,如果确实没见过,就说:“我没有直接处理过这个问题。但我的思路是——如果序列非平稳,传统的相关性度量会失效。我会先做协整检验,看两者是否存在长期均衡关系。

如果没有,我会差分处理或者用其他方式去趋势。这个方向对吗?”你没有给出标准答案,但你展示了结构化思维和知识迁移能力。面试官通常会在这个节点给一个提示,然后看你能不能顺着提示推导下去。

面试不是考试,面试是模拟同事讨论。你的目标不是独立解出答案,而是证明你是一个值得被帮助的人——因为在实际工作中,你遇到不会的问题,正确的做法不是硬扛,而是清晰描述问题并寻求协作。这个答案本身就是面试官想看到的。


准备好系统化备战PM面试了吗?

获取完整面试准备系统 →

也可在 Gumroad 获取完整手册

相关阅读