Didi数据科学家简历与作品集指南2026

一句话总结

Didi数据科学家的筛选逻辑不是"统计功底越深越好",而是"你的模型能不能在司机端、乘客端、定价引擎里活过上线第一天"。真正拿到offer的人,简历上写的不是Kaggle排名和论文数量,而是撮合效率提升了多少、ETA偏差收窄了几个点、AB实验设计得多干净。

这个岗位的本质是业务翻译官,不是学术研究员——你的作品集需要证明的是:你能在Didi的三边网络里找到数据切口,把模糊的运营问题变成可量化的模型目标,再让模型结果变成可执行的策略。如果你的简历还在用"精通Python/R"和"发表X篇论文"填充篇幅,你的竞争对手已经在用"动态定价模型使高峰时段司机应答率提升14%"这样的句子收面试邀请了。

适合谁看

这篇文章写给三类人:第一类是正在投递Didi数据科学家岗位、但简历反复石沉大海的候选人,你可能有扎实的统计背景,却不知道怎么把学术训练翻译成工业界的语言;第二类是从其他大厂(字节、美团、阿里)想平跳Didi的资深DS,你带着成熟的建模经验,但不熟悉Didi独特的业务场景和评估逻辑;

第三类是2025-2026届的应届生,你在海外读完了统计或CS硕士,对回国加入互联网大厂有明确意向,但缺乏对Didi招聘细节的 insider 认知。

Didi的数据科学家岗位分布在北京总部和杭州研发中心,业务线涵盖网约车、货运、国际化(主要是巴西和墨西哥市场)、以及自动驾驶。不同业务线的面试侧重点差异极大:网约车核心看重供需匹配和定价算法,货运看重路径规划和重货匹配,国际化看重本地化特征工程的复杂度,自动驾驶则偏感知和预测模型。

这意味着不存在一份"通用简历"能打遍所有业务线——你需要根据投递方向调整作品集的叙事主线。

薪资层面,Didi数据科学家的总包结构在2025-2026招聘季大致如下:应届硕士base 25-35万人民币,RSU按4年归属约15-25万,年终奖2-4个月,总包约40-55万;3-5年经验的高级DS base 40-60万,RSU 30-60万,年终奖3-6个月,总包70-120万;

资深DS/专家级别base 60-90万,RSU 60-150万,年终奖和签字费另计,总包可达150-250万。薪资不是本文重点,但你需要知道:Didi的薪酬带宽比字节、美团略窄,但期权流动性在2023年退市后有所改善,2025年有新一轮上市传闻,这是谈判时的隐性筹码。


为什么你的论文数量敌不过一个撮合效率优化案例

Didi数据科学家的简历筛选有一个不成文的潜规则:第一行经历决定了面试官是否继续往下读。不是因为你不够优秀,而是因为HR和hiring manager每天浏览的简历里,"发表5篇SCI论文"和"Kaggle Grandmaster"已经造成了严重的认知疲劳。

我曾经参与过一次网约车核心算法组的debrief会议,那天我们讨论三个进入终面的候选人。其中一位候选人的简历开头是:"某Top2高校博士,发表CVPR/NeurIPS论文7篇,研究方向为图神经网络"。另一位的开头是:"负责XX城市高峰时段动态定价模型,司机应答率提升11%,乘客取消率下降6%"。

第三位是:"搭建司机收入预测体系,将新司机7日留存从34%提升至51%"。后两位进入了offer讨论环节,第一位在简历关就被标记为"学术背景强,但缺乏业务sense,建议先实习观察"。这个判断不是来自技术面试的表现,而是简历叙事本身传递的信号——在Didi的语境里,图神经网络是一个技术工具,而司机应答率是一个生死指标。

这里的关键洞察是:Didi的数据科学家不是在做研究,而是在做决策支持。你的模型输出最终要变成产品经理能看懂的策略阈值,变成运营团队能执行的补贴规则,变成工程师能实现的后端逻辑。

这意味着你的作品集需要展示完整的决策链条:从业务问题定义、数据探查、特征工程、模型选型,到AB实验设计、上线监控、业务效果回收。一个只展示模型AUC的portfolio,和一个展示"模型上线后GMV变化趋势"的portfolio,在Didi面试官眼中的价值差距可能是数量级的。

具体的BAD vs GOOD对比:BAD版本写"使用XGBoost模型预测订单取消概率,AUC达到0.87";GOOD版本写"识别出乘客取消前的3个关键行为信号,构建实时干预模型,在司机已接单但未到达阶段触发关怀策略,使 pilot 城市取消率从18%降至12%,年化减少GMV损失约2400万"。

差距不在于技术深度,而在于你是否理解这个模型在业务系统中的位置。

另一个常见误区是过度强调技术栈的复杂度。Didi的面试流程通常是:一轮简历筛选,一轮电话技术面(45分钟,侧重项目深挖和SQL),一到两轮现场/视频技术面(每轮60分钟,侧重案例分析和模型设计),一轮hiring manager面(侧重业务理解和职业规划),最后一轮HR面。

在技术面试中,面试官更关心的是你为什么选择这个模型、这个特征、这个评估指标,而不是你能把多少种算法串联起来。我曾经听到提醒自己团队的面试官:"我们要找的是能在深夜爆单时保持模型稳定的人,不是能背出Transformer论文细节的人。"


> 📖 延伸阅读:Didi应届生SDE面试准备指南2026

Didi数据科学家面试流程的每一轮,到底在筛什么

Didi的DS面试不是统一命题,而是业务线自主组织。但各条线的流程结构高度相似,可以拆解为五个环节,每个环节的考察重点和时间分配有明确的筛选意图。

第一环节:简历筛选(3-5个工作日)。这一轮的隐形规则是"业务匹配度 > 技术深度 > 学历背景"。

网约车业务线的hiring manager曾经在一次内部分享中说过:"我不要求候选人做过打车,但我要求他理解双边市场的基本矛盾——乘客要便宜、要快,司机要多赚、要轻松。"如果你的简历能体现对这种矛盾的认知,比如"通过补贴弹性建模平衡乘客等待时长和司机空驶率",你会比单纯写"优化了XX模型"的人更快拿到面试。

第二环节:电话技术面(45分钟)。这一轮通常由资深DS或tech lead执行,核心考察三个能力:SQL熟练度、项目叙述的清晰度、对业务指标的定义能力。一个典型的开场问题是:"Didi每天产生几千万订单,如果让你定义'司机满意度',你会怎么设计指标?"这个问题没有标准答案,但BAD的回答是立刻跳入"我可以做NLP情感分析"或"我可以设计一个多维度加权指数"——这暴露了你急于展示技术而回避业务本质。

GOOD的回答是先追问:"这个指标的使用场景是什么?是用于城市运营考核、还是用于算法优化、还是用于司机分层运营?"然后根据场景给出分层设计:如果是运营考核,可能需要可解释性强的显性指标(完单率、投诉率、收入稳定性);如果是算法优化,可能需要隐性行为指标(在线时长响应速度、拒单模式、高峰出勤意愿)。

第三环节:现场/视频技术面(2轮,每轮60分钟)。这一轮进入深水区,典型题型包括:开放性的建模设计题("如何预测某个新城市的司机供给潜力")、AB实验设计题("上线新定价策略后,如何评估对司机收入的影响,如何处理时间趋势和地域差异的混淆")、以及案例分析题("某城市周末深夜订单暴增但应答率骤降,你的分析思路是什么")。这里的关键不是给出完美答案,而是展示结构化思维和假设驱动分析的能力。

一个常见的陷阱是候选人急于给出模型方案,而忽略了"先验证问题是否值得建模"这一步。Didi面试官暗中期待的是:你能先问出"这个现象是周期性的还是突发性的"、"是供给不足还是需求过旺"、"是价格弹性问题还是司机分布问题",然后再进入技术方案。

第四环节:hiring manager面(60分钟)。这一轮的核心是"文化 fit 和业务野心"。Didi的组织文化带有强烈的"打仗"色彩,尤其是网约车业务在经历2021年的监管风暴后,团队更强调韧性和务实。hiring manager会关注你的职业动机:为什么选择Didi而不是其他大厂?

你对Didi当前业务挑战的理解是什么?一个高分的回答是坦诚承认Didi的困境(监管压力、国际化不确定性、自动驾驶的长期投入),但指出你看到了具体的数据科学机会——比如在合规前提下优化司机合规率与运力的平衡,或者在巴西市场复制中国市场的动态定价经验。BAD的回答是泛泛而谈"看好出行赛道"或"想加入大厂学习"——这等于什么都没说。

第五环节:HR面(30-45分钟)。这一轮看似简单,实则有两个隐藏雷区:一是薪资预期管理,Didi的HR有一定权限在base和RSU之间调配,但如果你过早暴露底线,后续谈判空间会被压缩;二是稳定性考察,Didi对频繁跳槽(2年内多次变动)有较高敏感度,你需要准备好对每段经历的合理解释。


作品集的核心结构:不是项目罗列,而是决策叙事

大多数候选人的作品集犯了一个结构性错误:按照"项目1、项目2、项目3"的线性排列,每个项目内部是"背景-方法-结果"的三段论。这种结构的问题是,它假设每个项目独立贡献价值,而实际上Didi面试官想看到的是:你如何在不同业务场景下反复运用和迭代同一套数据思维。

更好的结构是"问题类型"导向:供需预测类、定价优化类、用户增长类、体验优化类。

在每个类别下,展示一个深度案例,包含以下要素:业务问题的原始形态(是谁、在什么场景下、遇到了什么痛点)、你的诊断过程(排除了哪些假设、锁定了哪个关键变量)、技术方案的选择逻辑(为什么不用更复杂的模型)、实验设计的细节(对照组如何设置、样本量怎么确定、观察窗口多长)、以及最终的业务效果和意外发现。

一个具体的insider场景:某候选人在面试中展示了一个"司机热力图优化"项目,原始版本是"基于历史订单密度构建热力图,指导司机接单"。面试官追问:"这个热力图上线后,司机的行为发生了什么变化?"候选人回答:"更多司机涌向热点区域,导致局部 oversupply,反而降低了单司机收入。

"这个回答反而加分,因为它展示了second-order thinking——模型输出改变了agent的行为,而行为改变又反过来影响了模型假设。这种认知在Didi的复杂系统里至关重要。

另一个关键维度是"工程可实现性"。Didi的DS需要与工程师紧密协作,你的方案是否考虑过实时性要求、特征存储方案、模型更新频率?一个优秀的作品集会明确标注:"该模型部署为在线服务,P99延迟<50ms,特征通过Flink实时计算,模型每日凌晨批量更新。"这不是炫耀技术,而是在告诉面试官:你理解从实验室到生产环境的gap。


> 📖 延伸阅读:Didi留学生OPT/H1B求职时间线与策略2026

准备清单

  1. 重写简历的第一经历条目,确保它以业务结果开头,技术细节后置。用"XX指标提升XX%"替代"使用XX算法",用"年化影响XX万"替代"模型AUC达XX"。
  1. 准备3个深度案例,分别对应"预测类"、"优化类"、"实验设计类"问题,每个案例能讲满15分钟且不重复。案例需要包含一个你犯过的错误及修正过程,Didi面试官对"完美项目"有天然警惕。
  1. 系统性拆解面试结构,PM面试手册里有完整的互联网大厂算法岗实战复盘可以参考,特别是关于如何在技术面试中控制叙事节奏、如何把开放式问题收敛到可建模问题的部分。
  1. 针对Didi的三条核心业务线(网约车、货运、国际化),各准备一个问题诊断:该业务当前的核心数据挑战是什么?如果你入职,第一个月会优先解决什么问题?这个准备不是为了给出正确答案,而是为了展示你的思考框架。
  1. 用Didi的实际数据场景练习SQL:给定订单表、司机表、乘客表,如何计算"司机高峰时段的接单响应率"?如何识别"疑似刷单的司机群体"?如何设计一个分层抽样的AB实验?这些题目在LeetCode上找不到,但面试中反复出现。
  1. 准备薪资谈判的三档数字:理想值、可接受值、底线值。同时了解Didi RSU的归属节奏(通常是4年,前两年各25%、后两年各25%,或前两年各20%、后两年各30%的变体)和离职后的处理方式。
  1. 找到一位Didi在职员工进行mock interview,重点不是技术问题,而是获取该业务线的具体语境——比如网约车业务线最近是否在推进"司机分层服务"项目,这会影响面试官对候选人的期待画像。

常见错误

错误一:把学术论文摘要直接粘贴到简历里

BAD版本:"基于深度强化学习的多智能体协同调度研究,发表于XX会议,提出了一种新颖的注意力机制改进方案。"

GOOD版本:"将强化学习框架应用于实时调度场景,在XX物流合作伙伴的试点中,车辆利用率提升8%,空驶里程减少12%。该方案后来被产品化为'智能派单引擎'的核心模块。"

核心区别:BAD版本假设读者是学术同行,GOOD版本假设读者是业务决策者。Didi的面试官绝大多数是后者。

错误二:在AB实验问题上只谈统计显著性,不谈业务可解释性

BAD版本:"实验组相对对照组提升显著,p值小于0.05,置信区间不包含0。"

GOOD版本:"实验组ETA预测偏差降低9%,但司机端的路线遵循率反而下降3%。深入分析发现,更精准的ETA预测使系统倾向于推荐'理论上更快'但司机更不熟悉的路线。我们最终采用'预测精度+路线熟悉度'双目标优化,在保持偏差改善的同时恢复遵循率至基线水平。"

这个BAD版本的问题在于,它暴露了候选人对"实验成功"的单一维度理解。Didi的真实业务中,指标打架是常态,能识别并处理这种冲突的能力,比跑出统计显著性稀缺得多。

错误三:对Didi的业务挑战缺乏认知,面试中被动应答

BAD场景:面试官问"你怎么看Didi当前面临的监管环境对数据科学工作的影响",候选人回答"我不太了解具体政策,但如果我入职会尽快学习"。

GOOD场景:同一问题,候选人回答:"2021年的下架事件和后续整改,实际上推动了Didi数据治理的规范化。我看到的一个具体影响是,司机和乘客数据的采集边界变得更清晰,这要求我们在特征工程阶段就更早地考虑隐私计算方案,比如联邦学习在司机收入预测中的应用。我在XX项目中有过类似经验……"

这个GOOD版本的关键在于:它不回避问题的敏感性,而是将外部挑战转化为具体的技术机会,同时自然地带出了自己的相关经验。


FAQ

Q1: 我没有互联网大厂经验,只有传统行业的数据分析背景,还有机会吗?

有机会,但你需要重构叙事逻辑。Didi面试官曾经录用过一位来自电信运营商的候选人,他的背景是"网络流量预测",看起来和打车无关。但他的作品集做了两件事:第一,他明确类比了"电信基站负载均衡"与"网约车供需匹配"的结构性相似——都是空间分布不均的资源调度问题,都需要预测峰值并提前部署;第二,他展示了在传统行业内部推动"数据驱动决策"的完整经历,包括如何说服没有数据背景的业务负责人接受模型建议。

Didi在乎的不是你之前在哪,而是你是否具备"把数据翻译成行动"的成熟能力。一个具体的操作是:在简历中突出你主导过的"跨部门协作"经历,哪怕是在传统行业,这比单纯的技术深度更能弥补互联网经验的缺失。如果你投递的是国际化业务线,传统行业甚至可能是优势——巴西、墨西哥等市场的基础设施和支付方式更接近传统电信/金融系统的复杂度。

Q2: Didi的DS岗位和算法工程师岗位有什么区别?我该怎么选?

这是一个经常被混淆但至关重要的问题。Didi的DS岗位核心是"用数据回答业务问题",工具箱包括统计分析、机器学习、实验设计,但输出物通常是分析报告、策略建议、或轻量级的模型原型;算法工程师岗位则是"把模型变成系统",需要深入理解工程架构、优化在线服务的延迟和吞吐量、处理大规模分布式计算。一个判断标准是:如果你的兴奋点在于"这个问题值不值得建模"、"这个指标能不能准确衡量业务目标",你更适合DS;如果你的兴奋点在于"如何把模型推理延迟从100ms压到10ms"、"如何在十亿级特征规模下保持训练稳定性",你更适合算法工程师。

在职业发展上,Didi的DS路径更偏向"业务决策合伙人",最终可能成长为某个业务线的首席数据官角色;算法工程师路径更偏向"技术架构负责人",最终可能成长为某个核心系统(如定价引擎)的技术负责人。两条路径的薪资天花板在资深级别后趋同,但前5年的能力积累方向截然不同。一个常见的后悔是:选了DS但实际想做工程,或选了算法但实际想和业务深度绑定——这需要在投递前就做好自我认知。

Q3: Didi的国际化业务线DS和国内业务线相比,有什么特殊考量?

国际化业务线(主要是巴西的99、墨西哥的DiDi Movil)是当前Didi的战略重点,也是数据科学家相对稀缺的领域。特殊考量有三层:第一层是数据基础设施的差异,巴西和墨西哥的地图精度、支付成功率、网络稳定性都与中国有显著差距,这意味着你的模型需要更强的鲁棒性设计,不能假设数据质量的一致性;第二层是本地化特征的复杂度,比如巴西的治安问题导致夜间出行模式与中国截然不同,墨西哥的现金支付比例极高使得"支付成功率"这个指标的定义和优化路径完全不同;第三层是组织协作的挑战,国际化团队分布在北京、圣保罗、墨西哥城,时差和文化差异要求你具备异步沟通和跨文化协作的能力。

一个具体的面试变化是:国际化业务线的面试官更常问"如果你只有巴西某城市7天的数据,如何快速判断该城市的供需特征"——这个问题考察的不是技术能力,而是在信息有限情况下的快速诊断和假设检验能力。如果你有意国际化业务线,建议在作品集中至少包含一个"数据受限场景"的案例,展示你如何在样本量小、质量不稳定的情况下做出可靠推断。国际化业务线的薪资结构与国内基本一致,但通常包含额外的外派补贴和更灵活的休假政策,总包竞争力在Didi内部属于第一梯队。


Didi数据科学家的竞争本质是一场"业务翻译能力"的筛选。你的简历和作品集不是技术能力的陈列柜,而是商业洞察的投射屏——它需要在6秒内让面试官相信:这个人理解我们真正面临的问题,并且有过在复杂约束下推动落地的经历。2026年的招聘市场不会变得更容易,但清晰认知到这一点的人,已经比绝大多数候选人领先了一个身位。


准备好系统化备战PM面试了吗?

获取完整面试准备系统 →

也可在 Gumroad 获取完整手册。

相关阅读