← 返回岗位列表

美团

校招

【北斗】大模型训推引擎工程师(后训练/推理方向)

北京/上海 · 校招 · 2027 届 · 本科

长期有效

任职要求

  • 【任职资格】
  • 必备项:
  • 1.2027届本科及以上学历,计算机、人工智能等相关专业;
  • 2.具备良好的计算机基础素养和分析解决问题的能力,熟练掌握C/C++或Python编程语言;
  • 3.学习能力强,对AI Infra方向有技术热情,富有极客精神;
  • 4.具备扎实的机器学习和深度学习基础,熟悉GPU、NPU硬件架构,熟悉CUDA,CCL,RDMA或者任意机器学习DSL;
  • 5.具有良好的沟通协作能力,工作积极主动。
  • 加分项:
  • 1.具备有影响力的大规模分布式系统、高性能计算项目经验;
  • 2.在OSDI、SOSP、NSDI、MLSys、ICML、ICLR、NeurIPS等等顶级会议上有论文发表;
  • 3.在高影响力开源项目(如vLLM/SGLang/Megatron/verl等)有核心代码贡献。
  • 【愿景】
  • 打造全球领先的本地生活智能平台,让每一次搜索和推荐都精准理解用户需求,从被动匹配走向主动认知推理。我们致力于成为大模型在搜索与推荐场景落地的标杆团队,推动行业从传统深度模型向生成式智能的范式跃迁,用AI能力重新定义下一代生活服务入口。
  • 【为什么是我们】
  • 1.顶级算力资源:超大规模GPU集群,充足的算力支持你的大胆想法;
  • 2.极致技术挑战:工作内容直面AI Infra方向最前沿的技术问题;
  • 3.强化开源影响:支持深度参与AI Infra方向顶级开源项目,建设开源社区影响力;
  • 4.开放研究氛围:鼓励论文发表,支持参加顶会,与学术界保持紧密合作。

岗位描述

【岗位职责】

方向一:面向Agent RL的LLM分布式后训练系统

  • 1.多模态与超长上下文训练优化:针对万级以上超长序列(Long Context)及多模态输入,研究高效的上下文并行(CP/SP)、序列并行策略及分布式通信拓扑,优化内存足迹,支撑长文本与复杂多模态后训练。
  • 2.计算资源弹性调度与容错容灾:研究超大规模集群下的弹性训练技术(Elastic Training),实现节点动态加入/退出、无感故障自动恢复(Fault Tolerance)与训练超参数自动寻优,提升集群算力有效利用率(MFU)。
  • 3.Agent RL算法基础设施:构建面向Agent强化学习的高效Rollout引擎、多模型(Policy/Value/Reward/Reference)多阶段流水线编排及动态负载均衡机制;设计并建设支持高并发、低延迟的工具调用(Tool-use)虚拟环境/沙箱模拟器交互系统。
  • 4.训推一致性协同设计(Co-design):打通训练与推理底层架构,研究在后训练阶段(如在线RL、Iterative DPO)如何实现训练框架与高性能推理引擎的深度融合,降低在线反馈延迟,实现训推一体化高效演进。

方向二:大模型高效推理与加速技术

  • 1.面向Agent场景的动态推理架构:针对Agent多轮对话、工具调用等复杂交互带来的极致动态性,研究智能KV Cache管理优化策略(如动态复用、分级存储、长短时记忆重组),解决长序列及高并发下的显存瓶颈。
  • 2.极致模型压缩:研究前沿的模型压缩技术,包括先进的高比例量化(INT4/FP4/低比特混合精度)、结构化/非结构化稀疏(Sparsity),并开发对应的硬件友好型Mega算子,压榨硬件极限性能。
  • 3.下一代投机采样技术: 深入研究并落地最前沿的解码加速技术,包括Draft-Target分离部署架构、Structured Speculative Decoding等异构投机采样方案;探索多Token预测(MTP)在线联合验证、无轻量模型依赖的自投机(Self-Speculative)等免草稿模型加速路径。
  • 4.前沿推理系统深度开发:跟踪并引领AI Infra业界最新进展,深度参与并优化主流开源推理框架,进行架构级的核心代码重构、极致的通信优化与算子融合,推动最新infra成果在核心业务的高效落地。

【任职要求】

【任职资格】

必备项:

  • 1.2027届本科及以上学历,计算机、人工智能等相关专业;
  • 2.具备良好的计算机基础素养和分析解决问题的能力,熟练掌握C/C++或Python编程语言;
  • 3.学习能力强,对AI Infra方向有技术热情,富有极客精神;
  • 4.具备扎实的机器学习和深度学习基础,熟悉GPU、NPU硬件架构,熟悉CUDA,CCL,RDMA或者任意机器学习DSL;
  • 5.具有良好的沟通协作能力,工作积极主动。

加分项:

  • 1.具备有影响力的大规模分布式系统、高性能计算项目经验;
  • 2.在OSDI、SOSP、NSDI、MLSys、ICML、ICLR、NeurIPS等等顶级会议上有论文发表;
  • 3.在高影响力开源项目(如vLLM/SGLang/Megatron/verl等)有核心代码贡献。

【愿景】

打造全球领先的本地生活智能平台,让每一次搜索和推荐都精准理解用户需求,从被动匹配走向主动认知推理。我们致力于成为大模型在搜索与推荐场景落地的标杆团队,推动行业从传统深度模型向生成式智能的范式跃迁,用AI能力重新定义下一代生活服务入口。

【为什么是我们】

  • 1.顶级算力资源:超大规模GPU集群,充足的算力支持你的大胆想法;
  • 2.极致技术挑战:工作内容直面AI Infra方向最前沿的技术问题;
  • 3.强化开源影响:支持深度参与AI Infra方向顶级开源项目,建设开源社区影响力;
  • 4.开放研究氛围:鼓励论文发表,支持参加顶会,与学术界保持紧密合作。

你的简历匹配这个岗位吗?

上传简历,AI 会对照这份 JD 指出你的差距和需要补强的地方

该岗位可能会问的问题

基于 算法 岗位的常见面试问题整理

请解释 Transformer 模型的自注意力机制(Self-Attention)

类型专业能力·难度困难
查看答题思路

1. Self-Attention = 序列中每个 token 与所有 token 计算相关性权重 2. Q=Wq·x, K=Wk·x, V=Wv·x; Attention(Q,K,V)=softmax(QK^T/√d_k)V 3. 除以 √d_k 防止点积过大导致 softmax 梯度消失 4. 多头注意力:多组 QKV 并行,拼接后线性变换,捕获不同子空间特征 5. 对比 RNN:可并行计算,捕获长距离依赖

你做过的最有深度的算法/模型项目是什么

类型项目经历·难度中等
查看答题思路

1. 一句话说清任务:分类/生成/检索/推荐 2. 模型选型:为什么选这个而非那个 3. 数据:数据量、来源、清洗策略 4. 创新点:你做的改进是什么(不是调参) 5. 结果:核心指标提升(准确率/召回/延迟)

过拟合是什么?怎么判断和解决

类型专业能力·难度简单
查看答题思路

1. 过拟合=训练集表现好、验证集表现差,模型记住了噪声 2. 判断:train loss 持续下降而 val loss 上升 3. 解决:更多数据 / 正则化(L1/L2) / Dropout / 早停 / 数据增强 / 降低模型复杂度

解释梯度下降的原理,SGD 和 Adam 的区别

类型专业能力·难度中等
查看答题思路

1. 梯度下降:沿负梯度方向更新参数,使损失降低 2. SGD:每次用随机小批量估算梯度,引入随机性帮助跳出局部最优 3. Adam = Momentum + RMSProp:自适应学习率 + 动量加速 4. Adam 收敛快但可能泛化不如 SGD;CV 常用 SGD,NLP 多用 Adam

给你 10 万条未标注的文本数据,如何找出其中 10 个主题

类型情景/案例·难度中等
查看答题思路

1. 预处理:分词、去停用词 2. 向量化:TF-IDF 或 Sentence Embedding 3. 聚类:K-Means(需指定 K=10)或 HDBSCAN(自动确定类数) 4. 或 LDA 主题模型直接输出主题-词分布 5. 评估:看每个簇的高频词判断主题合理性,迭代调整

更多面试题库功能即将上线

信息来源:企业官方招聘页。投递前请以官网信息为准。