AI大模型后训练研究工程师
岗位定位:
该岗位以 Agent 能力为核心,负责通过后训练系统性提升大模型在代码与软件工程、工具使用、多轮任务执行、长程规划与真实环境交互等典型 Agent 场景中的综合表现,综合运用 SFT、偏好优化、强化学习、蒸馏与数据合成等多种手段,建设可持续迭代的后训练体系。
岗位职责:
1、围绕 Agent 能力 的后训练算法研发:综合运用 SFT、偏好优化(DPO/GRPO)、Reward Modeling、强化学习(含 agentic RL)、蒸馏与数据合成等手段,针对多轮、工具调用、长任务等场景选择并组合合适的方法。
2、设计 Agent 轨迹(trajectory)数据、工具调用与偏好数据,搭建面向 tool-use 与 coding agent 的自动化评测与 sandbox 环境(如 SWE-bench、Terminal-Bench 等代码 / 终端类基准)。
3、构建 Agent 后训练闭环:从环境/sandbox 构建、轨迹采集、训练实验、效果评估到线上反馈,持续提升模型在真实 Agent 任务中的稳定性与泛化能力。
4、围绕代码与软件工程、工具调用、MCP、多轮规划与执行等方向,把模型能力落到可交付的 Agent 产品、企业场景与行业解决方案中。
5、跟踪 agentic RL、tool-use、MCP、推理与代码模型等前沿研究与开源进展,形成内部可执行的技术判断与方法沉淀。
任职要求:
1、机器学习、计算机、数学、统计或相关专业背景,具备扎实的深度学习与大模型训练基础。
2、在 SFT、偏好优化、强化学习、蒸馏、数据合成或模型评测中至少一个方向有完整实验闭环经验,有面向 Agent场景的后训练经验者优先。
3、熟练使用 PyTorch、Transformers、DeepSpeed/FSDP、Ray 等训练框架,了解 Verl、Slime、AReal 等 RL 训练框架者优先,具备较强工程实现能力。
4、能独立拆解开放问题,设计实验、分析结果,并基于数据做出清晰技术判断。
5、具备良好的论文与英文技术资料阅读能力,能持续跟踪前沿方法并判断其落地价值。
加分项
1、有面向 Agent 的后训练(SFT、偏好优化、agentic RL、蒸馏等)、coding agent、工具调用 / MCP、代码或推理模型相关项目经验。
2、有 tool-use 评测、sandbox 环境或 Agent benchmark(如 SWE-bench、Terminal-Bench、Toolathlon 等)搭建/评测经验。
3、有高质量论文、开源项目、竞赛成绩或大模型/Agent 产品化经验。
4、熟悉数据合成、自动化评测、LLM-as-a-Judge、训练数据治理或模型安全对齐。
