返回职位列表

AI大模型后训练研究工程师

¥30k – ¥60k/月ShanghaiJunior / Senior全职10 天前

岗位定位:

该岗位以 Agent 能力为核心,负责通过后训练系统性提升大模型在代码与软件工程、工具使用、多轮任务执行、长程规划与真实环境交互等典型 Agent 场景中的综合表现,综合运用 SFT、偏好优化、强化学习、蒸馏与数据合成等多种手段,建设可持续迭代的后训练体系。

岗位职责:

1、围绕 Agent 能力 的后训练算法研发:综合运用 SFT、偏好优化(DPO/GRPO)、Reward Modeling、强化学习(含 agentic RL)、蒸馏与数据合成等手段,针对多轮、工具调用、长任务等场景选择并组合合适的方法。

2、设计 Agent 轨迹(trajectory)数据、工具调用与偏好数据,搭建面向 tool-use 与 coding agent 的自动化评测与 sandbox 环境(如 SWE-bench、Terminal-Bench 等代码 / 终端类基准)。

3、构建 Agent 后训练闭环:从环境/sandbox 构建、轨迹采集、训练实验、效果评估到线上反馈,持续提升模型在真实 Agent 任务中的稳定性与泛化能力。

4、围绕代码与软件工程、工具调用、MCP、多轮规划与执行等方向,把模型能力落到可交付的 Agent 产品、企业场景与行业解决方案中。

5、跟踪 agentic RL、tool-use、MCP、推理与代码模型等前沿研究与开源进展,形成内部可执行的技术判断与方法沉淀。

任职要求:

1、机器学习、计算机、数学、统计或相关专业背景,具备扎实的深度学习与大模型训练基础。

2、在 SFT、偏好优化、强化学习、蒸馏、数据合成或模型评测中至少一个方向有完整实验闭环经验,有面向 Agent场景的后训练经验者优先。

3、熟练使用 PyTorch、Transformers、DeepSpeed/FSDP、Ray 等训练框架,了解 Verl、Slime、AReal 等 RL 训练框架者优先,具备较强工程实现能力。

4、能独立拆解开放问题,设计实验、分析结果,并基于数据做出清晰技术判断。

5、具备良好的论文与英文技术资料阅读能力,能持续跟踪前沿方法并判断其落地价值。

加分项

1、有面向 Agent 的后训练(SFT、偏好优化、agentic RL、蒸馏等)、coding agent、工具调用 / MCP、代码或推理模型相关项目经验。

2、有 tool-use 评测、sandbox 环境或 Agent benchmark(如 SWE-bench、Terminal-Bench、Toolathlon 等)搭建/评测经验。

3、有高质量论文、开源项目、竞赛成绩或大模型/Agent 产品化经验。

4、熟悉数据合成、自动化评测、LLM-as-a-Judge、训练数据治理或模型安全对齐。

团队的其他职位
了解这群人
StartLux 原点星辉|本地 AI、本地大模型与本地智能体
面向个人设备与本地工作站研发本地大模型,为端侧 AI、本地个
51-200 人