返回职位列表
元理智能

大模型后训练(Post-Training)算法研究员

¥40k – ¥70k/月 · 15薪 + 期权bei'jing · 杭州全职今天发布

职责

1. 自动化合成数据与知识注入(Data Synthesis & Distillation):

针对 B 端高门槛领域知识与稀缺标注,构建基于 Model-generated Data 的高质量合成数据流水线(Data Synthesis),设计数据去噪、去偏与对齐机制,实现企业专有 Domain Knowledge 的高效注入。

2. 渐进式课程学习(Curriculum Learning)方案设计:

针对复杂的企业多步逻辑,设计从简单任务到综合业务场景的渐进式 Post-Training 路径,优化 SFT/Alignment 阶段的损失函数与采样策略,提升模型在长上下文(Long-context)与复杂 CoT 推理上的泛化能力。

3. Agent 专项能力微调(SFT for Agent Capabilities):

围绕 Tool Calling、MCP(Model Context Protocol)、多模态交互及自动提示工程(AutoPE),设计精细化的 Instruction Tuning 方案,为上层 RL 训练提供具备高遵循度与鲁棒性的基座模型。

4. 动态闭环评估引擎(Dynamic Evaluation Engine):

构建贴合真实业务流的动态 Agent 评测基准(Benchmark),打破静态数据集评测的局限,建设“数据合成-后训练-在线评估-真实反馈”的端到端 Flywheel 飞轮。

能力要求

1. 敏锐的数据品味与数据工程能力(Data-centric AI):

深谙“Data is the new code”,具备从海量非结构化 Enterprise Logs 与业务规则中自动化提炼、构造高质量 Instruction & CoT 对话的技术方案力。

2. 深厚的 Post-Training 算法与工程功底:

精通 Megatron-LM、DeepSpeed、Llama-Factory 等分布式训练框架,对 SFT、Alignment(DPO/ORPO/KTO 等)、Quantization 及 Data Pruning 的底层机制有深刻理解。

3. 严谨的系统抽象与评估思维:

能将业务场景中模糊、非结构化的成功标准(如合同审核准确率、客服转化率),精准转化为可量化、可自动迭代的数据构造规则与评测基准。

加分项(选填)

  1. 拥有大模型 Post-Training(SFT/Alignment/Quantization)的实际调优与上线经验。

  2. 在合成数据(Data Synthesis)、AutoPE(自动提示工程)或 Teacher-Student 模型蒸馏方向有深度研究或顶会论文(NeurIPS、ICML、ICLR、ACL 等)。

  3. 熟悉企业级数据栈(Enterprise Data Stack),具有 Agent 知识库/RAG/MCP 工具链数据集建构的成功实践。

团队的其他职位
了解这群人
元理智能
构建自进化 智能体员工 重塑企业数字生产力
bei'jing · 杭州