大模型后训练(Post-Training)算法研究员
职责
1. 自动化合成数据与知识注入(Data Synthesis & Distillation):
针对 B 端高门槛领域知识与稀缺标注,构建基于 Model-generated Data 的高质量合成数据流水线(Data Synthesis),设计数据去噪、去偏与对齐机制,实现企业专有 Domain Knowledge 的高效注入。
2. 渐进式课程学习(Curriculum Learning)方案设计:
针对复杂的企业多步逻辑,设计从简单任务到综合业务场景的渐进式 Post-Training 路径,优化 SFT/Alignment 阶段的损失函数与采样策略,提升模型在长上下文(Long-context)与复杂 CoT 推理上的泛化能力。
3. Agent 专项能力微调(SFT for Agent Capabilities):
围绕 Tool Calling、MCP(Model Context Protocol)、多模态交互及自动提示工程(AutoPE),设计精细化的 Instruction Tuning 方案,为上层 RL 训练提供具备高遵循度与鲁棒性的基座模型。
4. 动态闭环评估引擎(Dynamic Evaluation Engine):
构建贴合真实业务流的动态 Agent 评测基准(Benchmark),打破静态数据集评测的局限,建设“数据合成-后训练-在线评估-真实反馈”的端到端 Flywheel 飞轮。
能力要求
1. 敏锐的数据品味与数据工程能力(Data-centric AI):
深谙“Data is the new code”,具备从海量非结构化 Enterprise Logs 与业务规则中自动化提炼、构造高质量 Instruction & CoT 对话的技术方案力。
2. 深厚的 Post-Training 算法与工程功底:
精通 Megatron-LM、DeepSpeed、Llama-Factory 等分布式训练框架,对 SFT、Alignment(DPO/ORPO/KTO 等)、Quantization 及 Data Pruning 的底层机制有深刻理解。
3. 严谨的系统抽象与评估思维:
能将业务场景中模糊、非结构化的成功标准(如合同审核准确率、客服转化率),精准转化为可量化、可自动迭代的数据构造规则与评测基准。
加分项(选填)
拥有大模型 Post-Training(SFT/Alignment/Quantization)的实际调优与上线经验。
在合成数据(Data Synthesis)、AutoPE(自动提示工程)或 Teacher-Student 模型蒸馏方向有深度研究或顶会论文(NeurIPS、ICML、ICLR、ACL 等)。
熟悉企业级数据栈(Enterprise Data Stack),具有 Agent 知识库/RAG/MCP 工具链数据集建构的成功实践。