📮ex头部AI厂商HRBP➡️百万顾问➡️ai猎头公司founder
缺一位多模态算法工程师
💰100-150W
🌎base上海
欢迎自荐OR推荐,推荐🧧2-4W
岗位职责:
1. 模型研发与微调: 负责视频创作领域大模型的 SFT(指令微调)工作,构建高质量的数据集,提升模型对用户意图的理解及剪辑动作预测的准确性。
2. 强化学习对齐: 引入强化学习(如 PPO、DPO 或针对序列决策的 RL 算法),基于美学评分、用户留存或专家反馈,优化剪辑序列的合理性与艺术性,实现模型与专业剪辑逻辑的对齐。
3. 多模态信号重构: 构造面向音视频理解的多模态训练数据表征,将非结构化的视频/音频流转化为模型可学习的行为信号。
4. 前沿技术探索: 跟踪多模态大模型(VLM)、视频生成、等领域的前沿进展,将 Sora/Kling 等生成式能力与非线性编辑(NLE)逻辑相结合。
5. 架构与性能优化: 主导模型架构的演进,解决超长视频序列建模、多模态对齐及推理延迟问题,确保算法在实际编辑器产品中的落地效果。
任职要求:
1. 技术功底: 计算机、人工智能相关专业硕士及以上学历。扎实的机器学习/深度学习基础,精通 PyTorch 或 JAX 框架。
2. 大模型经验:
- 深入理解 Transformer 架构,有大规模参数模型 SFT(全量或 LoRA/QLoRA) 的实战经验。
- 熟悉 RL(强化学习) 基本原理,有 DPO、PPO 或相关对齐算法落地经验者优先。
3. 多模态能力: 熟悉视频理解、音视频对齐或多模态表征学习,对“视频-语言-动作” (VLA) 模型有思考。
4. 聪明与高潜: 具备极强的逻辑思考能力,能从第一性原理出发解决问题;学习速度快,能迅速切入音视频剪辑这一细分业务领域。
加分项:
- 跨界思维: 有过视频理解(Temporal Modeling)与生成(Diffusion/Sora-like)结合的经验。
- 0→1 的破局力: 在数据匮乏或非标准场景下,有通过合成数据(Synthetic Data)或弱监督学习解决问题的成功案例。
- 产品直觉: 自己是剪辑软件(PR/Final Cut/剪映)的高阶玩家,或对内容创作生态有深刻理解。
- 学术/竞技光环: 在顶级会议(CVPR/ICLR/NeurIPS)有高质量产出,或在相关领域算法竞赛中取得过顶尖成绩。
- 行业热情: 是音视频产品(抖音、B站、YouTube等)的热衷用户。如果你本身就是剪辑爱好者、Vlogger 或对影视后期技术有浓厚兴趣,将是极大的加分项。