返回职位列表

算法工程

薪资面议上海全职1 天前

岗位职责

  1. 负责大模型与多模态模型在生产环境中的推理落地,包括文本、图像理解、语音识别、语音合成等能力的服务化与批处理化。

  2. 建设面向大规模数据生产的分布式推理系统,将模型能力接入数据清洗、标注、理解、生成等流程。

  3. 基于 Ray 设计和优化数据处理链路,解决任务调度、资源隔离、批量推理、失败恢复、结果落盘等工程问题。

  4. 针对不同模型形态设计合理的部署方案,提升 GPU 利用率、任务并发度和端到端数据吞吐。

  5. 优化推理链路性能,包括 batching、并发控制、显存管理、模型加载策略、队列调度和多节点扩展。

  6. 建设监控、日志、性能评估和稳定性机制,保障长周期、大规模数据任务可靠运行。

  7. 与算法、数据和平台团队协作,把模型能力沉淀为可复用的数据生产基础设施。

  任职要求

  1. 熟悉 Python,有扎实的后端或基础设施工程经验。

  2. 理解分布式任务调度、批处理系统或模型推理服务中的常见工程问题。

  3. 熟悉 Ray 生态中的至少一部分,如 Ray Core、Ray Data、Ray Serve,有实际项目经验优先。

  4. 有模型部署经验,了解 vLLM、Triton、TensorRT、ONNX Runtime、FastAPI 等常见推理或服务化方案中的一种或多种。

  5. 理解 GPU 资源调度、显存占用、吞吐率、延迟、batch size、并发数之间的权衡。

  6. 能独立排查线上任务失败、性能瓶颈、资源争抢和稳定性问题。

  加分项

  1. 熟悉 Kubernetes,了解容器化部署、GPU 调度、服务发现、弹性伸缩等机制。

  2. 有 KubeRay 使用或运维经验,熟悉 Ray 集群在 K8s 上的部署、升级和稳定性保障。

  3. 有大规模离线数据处理、自动化标注、多模态数据管线或模型驱动数据生产经验。

  4. 熟悉大模型推理优化,如量化、KV Cache、continuous batching、多卡推理、模型并行等。

  5. 有构建内部 AI 平台、推理平台或数据生产平台的经验。

团队的其他职位
了解这群人
AutoArk(无界方舟)
端云一体的语音 AI Infra 公司——自研语音模型登上 Hugging Face 全球语音榜、全尺寸模型 SOTA 第一,旗下早教品牌"奇多多星球"获 CCTV 报道、多平台销量 TOP1。
20-50 人·远程 · 上海 · 深圳 · 珠海 · 杭州