返回职位列表

AI推理基础设施工程师(推理引擎方向)

¥30k – ¥60k/月ShanghaiJunior / Senior全职10 天前

岗位定位:

负责研发面向桌面端、移动端及边缘设备的大模型推理框架、运行时与性能优化能力。

该岗位负责打造公司在大模型端侧推理方向的核心基础设施,支持大语言模型、多模态模型及其他 Transformer 模型在不同硬件、操作系统和产品形态中的高效运行。

我们关注的不只是使用现有推理框架,而是深入理解模型推理、运行时和硬件执行机制,参与框架核心模块、新模型适配、低比特执行和性能优化能力的研发,逐步形成可控、可适配、可持续演进的自研端侧推理框架。。

岗位职责:

1、设计并实现端侧推理框架核心模块,包括模型加载、权重管理、计算图执行、算子调度、KV Cache、内存管理、流式生成和并发执行。面向 CPU、GPU、统一内存架构及边缘设备开展性能优化,持续改善模型加载速度、首 Token 延迟、Prefill/Decode 吞吐、内存占用、功耗和运行稳定性。

2、深入开发和优化 llama.cpp、MLX/MLX-LM 等开源推理框架,完成新模型适配、量化格式接入、运行时扩展、推理服务开发和产品集成。研究并落地 Prefix Cache、Continuous Batching、Chunked Prefill、计算图优化和算子融合等推理技术。

3、支持 Weight-only、Weight-Activation 和 KV Cache 等量化方案,打通 GGUF、INT8、INT4、FP8/FP4 等低比特格式与推理运行时、算子执行之间的链路。

4、建设模型转换、量化、Benchmark、效果验证、性能回归和版本发布工具链,保障不同模型、设备和运行环境下的正确性、稳定性与可复现性。

5、研究并借鉴 MLC-LLM、ExecuTorch、ONNX Runtime 等端侧框架,以及 vLLM、SGLang、TensorRT-LLM 等云端框架的架构与优化思路,推动前沿技术在公司产品和自有框架中落地。

6、与模型算法、量化算法、Agent 工程和产品团队协作,为本地知识库、代码助手、文档处理和多模态 Agent 等产品提供稳定的推理 API、SDK 与运行时能力。

任职要求:

1、熟练掌握 C++,具备扎实的系统编程、性能优化和工程调试能力;熟悉 Python 工具链。

2、深入理解 Transformer 推理流程,熟悉 Attention、RoPE、GQA/MQA、MoE、KV Cache、Batching、Sampling 和自回归生成等关键机制。

3、熟悉 llama.cpp、GGML 和 GGUF 生态,具备模型转换、量化、新模型适配、推理服务开发或源码修改经验。

4、熟悉 MLX/MLX-LM,理解统一内存、Lazy Evaluation、计算图编译、CPU/GPU 协同和 Metal 后端等机制,具备模型推理、量化或框架扩展经验。

5、具备系统化的性能 Profiling 能力,能够围绕 TTFT、Tokens/s、Prefill/Decode 吞吐、内存带宽和资源利用率定位性能瓶颈。

6、熟悉大模型量化与压缩,理解不同位宽、量化格式和量化粒度对模型精度、内存占用及推理性能的影响。

加分项:

1、参与过推理引擎、模型运行时、端侧推理框架或高性能计算框架开发。

2、熟悉 fastllm、llama.cpp、vLLM、SGLang、TensorRT-LLM、MLC-LLM、ONNX Runtime 等项目。

3、有昇腾、寒武纪、沐曦、燧原、海光、昆仑芯等国产 AI 芯片适配经验,或具备跨硬件推理优化经验。

团队的其他职位
了解这群人
StartLux 原点星辉|本地 AI、本地大模型与本地智能体
面向个人设备与本地工作站研发本地大模型,为端侧 AI、本地个
51-200 人