语音算法工程师
岗位职责
• 研发与迭代语音识别(ASR)模型,优化流式架构与解码策略,提升复杂声学场景下的准确率与实时性。
• 建设说话人相关能力,包括说话人识别、说话人聚类与说话人日志。
• 负责大规模语音数据的清洗、对齐、难例挖掘与配比设计,建设自动化流水线和 Bad Case 回流机制。
• 建立语音模型评测体系,覆盖客观指标与主观听测。
• 研究数据、模型与算力的 Scaling 规律,提升大规模分布式训练效率。
岗位要求
• 计算机、电子信息、通信、人工智能等相关专业,本科及以上学历。
• 3 年及以上语音算法或相关工业研发经验。
• 在 ASR、TTS、实时语音交互中,至少一个方向有深入项目经验。
• 深入理解 CTC、RNN-T、Attention、Conformer 等 ASR 架构。
• 掌握数字信号处理基础,熟悉 FFT、MFCC、Mel Spectrogram 等语音特征。
• 熟练使用 Python 和 PyTorch,能够完成从算法原型到产品部署的落地。
• 具备大规模线上语音系统开发经验,能够独立完成数据构建、训练、评测、部署与 Bad Case 迭代。
• 具备良好的英文论文阅读能力,持续关注 Interspeech、ICASSP 等顶会顶刊进展。
加分项
• 熟悉模型量化、剪枝,具备 GPU 推理优化或流式识别系统开发经验。
• 具备全双工或流式语音对话系统的实际项目经验,熟悉 WebSocket、WebRTC。
• 具备优化语音识别解码器并实际落地的经验。
• 熟悉 LoRA、SFT、DPO、PPO、GRPO、RLHF 等后训练方法。
• 具备 Neural Audio Codec 或低码率音频压缩相关经验,理解语音表征的因子分解。
• 在相关国际会议或主流期刊上发表论文(ICASSP、Interspeech、ASRU、IEEE/ACM Transactions 等)。
• 语音相关比赛或机器学习相关比赛名列前茅;具备 ACM/NOI/IOI/TopCoder 等编程比赛获奖经历。
