职位描述:

1.研发行业领先且实用的音频/音乐多模态算法,包括但不限于文生音频/音乐、视频音效/音乐生成、音频/音乐编辑、基于歌词/发音人 prompt/哼唱等条件的歌曲生成、交互式音频/音乐内容创作、音乐信息检索等方向;

2.跟进并调研国内外前沿的音频、音乐多模态生成与编辑技术,协助团队完成相关算法的设计、实现与优化;

3.协助完成数据处理、模型训练、效果评估等实验工作,并产出高质量的实验报告与技术文档;

4.积极参与团队讨论,配合工程同事推动算法落地;

5.参与开源项目、技术论文撰写、专利申请等工作,持续打造业界的技术口碑及影响力。


任职要求:

1.计算机、人工智能、电子信息、声学、音乐工程等相关专业硕士及以上学历(具有相关科研经历的优秀本科生亦可考虑);

2.具备良好的编程能力,熟练使用 Python,熟悉 PyTorch 等主流深度学习框架,熟练使用 C++/ Python编程、Linux 开发环境;

3.具备良好的英文文献阅读能力,能够主动学习和跟进前沿技术动态;

4.熟悉深度学习、信号处理等相关理论知识,具备音频处理、音乐生成、语音识别、语音合成、音频特征提取等相关项目/研究经验者优先;熟悉音频 Codec(如 VQ、RVQ、Encodec、DAC 等)、LLM(如 LLaMA、Qwen 等开源模型)、Diffusion/Flow Matching(如 Stable Audio、F5TTS、MMAudio 等)、Vocoder(如 HiFi-GAN、BigVGAN 等)等行业主流算法者优先;熟悉大模型预训练/微调/后训练等训练策略者优先;

5.有顶会/期刊论文者优先,如 ACL/ACMMM/ICASSP/INTERSPEECH/CVPR/ECCV/ICCV/NeurIPS/ICLR/ICML/TASLP/TMM/PAMI 等,在重要算法比赛中取得过优秀名次的候选人优先;

6.对技术前沿有浓厚兴趣,善于利用各类技术解决复杂实际问题,强烈的自驱力,良好沟通表达及的团队协作能力优先。7.要求实习至少 6 个月以上,可长期实习者优先。


【工作地点】北京/上海,北京优先

【联系方式】邮箱:dadinghh2@gmail.com