上海岩芯数智人工智能科技有限公司(简称RockAI)成立于2023年6月,以“让世界上每一台设备拥有自己的智能”为使命,于2024年1月发布国内首个非Attention机制大模型Yan1.0。

2024年7月发布国内首个非Transformer架构终端多模态大模型Yan1.2,并亮相WAIC2024。2024年9月,正式发布全新升级的群体智能单元大模型Yan1.3,并在现场对机器人、无人机、PC、手机等多终端设备做真实演示。采用非Transformer架构的Yan1.3大模型,可高效处理图文及语音等多模态信息,广泛适配于树莓派、无人机、机器人、PC、手机等各类终端设备。目前已提交专利申请超过50项,涵盖大模型的模型结构设计、算法改进、预训练、微调等核心环节。

招聘岗位

音频算法专家(TTS)

工作职责:
1、负责公司多模态模型的音频实时交互算法模块的开发与优化,聚焦端到端的音频合成技术。
2、立足多模态,开展数据工程、网络结构设计、模型训练等工作,设计和优化声学模型、语言模型,推进算法在终端设备上的应用,确保语音交互的流畅性。
3、探索业界前沿算法,持续创新和突破,建设全模态实时人机交互系统,保持行业领先水平。

任职资格:

1、计算机相关专业,硕士及以上学历,3年及以上深度学习的项目经验。
2、有音频多模态领域的算法经验,熟悉TTS、ASR等结构和原理,有较强的算法设计、编程实现和模型训练能力。
3、熟练使用Python/C++,熟悉Linux开发环境和Shell,熟悉Pytorch框架以及分布式训练。
4、具备钻研精神和创造力,有较强的分析问题解决问题能力,工作踏实上进,有良好的团队合作意识。
5、在顶级会议发表过学术论文者或在国际竞赛取得优异成绩者优先。

音频算法工程师

工作职责:

1、研究和优化语音识别(ASR)、语音合成(TTS)等任务,提升音频相关任务的准确性和生成质量。

2、研究跨模态语音-文本-图像融合技术,优化语音与视觉、文本等任务的协同学习能力。

3、结合深度学习方法(如 Conformer、HuBERT、Whisper)进行音频数据建模,提高低资源语言及复杂场景下的语音识别能力。

任职资格:

1、计算机、人工智能、电子信息等相关专业,硕士及以上学历,具备 2 年及以上深度学习研究或项目经验。

2、精通 Python,熟练使用 PyTorch 或 TensorFlow 进行深度学习模型开发,掌握 C++ 者优先。

3、有音频多模态领域的算法经验,熟悉TTS、ASR等结构和原理,有较强的算法设计、编程实现和模型训练能力。

4、具备扎实的数学和算法基础,能够阅读和复现前沿论文,并将研究成果应用于实际问题。

5、具有团队合作精神,良好的沟通能力和独立解决问题的能力。

语音大模型算法实习生

工作职责:

1、结合语音识别、语音合成、前端信号处理等模型工具参与语音数据质量迭代pipeline的研发,持续累积语音高质量训练数据。

2、实验最新语音理解、生成方案,并对其中的模块进行解耦和分析。

3、结合大模型范式,参与研发语音Encodec、Decoder、多模态对齐等模块,构建LLM based TTS和端到端Speech2Speech系统。

4、参与语音大模型的评测及优化。

任职资格:

1、计算机、人工智能、信号处理、通信、数学等相关专业,硕士及以上学历。

2、精通 Python/C/C++等编程语言,熟练使用 Pytorch进行深度学习模型开发,熟悉Kaldi等语音相关工具优先。

3、熟悉ASR/TTS等语音基础理论和算法,了解或使用过VITS/VALLE/FishSpeech/CosyVoice,有LLM理论和训练基础的优先。

4、有语音识别、语音合成等相关实际项目经验者优先。

5、具备良好的沟通能力,对技术充满热情。

简历投递

邮箱主题:应聘岗位 + 姓名 + 语音之家推荐

邮箱:hr@rockai.net

地址:上海市浦东新区环科路1455号模力社区T1