上海岩芯数智人工智能科技有限公司(简称RockAI)成立于2023年6月,以“让世界上每一台设备拥有自己的智能”为使命,于2024年1月发布国内首个非Attention机制大模型Yan1.0。
2024年7月发布国内首个非Transformer架构终端多模态大模型Yan1.2,并亮相WAIC2024。2024年9月,正式发布全新升级的群体智能单元大模型Yan1.3,并在现场对机器人、无人机、PC、手机等多终端设备做真实演示。采用非Transformer架构的Yan1.3大模型,可高效处理图文及语音等多模态信息,广泛适配于树莓派、无人机、机器人、PC、手机等各类终端设备。目前已提交专利申请超过50项,涵盖大模型的模型结构设计、算法改进、预训练、微调等核心环节。
招聘岗位
音频算法专家(TTS)
任职资格:
音频算法工程师
1、研究和优化语音识别(ASR)、语音合成(TTS)等任务,提升音频相关任务的准确性和生成质量。
2、研究跨模态语音-文本-图像融合技术,优化语音与视觉、文本等任务的协同学习能力。
3、结合深度学习方法(如 Conformer、HuBERT、Whisper)进行音频数据建模,提高低资源语言及复杂场景下的语音识别能力。
任职资格:
1、计算机、人工智能、电子信息等相关专业,硕士及以上学历,具备 2 年及以上深度学习研究或项目经验。
2、精通 Python,熟练使用 PyTorch 或 TensorFlow 进行深度学习模型开发,掌握 C++ 者优先。
3、有音频多模态领域的算法经验,熟悉TTS、ASR等结构和原理,有较强的算法设计、编程实现和模型训练能力。
4、具备扎实的数学和算法基础,能够阅读和复现前沿论文,并将研究成果应用于实际问题。
5、具有团队合作精神,良好的沟通能力和独立解决问题的能力。
语音大模型算法实习生
1、结合语音识别、语音合成、前端信号处理等模型工具参与语音数据质量迭代pipeline的研发,持续累积语音高质量训练数据。
2、实验最新语音理解、生成方案,并对其中的模块进行解耦和分析。
3、结合大模型范式,参与研发语音Encodec、Decoder、多模态对齐等模块,构建LLM based TTS和端到端Speech2Speech系统。
4、参与语音大模型的评测及优化。
任职资格:
1、计算机、人工智能、信号处理、通信、数学等相关专业,硕士及以上学历。
2、精通 Python/C/C++等编程语言,熟练使用 Pytorch进行深度学习模型开发,熟悉Kaldi等语音相关工具优先。
3、熟悉ASR/TTS等语音基础理论和算法,了解或使用过VITS/VALLE/FishSpeech/CosyVoice,有LLM理论和训练基础的优先。
4、有语音识别、语音合成等相关实际项目经验者优先。
5、具备良好的沟通能力,对技术充满热情。
邮箱主题:应聘岗位 + 姓名 + 语音之家推荐
邮箱:hr@rockai.net
地址:上海市浦东新区环科路1455号模力社区T1

