来源丨AI音频时代

语音技术及数据服务提供商Voices近日推出了一款面向AI训练的角色语音数据集。该数据集包含超过450种角色类型,由专业配音演员参与录制,覆盖了包括1920年代时髦女性、军事教官和老年巫师在内的多种形象。


据发布信息显示,这一数据集提供了19类音色、35种情感状态和21种副语言表达方式。所有语音材料均通过与专业配音演员合作完成,每位参与者以不同角色和情绪录制语料,从而构建出一个支持多角色、多情绪生成的语音样本集合。

该资源主要面向语音合成和人工智能交互应用开发,强调在伦理合规基础上的数据构建,目前已在Voices平台正式上线。


Voices 角色数据集以即用格式交付,研究人员与开发者可即刻导入文件开始训练。

该数据集中的每条语音样本均附带结构化元数据,涵盖角色属性、文本内容、音色类别和情感标签,并提供精准的转录文本。这些标注信息旨在辅助AI模型更有效地学习细腻且自然的语音表达。

录音采集通过Voices自主研发的虚拟录音室系统完成,该技术目前处于专利审查阶段。系统采用自动化引导会话流程,在提升录制效率的同时,力求保持语音表演的真实性和音质一致性,以满足高阶AI应用对训练数据的质量要求。

在数据伦理方面,Voices表示其语音样本均在与专业配音演员建立的长期合作基础上采集,强调贡献者对录制内容的知情权和自主选择权,并通过透明合约保障其获得相应报酬。该公司称,此举旨在推动语音AI领域在合规和负责任的方向发展。


Voices 是全球领先的企业级市场与平台,专注于以符合伦理的方式获取配音演员、语音 AI 及用于训练 AI 模型的语音数据。二十多年来,Shopify、微软、思科等世界顶级品牌均信赖 Voices 来“找到自己的声音”。Voices 的人才库囊括全球数百万名演员,他们信任 Voices 能够维护其权益并帮助其获得有意义的工作机会。