说明及更新

滚动测试目的:

  • 在时间轴持续记录各服务的性能表现,形成历史数据。

  • 避免一次性测试带来的偶然偏差和结论,及时体现各服务最新迭代的性能水平。

  • 及时发布因新增测试集、测试框架中细节参数调整带来的性能变化。


本期新加入语音平台:

  • 微软 Azure 认知服务 语音服务

  • 搜狗 知音平台


本期新加入测试场景领域:

  • 鲁豫有约 大咖一日行


新增测试:

已有平台 × 已有领域


滚动测试结果

新闻联播

CER%
阿里
百度
谷歌
讯飞
微软
搜狗
腾讯
创Y
2020.3
1.41
2.42
4.68
1.12
N/A
N/A
2.2
1.09
2020.4
1.02
2.41
4.68
1.13
1.43
2.06
2.23
1.09
鲁豫有约 大咖一日行
CER%
阿里
百度
谷歌
讯飞
微软
搜狗
腾讯
创Y
2020.4
7.04
8.85
18.74
6.23
6.83
7.17
10.62
4.56


    简评

    • 补充了新增两家服务在已有新闻联播场景的性能数据

    • 从新闻联播历史数据看到,阿里在3月-4月间应该有模型迭代,性能有较明显提升。


    后记

    • 过去十年,语音行业的技术水平和数据积累都取得长足的进步,但始终没有贯彻一致的测试数据,来定量的追踪这种时间变化趋势,甚至做出行业整体的提升曲线。虽然现阶段语音技术发展进入相对的平缓期,但 SpeechIO TIOBE 测试还是会尝试在未来逐步填补这一空白。Better late than never.

    • 在很多的语音团队中,内部的测试集,最后实际上都变成了一个调参的开发集(一个观察,不一定对),相信各团队中负责核心识别率研发的同学都能理解这个观察。我们这样一个外部的大规模、多领域的中立测试集,多少也会对各团队的研发起到参考作用,希望我们的这部分工作能使整个行业受益。

    • 我们正在构建的应该是语音行业有史以来最大的多领域中文测试集,大家接下来想看到什么样的场景和领域测试,可以后台私信参与进来,两个原则:公开渠道;公众熟知。我们会选取有普遍参考价值的领域进行实施。

    • 原则上,我们会尽量密集的进行追踪测试。但出于资金和时间精力的投入,我们不保证每月都发布滚动测试报告。