说明及更新
滚动测试目的:
在时间轴持续记录各服务的性能表现,形成历史数据。
避免一次性测试带来的偶然偏差和结论,及时体现各服务最新迭代的性能水平。
及时发布因新增测试集、测试框架中细节参数调整带来的性能变化。
本期新加入语音平台:
微软 Azure 认知服务 语音服务
搜狗 知音平台
本期新加入测试场景领域:
鲁豫有约 大咖一日行
新增测试:
已有平台 × 已有领域
滚动测试结果
新闻联播
简评
补充了新增两家服务在已有新闻联播场景的性能数据
从新闻联播历史数据看到,阿里在3月-4月间应该有模型迭代,性能有较明显提升。
后记
过去十年,语音行业的技术水平和数据积累都取得长足的进步,但始终没有贯彻一致的测试数据,来定量的追踪这种时间变化趋势,甚至做出行业整体的提升曲线。虽然现阶段语音技术发展进入相对的平缓期,但 SpeechIO TIOBE 测试还是会尝试在未来逐步填补这一空白。Better late than never.
在很多的语音团队中,内部的测试集,最后实际上都变成了一个调参的开发集(一个观察,不一定对),相信各团队中负责核心识别率研发的同学都能理解这个观察。我们这样一个外部的大规模、多领域的中立测试集,多少也会对各团队的研发起到参考作用,希望我们的这部分工作能使整个行业受益。
我们正在构建的应该是语音行业有史以来最大的多领域中文测试集,大家接下来想看到什么样的场景和领域测试,可以后台私信参与进来,两个原则:公开渠道;公众熟知。我们会选取有普遍参考价值的领域进行实施。
原则上,我们会尽量密集的进行追踪测试。但出于资金和时间精力的投入,我们不保证每月都发布滚动测试报告。
