最新更新日期:2020.07
2020年7月:
场景:增加播客 故事FM
重要修复:发现直播 王者荣耀 老罗语录三个个场景测试集标注错误,全面检查&修正;作废这三个测试集6月的测试结果,7月开始启用修正后的测试集。详情见本月已经发布的[更正说明文章]
测试:全厂商 × 全场景 滚动刷新测试
2020年6月:
场景:增加 直播带货 李佳琪、薇娅直播、王者荣耀、老罗语录
厂商:增加 阿里+,为阿里云新算法的试用版; 测试中取消 谷歌 ,因谷歌的中文识别性能没有参考性,且费用超过其余各家之和。
更名:原 搜狗知音平台 改名为 搜狗AI开放平台
测试:全厂商 × 全场景 滚动刷新测试
2020年5月:
修复搜狗多句结果解析bug
场景:增加 天下足球-世界杯往事、罗振宇跨年演讲、李永乐老师在线讲堂
厂商:增加 创S
测试:全厂商 × 全场景 滚动刷新测试
2020年4月:
场景:增加 鲁豫有约大咖一日行
厂商:增加 微软 Azure 认知服务 、 搜狗知音平台
测试:全厂商 × 全场景 滚动刷新测试
2020年3月:
场景:增加 新闻联播
厂商:增加 阿里、百度、谷歌、讯飞、腾讯、创Y
滚动测试
已有测试集信息汇总

最新滚动测试结果汇总
视角1:纵轴(字准确率%)绘制范围为[0, 100],适合比较不同场景间差异

视角2:纵轴(字准确率%)绘制范围为[70, 100],适合比较不同厂商间差异

7月滚动测试详细数据

后记
本周最重要的更新为修正6月份我们3个测试集的标注失误,从上面视角1图中可以看到,在直播这种比较难的场景下,绝大多数厂商的识别性能仍可以达到80%以上,通用模型对中远场兼容较好的甚至可以达到90%左右。
但这里需要说明,像直播这类场景,标注过程中存在人都听不清的句子,相当于没有可用于比对的ground truth,因此这类句子在我们的测试集制作中是被人工剔除的。而在实际应用中,对于这类句子并没有区分和剔除机制,识别出的结果往往类似乱码句,因此实际接入此类场景的服务时,体感性能距离我们测试集反映出的数字会有一定差距。
本月搜狗和腾讯的性能有明显提升。
微信公众号文章的推送改为推荐机制后,我们确实发现我们的文章的阅读量有明显下滑,对我们文章感兴趣的读者,可以标星公众号,方便的读者可以点一下在读,或者推荐给自己关注语音方面的朋友,小编在此表示感谢 : )
附录 全厂商× 全场景× 全历史月份 数据表
新闻联播

鲁豫有约一日行

天下足球 世界杯往事

罗振宇 跨年演讲

李永乐老师 在线讲堂

直播 王者荣耀 张大仙&骚白

直播 带货 李佳琪&薇娅

老罗语录

播客 故事FM
