更新日志

最新更新日期:2020.07

  • 2020年7月:

  • 场景:增加播客 故事FM

  • 重要修复:发现直播 王者荣耀  老罗语录三个个场景测试集标注错误,全面检查&修正;作废这三个测试集6月的测试结果,7月开始启用修正后的测试集。详情见本月已经发布的[更正说明文章]

  • 测试:全厂商 × 全场景 滚动刷新测试


  • 2020年6月:

  • 场景:增加 直播带货 李佳琪、薇娅直播、王者荣耀、老罗语录

  • 厂商:增加 阿里+,为阿里云新算法的试用版; 测试中取消 谷歌 ,因谷歌的中文识别性能没有参考性,且费用超过其余各家之和。

  • 更名:原 搜狗知音平台 改名为 搜狗AI开放平台

  • 测试:全厂商 × 全场景 滚动刷新测试

  • 2020年5月:

  • 修复搜狗多句结果解析bug

  • 场景:增加 天下足球-世界杯往事、罗振宇跨年演讲、李永乐老师在线讲堂

  • 厂商:增加 创S

  • 测试:全厂商 × 全场景 滚动刷新测试

  • 2020年4月:

  • 场景:增加 鲁豫有约大咖一日行

  • 厂商:增加 微软 Azure 认知服务 、 搜狗知音平台

  • 测试:全厂商 × 全场景 滚动刷新测试

  • 2020年3月:

  • 场景:增加 新闻联播

  • 厂商:增加 阿里、百度、谷歌、讯飞、腾讯、创Y


滚动测试

已有测试集信息汇总


最新滚动测试结果汇总

视角1:纵轴(字准确率%)绘制范围为[0, 100],适合比较不同场景间差异


视角2:纵轴(字准确率%)绘制范围为[70, 100],适合比较不同厂商间差异


7月滚动测试详细数据



后记

  • 本周最重要的更新为修正6月份我们3个测试集的标注失误,从上面视角1图中可以看到,在直播这种比较难的场景下,绝大多数厂商的识别性能仍可以达到80%以上,通用模型对中远场兼容较好的甚至可以达到90%左右。

  • 但这里需要说明,像直播这类场景,标注过程中存在人都听不清的句子,相当于没有可用于比对的ground truth,因此这类句子在我们的测试集制作中是被人工剔除的。而在实际应用中,对于这类句子并没有区分和剔除机制,识别出的结果往往类似乱码句,因此实际接入此类场景的服务时,体感性能距离我们测试集反映出的数字会有一定差距。

  • 本月搜狗和腾讯的性能有明显提升。

  • 微信公众号文章的推送改为推荐机制后,我们确实发现我们的文章的阅读量有明显下滑,对我们文章感兴趣的读者,可以标星公众号,方便的读者可以点一下在读,或者推荐给自己关注语音方面的朋友,小编在此表示感谢 : )


附录 全厂商× 全场景× 全历史月份 数据表

新闻联播



鲁豫有约一日行


天下足球 世界杯往事


罗振宇 跨年演讲


李永乐老师 在线讲堂


直播 王者荣耀 张大仙&骚白


直播 带货 李佳琪&薇娅


老罗语录


播客 故事FM