更新日志

最新更新日期:2021-04

  • 场景:增加 [播客 故事FM]

  • 重要修复:发现 [直播带货 李佳琪薇娅][直播王者荣耀 张大仙骚白][老罗语录]三个场景测试集标注错误,全面检查&修正;作废这三个测试集6月的测试结果,7月开始启用修正后的测试集。详情见本月已经发布的[更正说明文章]

  • 测试:全厂商 × 全场景 滚动刷新测试

  • 2020年6月:

  • 场景:增加 [直播带货 李佳琪薇娅] [直播王者荣耀 张大仙骚白] [老罗语录]

  • 厂商:增加 阿里+,为阿里云新算法的试用版;测试中取消[谷歌], 因谷歌的中文识别性能没有参考性,且费用超过其余各家之和。

  • 更名:原 搜狗知音平台 改名为 搜狗AI开放平台

  • 测试:全厂商 × 全场景 滚动刷新测试

  • 2020年5月:

  • 2020年4月:

  • 场景:增加 [鲁豫有约大咖一日行]

  • 厂商:增加 微软 Azure 认知服务、搜狗知音平台

  • 测试:全厂商 × 全场景 滚动刷新测试

  • 2020年3月:

  • 场景:增加 [新闻联播]

  • 厂商:增加 阿里、百度、谷歌、讯飞、腾讯、创Y


滚动测试

已有测试集信息汇总


最新滚动测试结果汇总

纵轴(字准确率%)绘制范围为[70, 100]

(注:讯飞被低估,原因详见链接[SOTA])


最新滚动测试详细数据

(飘绿部分为各个测试集的最优性能)






后记

  • 从测试数字中可以看到,依图在沉寂了一年后,更新了新的模型,性能有一致提升。阿里有小幅提升。其余厂商与上次滚动测试基本一致。

  • 后台持续征集评测场景。