素材来源
YouTube 张大仙团队官方频道 & 骚白团队官方频道
我们爬取了张大仙 & 骚白的日常直播录像,从中抽取了共计14局直播对局,共计时长约5小时。
素材示例:
https://www.bilibili.com/video/BV19K411p7Pt?share_source=copy_web
https://www.bilibili.com/video/BV1g54y1B7dt?share_source=copy_web
场景特点
环境
直播间
环境安静,但混入较强的游戏声效,有时有BGM背景音乐
拾音设备
专业麦克风,一般距离主播半臂距离左右
说话人
张大仙、骚白
说话方式
自然语言,语速快,带有很强烈的感情色彩和鲜明的个人语言风格,非字正腔圆。
方言
普通话
内容领域
游戏(大量王者荣耀相关游戏词汇)、闲聊、段子
测试结果
测试时间:2020.06
本场景后面会进行定期重测(1-2个月),关注最新滚动测试报告查看最新结果。

本月开始评测中将剔除谷歌,因为根据往期结果,中文领域谷歌性能不具有参考价值。
“搜狗知音平台”已更名为“搜狗AI开放平台”
本月开始新加入阿里的预发模型(需经过更多测试稳定后才会发布到阿里云官网),暂定名阿里云+(用户目前可以调用到的仍为“阿里云”)
简评
可以看到,在直播这种更自由化场景下,各家的语音识别性能均发生大幅度下降,与场景特点中的说话方式、内容领域有较大关系。
一般来说,如果语音识别的准确率低于85%甚至80%,人类阅读识别文本就会产生理解障碍,因此可以说各家的通用语音识别在该场景下,需要垂直优化。
关于垂直领域定制优化的问题,是语音识别产业走向实用的重要方向。现在走得比较快的平台都在发布各种垂直领域模型和定制能力,如果读者感兴趣的话,我们后期可能会梳理一期相关内容进行介绍。
预告:下一期评测场景为直播带货,是语音识别性能集体翻车的一期,与我们之前的测试场景中的优秀性能形成鲜明对比,敬请期待。
