素材来源
YouTube 李佳琪官方频道 & 薇娅官方频道
我们爬取了李佳琪和薇娅的日常带货直播录像,共计约 3.5 个小时
因为场景较复杂,标注过程中我们有一些处理原则,来确保测试集准确性:
当存在明显的多人同时说话,抢话时,该句丢弃。
当句子中存在标注员都完全听不懂的品牌,名字时,将句子丢弃。
素材示例:
https://www.bilibili.com/video/BV1KK4y147t4?share_source=copy_web
https://www.bilibili.com/video/BV1Kb41137mz?share_source=copy_web
为了让大家更直观的体验一下这个场景的难度,我们破例摘一条音频放在这里,标注人员的标注在最后简评部分放出,看看大家自己能否听清听明白
>>>李佳琪带货音频
场景特点
环境
直播间
直播间内聚集多人团队及嘉宾,有少量人员沟通、工作时产生的背景噪声。
拾音设备
麦克风或手机,距主播约一臂距离,拾音效果较差
说话人
李佳琪及其助理 & 带货嘉宾
薇娅及团队辅助人员 & 带货嘉宾
说话方式
自然语言,薇娅语速快,李佳琪语速极极极快
方言
普通话
内容领域
美妆推荐(涉及大量品牌,体验,夸赞语)
各种各样的商品,如零食、平底锅、火箭等
测试结果
测试时间:2020.06
本场景后面会进行定期重测(1-2个月),关注最新滚动测试报告查看最新结果。

简评
文章开头的李佳琪音频标注为:呃你薄薄涂的话是种比较偏玫调然后你全唇的话就会比较的显气质一点点。抛开这个语速不谈,就“玫调”这个词,男同学中你们有多少听懂了呢 : ) 这个场景的识别,人尚且困难,对于机器,难度可想而知,这些都反映在数字中。
大家可能会觉得识别率是不是统计错了,这个场景下,除了腾讯,其余厂商均低于50%,跟我们常听到的97%有这么大差距。
其实这就又回到我们评测引篇里提到,我们以后还会反复提的问题:现阶段语音识别是分场景的,还不存“通用能力”,抛开了场景和语境,数字的意义并不大。
近些年大家互相攀比好像口头没个97%就没法开展业务,在有些场景的实际使用中又差强人意,一直被很多语音行业外的朋友诟病。骂声一直都会有,技术和解决方案还要进步,一方面各种对语音识别更友好的硬件麦克风设备进入实用(智能录音笔、家居音箱、电视麦克风阵列),另一方面各种垂直场景的定制化模型和定制能力,都在快速的发展,这些都是为了解决通用语音识别搞不定的问题。
类比一下服装行业,成衣和量身定制的服装总是会同时存在。在应用语音识别能力时,权衡功能的价值收益以及定制成本,这终究是一个投入和产出的问题。语音技术的持续快速发展,也尤其需要更多可验证商业价值的场景来支撑。
