6月份我们发布了 直播:王者荣耀(张大仙&骚白),直播:带货(李佳琦&薇娅),老罗语录 三个场景领域的测试集及评测结果。本月初对结果分析过程中,我们发现这三个测试集中的部分语音标注存在时间戳偏差。经过近一个月的人工检查和标注检验,我们对问题进行了修正。在此将问题详情进行公示,并向测试厂商以及公众号的读者们致以我们诚挚的歉意。


问题:下面例子中,REF为人工标注,REC为我们任选的一家厂商的识别结果。

例子1:

REF: 在 那 个 规 定 情 境 中 去 表 达 那 个 人 的 情 感 *+ *+ *+ *+ *+ *+ *+ *+ *+

REC:在那个规定情境中去表达那个人的情感所以就会很难很难就


例子2:

REF: *+ *+ *+ 全 *唇 *涂 的 啊 来 三 号 色 来 下 一 支 零 三 号

REC:好看哦全*全*图的啊来三号色来下一支零三号


例子中的[*+]是服务正确识别出文字,但标注中没有对应文本,而被判成错误的部分。


原因:6月北京的疫情导致标注项目团队改为远程居家办公,工作电脑变更,导致新旧软件环境版本不一致。在测试集制作最后的短音频切割环节,部分语音的时间戳(在原始长语音素材中的位置)发生偏移错误,且该错误集中发生在部分语音中,并非普遍存在,我们未能及时发现该问题。


影响:

上述问题导致我们上月明显低估了所有评测厂商在这三个测试集上的识别性能。



补救措施:

  • 本月人工逐条检查并重新标注。统计了问题句子占所在场景全部句子中的比例,公示如下:

    • 直播 王者荣耀:18.3%

    • 直播 带货:35%

    • 老罗语录:28.8%

  • 上个月三个问题测试集的测试结果作废,不计入TIOBE历史滚动测试数据记录。

  • 逐条重新检查和修正后的测试集已于近日返回,我们将在本月的滚动测试中启用修正后的三个测试集。从我们初步的重测看,以直播带货场景为例,各家的识别率应该从上月汇报的40~50%提升至70~80%左右。

  • 测试工具方面我们增加了一些可视化的结果分析工具,方便以后我们在发布结果前,能够人工将统计结果快速全面的过一遍,避免类似问题发生。


最后,再次就上个月发布的三个场景测试集的问题向 TIOBE 的测试厂商和读者朋友们道歉,是我们工作的疏漏。测试集修正后的具体结果,请关注我们本月的滚动测试报告。


另外,我们一如既往的欢迎厂商和读者对我们的评测提出意见和建议,TIOBE 评测项目从一开始就规划成滚动式的长期测试而不是一锤子单次评测,发现任何问题我们都会尽快更正,也希望大家能帮助我们一起完善。