来源丨21db声学人

在当今这个日益互联互通的世界里,语言学习对于教育、商业以及文化交流而言已变得至关重要。然而,准确衡量语言学习者的熟练程度是一个复杂的问题。一种有价值的方法是让学习者听句子,然后尽可能准确地重复出来,这种方法被称为 “诱发模仿”(Elicited Imitation,EI)。

这种方法揭示的不仅仅是记忆和模仿能力。当句子超出我们的工作记忆容量——通常超过八到十个音节时,成功的重复需要学习者快速处理并使用他们对语言模式和结构的内化知识来重建语言。因此,诱发模仿可以为一个人的真实语言熟练程度提供一个窗口。

尽管诱发模仿法在过去几十年中已经得到了完善,但其广泛应用却受到现实难题的限制:需要经过专业培训的人工评估员来聆听并给每个回答打分。这个耗时的过程使得大规模评估难以开展,尽管诱发模仿法经过研究证明是有效的。

尽管基于诱发模仿的测试在 21 世纪初由于一种标准化评分方法的发展而受到广泛关注,但诱发模仿法对资源的需求仍然限制了它在教育领域的应用,而在教育领域它本可以发挥很大作用。

在这样的背景下,由日本同志社大学文学部英语系副教授迈克尔・麦奎尔(Michael McGuire)和北九州市立大学的詹妮弗・拉森 - 霍尔(Jenifer Larson-Hall)博士组成的一个研究团队,开发了一种用于诱发模仿评估的自动化方法。

他们最近发表在《应用语言学研究方法》(Research Methods in Applied Linguistics)上的论文,展示了人工智能如何助力革新这一过程。

研究人员提出了一个分两部分的解决方案来实现诱发模仿测试的自动化:首先,使用 OpenAI 的 “Whisper”(一种自动语音识别系统)将学习者的口头回答转录成文本;其次,应用 “词错率(WER)” 的计算指标来评估这些回答与原始提示的匹配程度。

选择 “Whisper” 自动语音识别系统,是因为它对非母语语音的识别准确率高,并且对背景噪音有一定的耐受性,而词错率则提供了一种精确的方法来衡量与目标句子的偏差,能够在单词层面识别出替换、插入和遗漏的情况。

研究团队推测,这些技术结合起来有可能在保持评估质量的同时取代人工评分员。为了测试这种方法,他们招募了 30 名英语水平各异的日本大学生,这些学生完成了一项包含 30 个项目的诱发模仿测试。由此产生的 900 个语音样本分别由人工评分员和 “Whisper” 自动语音识别系统进行转录。

值得注意的是,他们发现 “Whisper” 的转录结果与人工评分员的转录结果相匹配,展现出了极高的准确性。即使测试条件并不理想,还存在一些背景噪音的情况,这种高度的一致性依然存在,这表明了该系统在现实教育环境中的稳健性。

最重要的是,自动评分与传统的人工评估方法高度吻合,显示出近乎完美的相关性。


该图描绘的良好线性表明手动评分和全自动评分之间具有极好的一致性,展现了所提系统的潜力。图片来源:Michael McGuire / 日本同志社大学

麦奎尔先生解释道:“我们的研究证明了针对英语语言学习者的全自动化口语测试的可行性和可靠性,这种测试可以低成本大规模地进行,使得口语水平评估更加容易获得且可靠,便于广泛应用。”
其意义不仅仅在于节省教师的时间和资源。自动化评估可以让学生的口语技能得到更频繁的评估,提供对语言发展至关重要的及时反馈。它还可以推动此前因人工评分的资源需求而难以开展的大规模研究。
研究团队已经在努力实现这些目标,正如麦奎尔先生所说:“我们目前正在开发一个基于网络的诱发模仿测试平台,计划使用‘Whisper’自动语音识别系统和词错率实现完全自动化,这样测试就可以在智能手机上进行,评分也可以在线实时完成。我们希望在不久的将来,能把这个全自动化平台提供给其他研究人员和教育工作者使用。”
展望未来,研究人员还计划拓展他们的方法,开发多个难度相当的标准化测试形式,以便更可靠地追踪语言随时间的发展情况。他们还设想创建针对特定词汇和语法特点的课程专属测试,甚至有可能开发出比现有方法更能高效确定口语水平的自适应测试。

更多信息:Michael McGuire et al, Assessing Whisper automatic speech recognition and WER scoring for elicited imitation: Steps toward automation,Research Methods in Applied Linguistics(2025).DOI: 10.1016/j.rmal.2025.100197


信息源于:phys.org