为音频内容添加字幕不仅对听障人士非常重要,也可以为所有观众提供便利。日常生活中,有多种情况是需要关掉声音看视频的,如你在乘坐公共交通工具、会议中、床上,或者身边孩子已熟睡时。研究表明,有字幕的视频会更有吸引力,使用户观看时长延长近40%。然而,字幕支持功能在应用间甚至应用内相互孤立,因而导致用户无法通过字幕查看大量音频内容(包括 vblog、播客、个人视频、语音消息、社交媒体等)。

【戳我看视频】


最近,我们推出了一个全新 Android 功能:Live Caption,可自动为手机上播放的媒体内容生成字幕。该功能可完全在设备上离线实时生成字幕,这样既能保护隐私,又能降低延迟时间。该功能目前支持 Pixel 4 和 Pixel 4 XL,并将于今年晚些时候更新至 Pixel 3 机型,之后则会大范围支持其他 Android 设备。

【戳我看视频】


播放媒体内容时,轻按音量控件启动 Live Caption,屏幕上便会出现字幕框


构建 Live Caption,提高准确性和效率

Live Caption 使用以下三种设备端深度学习模型:用于语音识别 (RNN-T) 的递归神经网络 (RNN)序列转导模型、用于无声标点的文本递归神经网络模型,以及用于声音事件分类的卷积神经网络 (CNN) 模型。Live Caption 结合这三种模型的信号来创建单个字幕轨道。在该轨道中,声音事件标签(例如 [APPLAUSE] 和 [MUSIC])会在不中断语音识别输出的情况下显示。该功能会在更新文本的同时预测标点符号。


通过声音识别和 ASR 反馈循环处理传入声音。生成的文本或声音标签已格式化,并会添加到字幕中


在声音识别方面,我们利用之前在声音事件检测领域取得的工作成果,使用一个基于AudioSet数据集的模型。声音识别模型不仅可用于生成常见的声音效果标签,还可用于检测语音时段。全自动语音识别 (Automatic Speech Recognition, ASR) RNN-T 引擎仅在发出语音的时段内运行,可最大程度减少内存和电池用量。例如,当检测到音乐并且在音频中不存在语音时,屏幕上会显示 [MUSIC] 标签,这时系统将卸载 ASR 模型。仅当音频中再次出现语音时,系统才会再次将 ASR 模型加载回内存。

若想让 Live Caption 发挥最大作用,则应使设备具备连续运行的能力。为此,Live Caption 的 ASR 模型使用神经连接修剪等多种技术为边缘设备进行了优化,与全尺寸语音模型相比,该技术将功耗降低了 50%。在显著降低功耗的同时,该模型在各种用例(包括为视频生成字幕、识别短查询和窄带电话语音)中仍表现良好,并能稳定应对背景噪音。

基于文本的标点符号模型经过优化,使用比云端更小的结构在设备上连续运行,并利用TensorFlow Lite运行时实现量化和序列化。随着字幕的生成,语音识别结果会以每秒多次进行快速更新。为了节省计算资源并提供流畅的用户体验,Live Caption 根据最近识别的句子的文本结尾执行标点预测;如果下一个更新的 ASR 结果没有更改该文本,则保留先前预测的标点。


前景展望

Live Caption 英文版现已支持 Pixel 4,不久将会搭载至 Pixel 3 和其他 Android 设备。我们希望通过扩展能够对其他语言予以支持并进一步改善格式,来提高字幕的识别准确性和语句的连贯性(尤其是针对有多人对话场景),从而将这一功能推向更多用户。


致谢

感谢团队的核心成员包括 Robert Berry、Anthony Tripaldi、Danielle Cohen、Anna Belozovsky、Yoni Tsafir、Elliott Burford、Justin Lee、Kelsie Van Deman、Nicole Bleuel、Brian Kemler 和 Benny Schlesinger。我们衷心感谢 Google Speech 团队的支持,特别是 Qiao Liang、Arun Narayanan 和 Rohit Prabhavalkar 与 Google Brain 团队成员 Chung-Cheng Chiu 在 ASR 模型方面的深入分析工作;Dan Ellis 和 Justin Paul 在整合声音识别模型方面的帮助;Tal Remez 在开发标点符号模型方面的支持;Kevin Rocard 和 Eric Laurent 在 Android 音频捕获 API 方面的协助,以及 Eugenio Marchiori、Shivanker Goel、Ye Wen、Jay Yoo、Asela Gunawardana 和 Tom Hume 在 Android 基础架构工作上的支持。


如果您想详细了解本文提及的相关内容,请参阅以下文档。这些文档深入探讨了这篇文章中提及的许多主题:

  • 观看时长延长 40%https://www.businesswire.com/news/home/20090325005658/en/PLYmedia-Subtitles-Increase-Online-Video-Viewing-40

  • Live Caption

    https://blog.google/products/android/live-caption/

  • 序列转导

    https://arxiv.org/pdf/1211.3711.pdf

  • 无声标点https://tensorflow.google.cn/tutorials/text/text_generation

  • 声音事件分类https://ai.google/research/pubs/pub45611

  • 声音事件检测

    https://blog.google/products/android/new-features-make-audio-more-accessible-your-phone/

  • AudioSethttps://ai.googleblog.com/2017/03/announcing-audioset-dataset-for-audio.html

  • 边缘设备优化https://arxiv.org/abs/1909.12408

  • 表现良好https://arxiv.org/pdf/1910.11455.pdf

  • TensorFlow Litehttps://tensorflow.google.cn/lite

  • 多人对话场景https://ai.googleblog.com/2019/08/joint-speech-recognition-and-speaker.html