第24届冬季奥林匹克运动会正如火如荼的进行中,细心的朋友可以发现在比赛的直播中有位AI手语主持人在为直播进行手语解说,用技术跨越声音的障碍。


AI手语主持人和被大家所了解的虚拟人一样,都有着以假乱真的外貌。从“她”的表情、口型、毛发、服饰、身形五大维度打造3D高精超写实的数字人AI模型,让AI驱动的数字人表情更加亲切自然。
以假乱真的外貌以及流畅自然的动作,都不再是虚拟人领域最令人惊叹的成就。陆续出现在大众眼前的虚拟人大多都已经开始了自己的“职业生涯”,其专业素养、职业能力才是真正有吸引力的。


AI手语主持人的意义重大
据统计,全球约有4.3亿人患中度及以上听力障碍,根据全国第二次残疾人抽样调查数据,中国有听障人士2780万。他们虽然听不到赛场的声音,但同样希望感受赛事的精彩。手语解说无疑成为了他们观赛的重要桥梁。
但手语解说,可不简单,区别于传统翻译,手语翻译的难点在于:手语并非按照语言逐字翻译,而需要根据语句整体意思进行语言精炼和语序调整,同时还需实时配合表情和唇语,帮助听障者更好的理解。这就导致AI手语主持人在信息凝练度、低时延和精细化三方面面临极其复杂的技术难题。因此,AI手语主持人不仅需要具备高精度的数字人形象,还需要具备能够语音识别、手语翻译和手语表达的AI大脑。
先来看语序问题,汉语、手语的正常语序编排是不一样的。来看个例子:
汉语:猫追老鼠
👇
手语:猫 老鼠 追
这就给手语解说增加了难度,如果你按汉语正常语序编排,那么,听障人士看到的手语解说,其实是乱序的。除了语序问题外,手语还有个特点:没有虚词和量词。举俩例子感受下:
汉语:两本书
👇
手语:书 二
汉语:大雪纷飞
👇
手语:雪 + 大幅身体摆动体现程度
试想一下,不恰当的省略,会导致意思理解上千差万别,比如,“两捆书”可能被理解成“两本书”。此外,手语还有个特点:不仅仅需要手势,还需要依靠面部表情、身体动作等表达信息。
调研发现,绝大多数听障者只能理解手语新闻中不到60%的内容。除了手语翻译难的问题外,另一个显而易见的现状是手语主持人太少了。因此,非常有必要去研发翻译精准的AI手语主持人。
2021年10月,广电总局在《广播电视和网络视听“十四五”科技发展规划》中首次明确指出,要推动虚拟主播、动画手语广泛应用于新闻播报、天气预报、综艺科教等节目生产,创新节目形态,提高制播效率和智能化水平。
AI手语主持人是如何研发出来的?
AI手语主持人背后,要先采集录制真人的声音等素材,然后通过声音标注、机器深度学习算法等构建发音声学模型,再进行人物建模。
其次利用虚拟人的肢体动作控制、自动化驱动口唇表情合成等技术,使得AI手语主持人具有灵动的身形、 活泼的表情和精准的口型。
除此之外,在语音合成、语音识别、图像识别、语义理解、口唇驱动、面部驱动、肢体动作驱动等多达7项(可能更多)技术的加持下,打造出的虚拟形象自动化内容生产方案,让AI手语主持人不仅会说普通话,还可以同时支持多种语言及方言。


期待未来,会有更多AI手语主持人在电视栏目中上线。