9月13日(周一)陆主席主持COPU例会。本次会议主要议题是听取小米集团首席语音科学家Daniel Povey关于发布语音识别Kaldi新版的报告,并就Kaldi及其未来发展远景进行讨论。
参加会议的有:陆首群、刘澎、陈伟、梁志辉、宋可为、崔宝秋、Daniel Povey、蒋涛、张娅婧、林珑、刘巍巍、鞠东颖。
陆主席:Daniel,你是语音科学大师,你率领的团队研发的语音识别Kaldi最近发布新版,首先我向你祝贺!并请你简要介绍Kaldi这几年在国内外发行及应用情况,请你谈一下Kaldi与其他语音识别技术相比,有什么特点和优势?以及Kaldi发展远景是什么?
Daniel:Kaldi是开源的语音识别工具,集成了各种语音识别模型,包括隐马尔可夫和深度学习神经网络,被认为世界语音识别框架的基石。新版Kaldi由Lhotse(训练数据准备部分,设计通用灵活的接口,以适应语音识别、文本转语音等任务,引入AudioCuts概念,降低数据存储空间)、Icefall(训练脚本集合,降低用户学习成本)、K2(新版Kaldi核心,将加权有限状态转换器和相关算法集成到PyTorch和TensorFlow)三部分组成,服务于小米的“手机+AIoT双引擎战略”。
陆主席:据说Kaldi识别准确率可达95%~97%,是否过高?!
Daniel:准确率与原始数据有关(不同数据有不同准确率)。
陆主席:Kaldi新版是基于PyTorch框架的,PyTorch创始人Soumith Chintala曾指出,2020年AI社区将用更多度量指标衡量AI模型的性能,而不仅仅是准确率和原始数据,Kaldi新版是否也有如此改进?
Daniel:新版kaldi用在小爱云端(服务器端),注重于改进模型性能:多通道、低功耗。
陆主席:新版Kaldi是否考虑更高效使用GPU及如何针对新硬件执行自动编译?
Daniel:太对了!我们考虑使用GPU包括与非监督学习。
陆主席:在此发布Kaldi新版之际,请你写一篇文章,在《深度信息技术(精品)专辑》上发表,希望在本周末完成。
Daniel:希望帮助抓好新版落实。
陆主席:给你找两个伙伴帮助抓落实:一是小米集团,你们已经做了,要求Kaldi新版服务于小米的“手机+AIoT双引擎战略”语音识别技术,请小米集团副总裁崔宝秋帮助落实!二是建议与CSDN合作,请CSDN创始人蒋涛(基于程序员资源及搜索引擎)帮助落实(在请你写的文章中CSDN就可向你提供搜索资料)。
陆主席:我们非常关注大规模语义网络(知识图谱),目前存在的全球性问题是:在语义网络中缺乏逻辑推理,常识问题是其短板,因此难以支持认知智能的实现,离解决还差最后一公里!
Daniel:恐怕不止最后一公里,离解决的路还遥远。Kaldi技术不同于大规模语义网络!
陆主席:认知计算是用来构建模拟人脑思维过程的系统,是使人工智能进入可理解、可解释的强人工智能的新阶段!
Danie:今后双方可就此交换意见。
COPU利用本次会议检查了致怀进鹏部长在高校设置开源课程的信件,要求尽快落实!还检查了《开源 创新,数字化转型、智能化重构》初稿落实情况,要求抓紧实施!
Daniel:中国开源何时实施?
陆主席:1991年我们引进UNIX!与AT&T BellLabs的USL/USG合作,开发、编译UNIXS5R4.2版本,UNIX是后来的自由软件、开源软件(Minux、Linux、BSD)、甚至iOS发展的基础。
