4月25日,余承东在华为开发者大会2021上(HDC.Cloud),发布盘古系列超大规模预训练模型,包括30亿参数的全球最大视觉(CV)预训练模型,以及与循环智能、鹏城实验室联合开发的千亿参数、40TB训练数据的全球最大中文语言(NLP)预训练模型。


据悉,华为云盘古系列 AI 大模型计划包括四大模型:NLP 大模型、CV 大模型、多模态大模型、科学计算大模型。


整个大模型设计遵循三大原则:

  • 超大的神经网络;

  • 网络架构强壮,相比于定制化小模型,大模型综合性能提升了 10% 以上;

  • 健壮(Robust)的网络性能,全场景覆盖率提升 10 倍以上。


盘古NLP大模型:是业界首个千亿参数中文语言预训练模型,预训练阶段学习了40TB中文文本数据,是最接近人类中文理解能力的AI大模型。


盘古CV大模型:是目前业界最大的视觉预训练模型,包含超过30亿参数。


盘古NLP大模型在CLUE榜单中,总成绩及分类、阅读理解单项均排名第一,刷新三项榜单世界历史纪录,总成绩得分83.046。而盘古CV大模型,则在ImageNet 1%、10%数据集上的小样本分类精度上,达到了业界最高水平。



华为云盘古大模型的开发模式,是“预训练+下游微调”,这也是与目前全球主流大模型(如Bert)所匹配的一种模式。可以在多个复杂的场景中适用,同时也可以在少量样本的情况达到高精度,在这方面超越了GPT系列。


盘古大模型,主要依托于CANN算子和MindSpore框架。

  • CANN(异构计算架构),目前可以用于推理、训练场景,还能够实现“端边云协同”。这就意味着不必在不同的终端,再去开发不同的算子,从而提高了效率。

    例如基于CANN,就能让ResNet-50模型的训练时间降低到28s。


  • MindSpore(全场景AI计算框架),具有全自动混合并行方案。MindSpore 采用了“流水线并行、模型并行和数据并行”的多维自动混合并行技术,大幅降低了手动编码的工作量,集群线性度提升 20%。


还推出了与“盘古”同级别,同分量的五大产品和服务:

  1. 华为云CCE Turbo容器集群:从计算、网络和调度三方面,让容器更加强大。这也是业界唯一支持100%容器虚拟化的集群。

  2. 华为云GaussDB(for openGauss)数据库:让核心数据库上云,与传统分布式数据库相比,在性能、弹性、可用性方面更强,是金融领域安全级别的那种。

  3. 可信智能计算服务(TICS):在安全保障的前提下,解决数据难开放、共享流通的问题,而且无须转换就能适配业界主流的大数据应用场景。

  4. 华为云CloudIDE智能编程助手:可以实现“让程序自己写程序”,还能随时随地、使用任何终端在线编程。

  5. 多样性计算基础软件:云的创新离不开操作系统、数据库、中间件等基础软件根技术的支撑。华为将围绕鲲鹏、昇腾构建多样性计算产业,尤其是在计算基础软件上持续投入,构建了包括操作系统、数据库、AI计算框架等全套计算基础软件栈,使能多样性算力,支撑华为云的产品和服务创新。