
CogView4-6B生成的图像
CogView4-6B模型特点
CogView4-6B模型技术架构
1. 任意长度文本与分辨率自适应
2.二维旋转位置编码(2D RoPE)
3.Flow-matching 扩散建模
5.多阶段训练策略
CogView4-6B的评测结果
CogView4-6B的实际生成的图片结果
CogView4-6B的开源情况和其它信息
CogView4-6B模型特点
中文场景突破:通过双语GLM-4编码器与中文图文联合训练,模型不仅能理解”野径云俱黑”等古诗意境,还可将汉字自然融入海报、漫画等视觉元素,解决中文创意产业的核心痛点; 动态生成自由:支持512-2048px范围内任意分辨率图像输出。不过需要注意的是,必须是32的整数倍,最多像素数量不超过2^21。用户可基于完整故事脚本生成四格漫画等复杂叙事图像; CogView4-6B免费开源:作为Apache 2.0协议下首个图像生成模型,提供从Hugging Face到ModelScope的全平台支持,智谱AI此次发布的CogView4-6B可以自由免费商用,没有限制门槛。
CogView4-6B模型技术架构
1. 任意长度文本与分辨率自适应
2.二维旋转位置编码(2D RoPE)
3.Flow-matching 扩散建模
5.多阶段训练策略
基础分辨率训练 :首先在标准分辨率图像上进行预训练,学习基本的文本-图像映射关系。 泛分辨率训练 :引入不同尺度的图像数据,使模型具备适应多种分辨率的能力。 高质量数据微调 :使用更高质量的图像数据进行精调,以提升图像的细节和美感。 人类偏好对齐训练 :结合人类反馈数据,使得模型生成的图像更符合用户的审美和意图。
CogView4-6B的评测结果
CogView4-6B的实际生成的图片结果

