最懂中国传统文化的AI绘画模型,画作有形更有神,传达儒释道思想

本文涉及的产品
模型在线服务 PAI-EAS,A10/V100等 500元 1个月
模型训练 PAI-DLC,100CU*H 3个月
交互式建模 PAI-DSW,每月250计算时 3个月
简介: 最懂中国传统文化的AI绘画模型,画作有形更有神,传达儒释道思想

多模态预训练模型与图像生成技术的结合让 AI 更智能、更有文化。


最近 AI 作画火爆出圈,国内外掀起了一波 AI 绘画热潮,各种社交媒体上用 AI 绘画模型生成的各种图片屡见不鲜。上个月,一位游戏设计师用 AI 作画工具 Midjourney(中途)创作的作品《太空歌剧院》获得了美国科罗拉多州博览会艺术比赛的金奖。


受此启发,中国人民大学卢志武教授团队将自身研发的多模态预训练模型文澜与最新的图像生成技术进行创新结合,打造了一款最懂中国传统文化的 AI 绘画生成模型


文澜模型是中国人民大学高瓴人工智能学院执行院长文继荣教授、卢志武教授、宋睿华长聘副教授等领衔研发的大规模中文多模态预训练模型。文澜模型经过 6.5 亿弱相关中文图文对的预训练,学习到独特的中文语义理解能力并能很好地将中文语义与视觉信息联系起来,尤其擅长读取中文独有的含蓄语义与图片中的抽象概念。


今年 6 月,相关研究成果 “Towards artificial general intelligence via a multimodal foundation model” 已经发表在 Nature Communications(《自然 · 通讯》)上。


论文链接:https://www.nature.com/articles/s41467-022-30761-2


文澜与生成模型的结合


该研究团队通过挖掘文澜模型的潜力,将其与最新的生成技术进行创新性的结合,融合文澜的抽象语义理解能力与生成模型的强大生成能力,确保得到的模型能够出色地解读输入文本的语义并生成具有对应语义的图片。


团队专注于挖掘文澜在中国传统文化上的潜力,借用最新的生成模型架构,并在所搜集的国画数据集上进行训练,得到的模型能根据输入文本生成对应风格的图片。详细架构图如下所示。


具体来说,团队在国画数据集上训练了一个无条件生成模型,并通过迭代生成的方式用文澜模型对生成过程进行引导。


该方法首先随机初始化一张噪声图片。在每一步生成中,模型都会将生成的图片沿着与输入文本接近的方向调整生成图片的内容,使得每一步生成的图片内容与输入文本在文澜模型的隐空间中趋于一致。该步骤可描述为:


其中 x 和 y 分别表示图片和文本,IE 和 TE 分别表示文澜的图片编码器和文本编码器。通过不断迭代,该模型能够实现根据文本语义生成高质量符图片的功能。


文澜绘画模型的评测结果


由于文澜模型本身的特点,文澜绘画模型能够根据输入的中国古诗词生成对应的图片。从下述的例子可以看出,模型生成的图片与古诗词的内容和意境都非常契合。


同时,团队还发现文澜绘画模型甚至对晦涩难懂的儒释道思想也有独到的解读,生成的 AI 绘画作品获得了王阳明心学研究专家姜洋教授的高度认可


为了更好地展现文澜绘画模型在解读儒释道思想上的特色,团队挑选了国内外最热门的 AI 绘画模型进行对比分析,包含盗梦师、文心、Disco Diffusion、Midjourney 和 Stable Diffusion。其中对 Disco Diffusion、Midjourney 和 Stable Diffusion 而言,中文文本需要先经过百度翻译。


首先在儒家思想方面,团队挑选了王阳明心学的三句代表性话。从下图生成的结果来看,盗梦师、Disco Diffusion、Midjourney 和 Stable Diffusion 偏向于生成句子中的一些具象物体或者生成一些画面较好但内容与句子并无太大关系的图片。文心则是倾向于生成带有人物的图片,甚至将光明直接对应成点燃的蜡烛。


而文澜绘画模型能够更好地读取整句话的意思以及其中蕴含的儒家思想,从而生成更契合该思想的图片。

 

文澜解读儒家思想。

其次对于含有释家思想的文本输入,目前最火的绘画生成模型均只能抓住其中的一些具象物体并进行针对性生成,有的绘画模型甚至有可能误解其中的思想。


如下图生成结果所示,文心将 “见道忘山者人间亦寂也,见山忘道者山中也喧也” 理解成道家的思想(生成了一个道士的形象)。文澜绘画模型则很好地解读输入文本的释家思想并将之反映在生成的图片中。

 

文澜解读释家思想

最后在道家思想方面,团队挑选了道德经中最核心的三句话。文心相对于盗梦师、Disco Diffusion、Midjourney 和 Stable Diffusion,对道德经有较好的解读能力。


但整体来说,文澜绘画模型对道家思想解读得更加到位,生成的图片更具有道家的意境。


文澜解读道家思想

总结


文澜团队将近期大火的 AI 绘画生成技术与中文多模态预训练模型文澜相结合,深度挖掘文澜模型在中国传统文化上的潜力,并通过生成模型以图片的形式展现出来,从而让普通大众对一些深奥的中国传统文化思想有了更直观的了解。

相关文章
|
4天前
|
人工智能 供应链 PyTorch
TimesFM 2.0:用 AI 预测流量、销量和金融市场等走势!谷歌开源超越统计方法的预测模型
TimesFM 2.0 是谷歌研究团队开源的时间序列预测模型,支持长达2048个时间点的单变量预测,具备零样本学习能力,适用于零售、金融、交通等多个领域。
68 23
TimesFM 2.0:用 AI 预测流量、销量和金融市场等走势!谷歌开源超越统计方法的预测模型
|
8天前
|
人工智能 编解码
通义万相2.1:VBench榜单荣登第一!阿里通义万相最新视频生成模型,支持生成1080P长视频
万相2.1是阿里通义万相最新推出的视频生成模型,支持1080P无限长视频生成,具备复杂动作展现、物理规律还原、艺术风格转换等功能。
168 26
通义万相2.1:VBench榜单荣登第一!阿里通义万相最新视频生成模型,支持生成1080P长视频
|
8天前
|
机器学习/深度学习 人工智能 安全
GLM-Zero:智谱AI推出与 OpenAI-o1-Preview 旗鼓相当的深度推理模型,开放在线免费使用和API调用
GLM-Zero 是智谱AI推出的深度推理模型,专注于提升数理逻辑、代码编写和复杂问题解决能力,支持多模态输入与完整推理过程输出。
112 24
GLM-Zero:智谱AI推出与 OpenAI-o1-Preview 旗鼓相当的深度推理模型,开放在线免费使用和API调用
|
10天前
|
数据采集 人工智能 算法
Seer:上海 AI Lab 与北大联合开源端到端操作模型,结合视觉预测与动作执行信息,使机器人任务提升成功率43%
Seer是由上海AI实验室与北大等机构联合推出的端到端操作模型,结合视觉预测与动作执行,显著提升机器人任务成功率。
49 20
Seer:上海 AI Lab 与北大联合开源端到端操作模型,结合视觉预测与动作执行信息,使机器人任务提升成功率43%
|
13天前
|
机器学习/深度学习 人工智能 编解码
Inf-DiT:清华联合智谱AI推出超高分辨率图像生成模型,生成的空间复杂度从 O(N^2) 降低到 O(N)
Inf-DiT 是清华大学与智谱AI联合推出的基于扩散模型的图像上采样方法,能够生成超高分辨率图像,突破传统扩散模型的内存限制,适用于多种实际应用场景。
67 21
Inf-DiT:清华联合智谱AI推出超高分辨率图像生成模型,生成的空间复杂度从 O(N^2) 降低到 O(N)
|
10天前
|
人工智能 测试技术
陶哲轩联手60多位数学家出题,世界顶尖模型通过率仅2%!专家级数学基准,让AI再苦战数年
著名数学家陶哲轩联合60多位数学家推出FrontierMath基准测试,评估AI在高级数学推理方面的能力。该测试涵盖数论、实分析等多领域,采用新问题与自动化验证,结果显示最先进AI通过率仅2%。尽管存在争议,这一基准为AI数学能力发展提供了明确目标和评估工具,推动AI逐步接近人类数学家水平。
62 37
|
10天前
|
人工智能 编解码 自然语言处理
Aria-UI:港大联合 Rhymes AI 开源面向 GUI 智能交互的多模态模型,整合动作历史信息实现更加准确的定位
Aria-UI 是香港大学与 Rhymes AI 联合开发的多模态模型,专为 GUI 智能交互设计,支持高分辨率图像处理,适用于自动化测试、用户交互辅助等场景。
64 11
Aria-UI:港大联合 Rhymes AI 开源面向 GUI 智能交互的多模态模型,整合动作历史信息实现更加准确的定位
|
2天前
|
存储 人工智能 数据可视化
昇腾AI行业案例(五):基于 DANet 和 Deeplabv3 模型的遥感图像分割
欢迎学习《基于 DANet 和 Deeplabv3 模型的遥感图像分割》实验。在本实验中,你将深入了解如何运用计算机视觉(CV)领域的 AI 模型,搭建一个高效精准的遥感地图区域分割系统,并利用开源数据集和昇腾 AI 芯片对模型效果加以验证。
6 0
昇腾AI行业案例(五):基于 DANet 和 Deeplabv3 模型的遥感图像分割
|
3天前
|
存储 Serverless 文件存储
AI 场景下,函数计算 GPU 实例模型存储最佳实践
当前,函数计算 FC 已被广泛应用在各种 AI 场景下,函数计算支持通过使用容器镜像部署 AI 推理应用,并且提供多种选项来访问训练好的模型。为了帮助开发者高效地在函数计算上部署 AI 推理应用,并快速解决不同场景下的模型存储选型问题,本文将对函数计算的 GPU 模型存储的优缺点及适用场景进行对比分析,以期为您的模型存储决策提供帮助。
|
13天前
|
人工智能 物联网
如何将Together AI上基于Qwen2-7B训练的模型部署到ModelScope平台
如何将Together AI上基于Qwen2-7B训练的模型部署到ModelScope平台
56 10

热门文章

最新文章