ELITE项目原作解读:基于扩散模型的快速定制化图像生成

简介: ELITE项目原作解读:基于扩散模型的快速定制化图像生成


近年来,大规模预训练的扩散模型(如 Imagen、DALLE-2、Stable Diffusion)在图像生成方面取得了巨大进展,尤其是在文本到图像生成任务中。根据给定的文本,现有的大模型能够生成多样且逼真的图像。然而这些模型依然难以满足用户对于生成结果精细控制的需求,特别是生成特定视觉概念的要求。定制化文本到图像生成方法,如 Textual Inversion、Custom Diffusion 等通过将给定的视觉概念表示成文本嵌入,可以更方便地实现对特定概念的生成和编辑。然而这些方法通常基于优化的方式来学习文本嵌入,需要较长时间(几分钟至几十分钟)学习新概念,限制了其实际应用效果。

为了实现快速的定制化文本到图像生成,我们提出一种基于模型的方法 ELITE。首先,ELITE 利用全局编码网络将视觉概念直接映射到文本嵌入,并在训练时引入多层特征策略以提升文本嵌入的可编辑性。同时,ELITE 使用局部编码网络进行细节补充,以更好地平衡定制化生成的一致性和可编辑性。实验结果表明,ELITE 可以在极短的时间内(小于 0.1 秒)学习新的视觉概念,并可以进行高效的编辑。

机器之心最新一期线上分享邀请到了哈尔滨工业大学博士生魏于翔,为大家分享他们近期工作 ELITE。


分享主题:ELITE:基于扩散模型的快速定制化图像生成

分享嘉宾:魏于翔,哈尔滨工业大学博士生,主要研究方向为图像生成,曾在 CVPR, ICCV, ECCV 等会议上发表论文数篇。

分享摘要:ELITE 是一种基于模型的快速定制化文本到图像生成方法。其首先利用全局编码网络将视觉概念直接映射到文本嵌入,并结合局部编码网络对概念细节进行补充,以更好地平衡定制化生成的一致性和可编辑性。实验证明 ELITE 能够以极高的效率(<0.1秒)得到新的视觉概念,并可以高效快捷的编辑。

相关链接:

1)SOTA!模型平台项目主页链接:

https://sota.jiqizhixin.com/project/elite

2)论文链接:

https://arxiv.org/abs/2302.13848

3)代码仓库:

https://github.com/csyxwei/ELITE

相关文章
|
测试技术 索引
Elasticsearch search after分页检索案例
Elasticsearch search after分页检索案例分享 The best elasticsearch highlevel java rest api-----bboss 1.准备工作 参考文档《高性能elasticsearch ORM开发库使用介绍》导入和配置es客户端 2.
5899 0
|
5G
蜂窝网络
蜂窝网络
1419 1
|
存储 关系型数据库 MySQL
PHP与MySQL动态网站开发:从基础到实践####
本文将深入探讨PHP与MySQL的结合使用,展示如何构建一个动态网站。通过一系列实例和代码片段,我们将逐步了解数据库连接、数据操作、用户输入处理及安全防护等关键技术点。无论您是初学者还是有经验的开发者,都能从中获益匪浅。 ####
|
机器学习/深度学习 数据采集 人工智能
基于可图Kolors的皮影戏风格LoRA训练&创作
可图Kolors-LoRA风格故事挑战赛比赛过程心得分享
459 8
基于可图Kolors的皮影戏风格LoRA训练&创作
|
机器学习/深度学习 PyTorch TensorFlow
ONNX 与量化:提高模型效率
【8月更文第27天】随着人工智能技术的广泛应用,模型部署变得越来越重要。为了在资源受限的设备上运行复杂的机器学习模型,模型量化技术成为了一种有效的手段。Open Neural Network Exchange (ONNX) 作为一种开放格式,支持在不同框架之间交换训练好的模型,同时也支持模型量化。本文将探讨如何结合 ONNX 和模型量化技术来提高模型的效率,减少模型大小并加快推理速度。
2449 2
|
机器学习/深度学习 缓存 编解码
AIGC 商业化道路探索 - Stable Diffusion 商业化应用(上)
Stable Diffusion 应用到商业领域的案例越来越多,商用场景下的技术架构应当如何构建?本文基于阿里云近期的一个 Stable Diffusion 商业案例,对大规模底模切换、大量 LoRA 调优的场景提出一个商业场景适用的技术架构,并已实现部署交付,稳定运行。
|
机器学习/深度学习 人工智能 自然语言处理
蚂蚁集团持续探索生成式AI,20篇论文入选AI顶会NeurlPS
NeurlPS官方数据显示,本届会议共有12343篇有效论文投稿,接收率为26.1%。蚂蚁集团20篇论文被收录。 据了解,蚂蚁此次入选的论文,覆盖计算机视觉、自然语言处理、图神经网络、图像处理等多个人工智能和机器学习领域的前沿主题。其中七成以上论文聚焦生成式AI在高速发展中遇到的一些挑战和难题。
蚂蚁集团持续探索生成式AI,20篇论文入选AI顶会NeurlPS
|
XML Java 数据格式
Spring系列文章3:基于注解方式依赖注入
Spring系列文章3:基于注解方式依赖注入
245 0
|
机器学习/深度学习 数据可视化 算法框架/工具
【深度学习】Generative Adversarial Networks ,GAN生成对抗网络分类
文章概述了生成对抗网络(GANs)的不同变体,并对几种经典GAN模型进行了简介,包括它们的结构特点和应用场景。此外,文章还提供了一个GitHub项目链接,该项目汇总了使用Keras实现的各种GAN模型的代码。
553 0
|
机器学习/深度学习 算法 物联网
LoRA及其变体概述:LoRA, DoRA, AdaLoRA, Delta-LoRA
LoRA可以说是针对特定任务高效训练大型语言模型的重大突破。它被广泛应用于许多应用中。在本文中,我们将解释LoRA本身的基本概念,然后介绍一些以不同的方式改进LoRA的功能的变体,包括LoRA+、VeRA、LoRA- fa、LoRA-drop、AdaLoRA、DoRA和Delta-LoRA。
1377 2