业界首个支持9种语言的文图生成模型!智源AltDiffusion开源技术解读

简介: 业界首个支持9种语言的文图生成模型!智源AltDiffusion开源技术解读


AIGC(AI-Generated Content 人工智能生成内容)是当前 AI 领域最热门的话题之一,受到学界、业界的广泛关注。尤其是伴随着 OpenAI DALL·E 2 的推出到 Stable Diffusion 的开源,文图生成也从之前的研究探索发展到了具有商业化落地潜力的新兴技术。最近一段时间,随着文本生成图像跨模态应用的不断涌现,AIGC 更是火爆出圈,广受关注。


然而,中文和其他语言的文图生成发展滞后于英语世界,大部分团队主要是基于翻译 API + 英文 Stable Diffusion 模型进行开发。在这个背景下,来自智源研究院的研究者通过搭建多语言文图表征模型 AltCLIP,提出了首个支持 9 种语言(英文、中文、日语、法语、韩语、西班牙语、俄语、意大利语、阿拉伯语)的文图生成模型 AltDiffusion。


该研究的主要贡献是搭建了一个多语言文图生成模型的基石,使得更多使用不同语言的创作者可以通过 AltDiffusion 模型进行创作。在 AltDiffusion 中可以观测到一些十分有意思的现象:不同的语言背后蕴含了不同的文化背景,这一点也在 AltDiffusion 生成的图片中有一定程度的反映。


为了方面大家更好的了解这一研究,在最新一期的线上分享中,机器之心邀请到了智源人工智能研究院自然语言和多模态研究负责人及 FlagAI 飞智开源项目负责人伍昱 (Ledell Wu) 为我们介绍关于多语言文图生成模型 AltDiffusion 和多语言多模态表征模型 AltCLIP。




分享主题:AltDiffusion: A multilingual text-to-image generation model


分享摘要:本次分享将介绍多语言文图生成模型 AltDiffusion 和多语言多模态表征模型 AltCLIP。AltCLIP 通过创新换塔和语言对齐等方式,搭建了一个支持多种语言的文图表征模型。AltDiffusion 使用 AltCLIP 作为文本表征,基于 Stable Diffusion 训练了支持 9 种语言的文图生成模型,为目前业界首个支持多种语言的文图生成模型。


嘉宾简介:伍昱(Ledell Wu),智源人工智能研究院自然语言和多模态研究负责人及 FlagAI 飞智开源项目负责人。Facebook AI Research(FAIR)初期成员之一,主导了 StarSpace、PyTorch-BigGraph 和 BLINK 等多个深度学习研究项目和相应工程落地。热爱研究,热爱技术,崇尚极客。

相关文章
|
XML JSON JavaScript
如何在js中,读取json文件?
如何在js中,读取json文件?
|
10月前
|
机器学习/深度学习 编解码 JSON
Qwen2.5-VL!Qwen2.5-VL!!Qwen2.5-VL!!!
Qwen2.5-VL!Qwen2.5-VL!!Qwen2.5-VL!!!
|
9月前
|
文字识别 测试技术 语音技术
看听说写四维突破:Qwen2.5-Omni 端到端多模态模型开源!
今天,通义千问团队发布了 Qwen2.5-Omni,Qwen 模型家族中新一代端到端多模态旗舰模型。该模型专为全方位多模态感知设计,能够无缝处理文本、图像、音频和视频等多种输入形式,并通过实时流式响应同时生成文本与自然语音合成输出。
2032 6
看听说写四维突破:Qwen2.5-Omni 端到端多模态模型开源!
|
6月前
|
机器学习/深度学习 编解码 文字识别
小米又放大招!MiMo-VL 多模态大模型开源,魔搭推理微调全面解读来了!
今天,小米开源发布两款 7B 规模视觉-语言模型 MiMo-VL-7B-SFT 和 MiMo-VL-7B-RL。
1031 9
|
6月前
|
存储 运维 分布式计算
OSS迁移实战:从自建MinIO到阿里云OSS的完整数据迁移方案
本文介绍了从自建MinIO迁移至阿里云OSS的完整方案,涵盖成本优化、稳定性提升与生态集成需求。通过双写代理、增量同步、分层校验等技术,解决数据一致性、权限迁移、海量小文件处理等挑战,实现业务零中断与数据强一致性,最终达成79%的TCO降低和显著性能提升。
1616 0
|
机器学习/深度学习 人工智能 程序员
[AI StoryDiffusion] 创造神奇故事,AI漫画大乱斗!
探索神奇AI项目StoryDiffusion,为您带来一致性连贯的图像和视频创作体验。
[AI StoryDiffusion] 创造神奇故事,AI漫画大乱斗!
|
负载均衡 监控 Dubbo
Dubbo 原理和机制详解(非常全面)
本文详细解析了 Dubbo 的核心功能、组件、架构设计及调用流程,涵盖远程方法调用、智能容错、负载均衡、服务注册与发现等内容。欢迎留言交流。关注【mikechen的互联网架构】,10年+BAT架构经验倾囊相授。
Dubbo 原理和机制详解(非常全面)
|
SQL 人工智能 DataWorks
DataWorks:新一代 Data+AI 数据开发与数据治理平台演进
本文介绍了阿里云 DataWorks 在 DA 数智大会 2024 上的最新进展,包括新一代智能数据开发平台 DataWorks Data Studio、全新升级的 DataWorks Copilot 智能助手、数据资产治理、全面云原生转型以及更开放的开发者体验。这些更新旨在提升数据开发和治理的效率,助力企业实现数据价值最大化和智能化转型。
2829 7
|
机器学习/深度学习 移动开发 JavaScript
Web实时通信的学习之旅:SSE(Server-Sent Events)的技术详解及简单示例演示
Web实时通信的学习之旅:SSE(Server-Sent Events)的技术详解及简单示例演示
5750 0