业界首个支持9种语言的文图生成模型!智源AltDiffusion开源技术解读

简介: 业界首个支持9种语言的文图生成模型!智源AltDiffusion开源技术解读


AIGC(AI-Generated Content 人工智能生成内容)是当前 AI 领域最热门的话题之一,受到学界、业界的广泛关注。尤其是伴随着 OpenAI DALL·E 2 的推出到 Stable Diffusion 的开源,文图生成也从之前的研究探索发展到了具有商业化落地潜力的新兴技术。最近一段时间,随着文本生成图像跨模态应用的不断涌现,AIGC 更是火爆出圈,广受关注。


然而,中文和其他语言的文图生成发展滞后于英语世界,大部分团队主要是基于翻译 API + 英文 Stable Diffusion 模型进行开发。在这个背景下,来自智源研究院的研究者通过搭建多语言文图表征模型 AltCLIP,提出了首个支持 9 种语言(英文、中文、日语、法语、韩语、西班牙语、俄语、意大利语、阿拉伯语)的文图生成模型 AltDiffusion。


该研究的主要贡献是搭建了一个多语言文图生成模型的基石,使得更多使用不同语言的创作者可以通过 AltDiffusion 模型进行创作。在 AltDiffusion 中可以观测到一些十分有意思的现象:不同的语言背后蕴含了不同的文化背景,这一点也在 AltDiffusion 生成的图片中有一定程度的反映。


为了方面大家更好的了解这一研究,在最新一期的线上分享中,机器之心邀请到了智源人工智能研究院自然语言和多模态研究负责人及 FlagAI 飞智开源项目负责人伍昱 (Ledell Wu) 为我们介绍关于多语言文图生成模型 AltDiffusion 和多语言多模态表征模型 AltCLIP。




分享主题:AltDiffusion: A multilingual text-to-image generation model


分享摘要:本次分享将介绍多语言文图生成模型 AltDiffusion 和多语言多模态表征模型 AltCLIP。AltCLIP 通过创新换塔和语言对齐等方式,搭建了一个支持多种语言的文图表征模型。AltDiffusion 使用 AltCLIP 作为文本表征,基于 Stable Diffusion 训练了支持 9 种语言的文图生成模型,为目前业界首个支持多种语言的文图生成模型。


嘉宾简介:伍昱(Ledell Wu),智源人工智能研究院自然语言和多模态研究负责人及 FlagAI 飞智开源项目负责人。Facebook AI Research(FAIR)初期成员之一,主导了 StarSpace、PyTorch-BigGraph 和 BLINK 等多个深度学习研究项目和相应工程落地。热爱研究,热爱技术,崇尚极客。

相关文章
|
XML JSON JavaScript
如何在js中,读取json文件?
如何在js中,读取json文件?
|
6天前
|
存储 人工智能 自然语言处理
基于Agent-SDK的Claude 记忆插件来了:上下文不再丢,Agent 开始“记住你是谁”
claude-mem 是为 Claude Code 设计的轻量级长期记忆系统,通过AI驱动的记忆抽取、压缩与精准注入,解决Agent“写完就忘”、上下文污染、经验无法复用等工程痛点,让AI真正具备持续学习能力。
|
5天前
|
SQL 人工智能 缓存
Claude Code自动模式上线:AI开始自己改代码了
Claude Code上线“自动模式”:AI获代码修改与文件写入权限,从“建议执行”升级为“直接执行”。这不仅是效率提升,更是开发权向AI转移的开端,重构输入方式、控制逻辑与开发者角色。测试、安全与边界管控成新焦点。
|
6月前
|
JavaScript 前端开发 Java
基于springboot的养老院管理系统
随着人口老龄化加剧,传统养老院管理效率低下,亟需信息化升级。本文基于Java、Spring Boot、Vue等技术构建智慧养老系统,结合MySQL与MyBatis实现数据高效管理,提升服务精准性与运营效率,推动养老服务向智能化、现代化发展。
|
机器学习/深度学习 编解码 JSON
Qwen2.5-VL!Qwen2.5-VL!!Qwen2.5-VL!!!
Qwen2.5-VL!Qwen2.5-VL!!Qwen2.5-VL!!!
|
文字识别 测试技术 语音技术
看听说写四维突破:Qwen2.5-Omni 端到端多模态模型开源!
今天,通义千问团队发布了 Qwen2.5-Omni,Qwen 模型家族中新一代端到端多模态旗舰模型。该模型专为全方位多模态感知设计,能够无缝处理文本、图像、音频和视频等多种输入形式,并通过实时流式响应同时生成文本与自然语音合成输出。
2952 6
看听说写四维突破:Qwen2.5-Omni 端到端多模态模型开源!
|
10月前
|
机器学习/深度学习 编解码 文字识别
小米又放大招!MiMo-VL 多模态大模型开源,魔搭推理微调全面解读来了!
今天,小米开源发布两款 7B 规模视觉-语言模型 MiMo-VL-7B-SFT 和 MiMo-VL-7B-RL。
1337 9
|
机器学习/深度学习 人工智能 程序员
[AI StoryDiffusion] 创造神奇故事,AI漫画大乱斗!
探索神奇AI项目StoryDiffusion,为您带来一致性连贯的图像和视频创作体验。
[AI StoryDiffusion] 创造神奇故事,AI漫画大乱斗!
|
SQL 人工智能 DataWorks
DataWorks:新一代 Data+AI 数据开发与数据治理平台演进
本文介绍了阿里云 DataWorks 在 DA 数智大会 2024 上的最新进展,包括新一代智能数据开发平台 DataWorks Data Studio、全新升级的 DataWorks Copilot 智能助手、数据资产治理、全面云原生转型以及更开放的开发者体验。这些更新旨在提升数据开发和治理的效率,助力企业实现数据价值最大化和智能化转型。
3301 7
|
XML Go 数据格式
Windows自定义后台进程并设置为开机启动
可以在`Windows`上配置任意一个可执行文件后台启动,并且设置为开机启动。
Windows自定义后台进程并设置为开机启动

热门文章

最新文章