牛!谷歌向量空间法:图片译成文字

简介:

概述:谷歌工程师利用和语言翻译类似的技术开发出了一个用于翻译图片主题的机器学习算法


将一种语言自动翻译成另一种语言一直以来都是难以攻克的问题。但最近几年,谷歌通过开发机器翻译算法改变了传统的翻译过程,通过谷歌翻译从本质上改变了跨文化翻译交流。


如今,谷歌正在运用同样的机器学习技术将图片转变为文字。其结果就是自动产生能够准确描述图片内容的标题。该技术将用在互联网搜索引擎,图片自动发表,视觉受损者的网页浏览,以及其他更为广阔的领域。


翻译语言的传统步骤是一个更迭的过程 - 从个体单词的翻译开始,然后通过重新排列单词和短语的顺序来提高翻译的准确性。但是近几年来,通过完全不同的方式,谷歌已经能够运用自己超大规模的搜索数据库来转换文字。


谷歌运用的方法的本质是统计相邻或相近单词出现的频率,并且在向量空间中定义他们之间的关系。通过这样的方法,每一个单词就可以用一个向量在空间中表示出来,每一个句子则是不同向量的组合。接下来谷歌做了一个重要的假设 - 无论什么语言,特定的单词之间具备相同的关系。例如,在所有语言中,向量“国王-男人+女人=皇后”都应该是一个真命题。


这就使得语言翻译成为了向量空间学里的一个问题。谷歌翻译是通过这一方式实现这一过程的:先把句子转换成向量,然后使用这个向量产生意思相同,另一种语言的句子。


现在Oriol Vinyals 和他在谷歌的合作者们正在使用类似的方法将图片转化为文字。他们的技术是使用神经网络去学习10万个图片的数据集合以及他们的标题,以此来实现如何对这些图片的内容进行分类。


但是除了生成一组可以描述图片的单词,他们的算法同样可以生成代表单词之间关系的向量。这个向量可以和谷歌现有的翻译算法结合起来去生成英语标题,或者任何其他语言的标题。事实上,谷歌的机器学习方法已经可以将图片转换为单词。


为了考量这种方法的效果,他们从亚马逊的”mechanical turk” (提供不同技能的劳动力资源平台)雇佣了评估者来对通过上述方法自动产生的标题,以及其他方法和人工翻译的标题进行评分。


结果显示被谷歌叫做神经图片标题(Neural Image Caption, NIC)的新系统非常成功。使用一个叫做PASCAL的被大家所熟知的图片数据集,神经图片标题的翻译功能明显超出其他的非人工翻译方法。据Vinyals说,NIC的BLEU (wiki) 分数是59,现今最好的非人工翻译技术的分数是25,人工翻译的分数是69。


这是个不错的结果,并且随着训练数据集的增大,这个方法产生的结果会更好。“从实验中我们非常清楚地看到,由于数据集的增大,NIC的翻译功能也相应得到提高。”谷歌团队说。


下图是一组图片翻译结果的示例-按翻译结果评分分组:


很明显,这是另一个在不久的将来机器会超越人类的项目。谷歌原论文题目:Show and Tell: A Neural ImageCaption Generator

论文链接:arxiv.org/abs/1411.4555


编者注:最近升级版的“谷歌翻译“中,已经增加了类似的功能,叫做“Word Lens“,下文摘自雷锋网(leiphone.com)

原文链接 http://www.leiphone.com/news/201501/4d8lzMhsZBfqy1NG.html


iOS版谷歌翻译推出了更新版本,新版本增加了“Word Lens”功能,可以直接对镜头捕捉到的文字图像进行实时翻译,并显示在相机视图上。并且,即使在没有网络连接的时候也能使用。遗憾的是,目前支持翻译的文字有限,仅包括英语、法语、俄语、德语、意大利语、葡萄牙语和西班牙语,不过未来会支持更多语言。


此外,新版本还增加了实时会话模式,可以在双方使用自然语速进行语音对话时,自动识别双方的语种并进行实时翻译。



摘自:MIT TechnologyReview

原文链接:


http://www.technologyreview.com/view/532886/how-google-translates-pictures-into-words-using-vector-space-mathematics/



译者:Cathy Xi Kan简介

阚玺(Cathy Xi Kan) 2012年获得了美国纽约州伦斯勒理工学院(Rensselaer Polytechnic Institute)决策科学专业(Decision Science)的博士学位。在她4年的博士学习中,Cathy对于决策模型的建立,运筹管理以及数据挖掘与分析等多项领域产生了浓厚的兴趣。毕业后,Cathy成为了一名资深的商业决策分析师,先后加入全美第二大肿瘤研制中心(Memorial Sloan-Kettering Cancer Center)的战略计划团队和全美第一大电子折扣网站(RetailMeNot, Inc.)的商业智能和分析团队工作。这些团队主要负责运用大数据分析向公司管理决策层提供有价值的商业决策建议。


2015年Cathy希望通过大数据文摘平台广泛结交业内人士及爱好者,并希望有机会多多参与国际国内大数据和电子商务相关的会议及交流活动。有意者可后台留言或私信。


原文发布时间为:2015-01-17

本文来自云栖社区合作伙伴“大数据文摘”,了解相关信息可以关注“BigDataDigest”微信公众号

相关文章
|
20天前
|
人工智能 自然语言处理 Shell
🦞 如何在 OpenClaw (Clawdbot/Moltbot) 配置阿里云百炼 API
本教程指导用户在开源AI助手Clawdbot中集成阿里云百炼API,涵盖安装Clawdbot、获取百炼API Key、配置环境变量与模型参数、验证调用等完整流程,支持Qwen3-max thinking (Qwen3-Max-2026-01-23)/Qwen - Plus等主流模型,助力本地化智能自动化。
32261 117
🦞 如何在 OpenClaw (Clawdbot/Moltbot) 配置阿里云百炼 API
|
9天前
|
应用服务中间件 API 网络安全
3分钟汉化OpenClaw,使用Docker快速部署启动OpenClaw(Clawdbot)教程
2026年全新推出的OpenClaw汉化版,是基于Claude API开发的智能对话系统本土化优化版本,解决了原版英文界面的使用壁垒,实现了界面、文档、指令的全中文适配。该版本采用Docker容器化部署方案,开箱即用,支持Linux、macOS、Windows全平台运行,适配个人、企业、生产等多种使用场景,同时具备灵活的配置选项和强大的扩展能力。本文将从项目简介、部署前准备、快速部署、详细配置、问题排查、监控维护等方面,提供完整的部署与使用指南,文中包含实操代码命令,确保不同技术水平的用户都能快速落地使用。
4738 4
|
15天前
|
人工智能 安全 机器人
OpenClaw(原 Clawdbot)钉钉对接保姆级教程 手把手教你打造自己的 AI 助手
OpenClaw(原Clawdbot)是一款开源本地AI助手,支持钉钉、飞书等多平台接入。本教程手把手指导Linux下部署与钉钉机器人对接,涵盖环境配置、模型选择(如Qwen)、权限设置及调试,助你快速打造私有、安全、高权限的专属AI助理。(239字)
6834 18
OpenClaw(原 Clawdbot)钉钉对接保姆级教程 手把手教你打造自己的 AI 助手
|
14天前
|
人工智能 机器人 Linux
OpenClaw(Clawdbot、Moltbot)汉化版部署教程指南(零门槛)
OpenClaw作为2026年GitHub上增长最快的开源项目之一,一周内Stars从7800飙升至12万+,其核心优势在于打破传统聊天机器人的局限,能真正执行读写文件、运行脚本、浏览器自动化等实操任务。但原版全英文界面对中文用户存在上手门槛,汉化版通过覆盖命令行(CLI)与网页控制台(Dashboard)核心模块,解决了语言障碍,同时保持与官方版本的实时同步,确保新功能最快1小时内可用。本文将详细拆解汉化版OpenClaw的搭建流程,涵盖本地安装、Docker部署、服务器远程访问等场景,同时提供环境适配、问题排查与国内应用集成方案,助力中文用户高效搭建专属AI助手。
4803 11
|
16天前
|
人工智能 机器人 Linux
保姆级 OpenClaw (原 Clawdbot)飞书对接教程 手把手教你搭建 AI 助手
OpenClaw(原Clawdbot)是一款开源本地AI智能体,支持飞书等多平台对接。本教程手把手教你Linux下部署,实现数据私有、系统控制、网页浏览与代码编写,全程保姆级操作,240字内搞定专属AI助手搭建!
5683 21
保姆级 OpenClaw (原 Clawdbot)飞书对接教程 手把手教你搭建 AI 助手
|
12天前
|
人工智能 JavaScript 安全
Claude Code 安装指南
Claude Code 是 Anthropic 推出的本地 AI 编程助手,支持 Mac/Linux/WSL/Windows 多平台一键安装(Shell/PowerShell/Homebrew/NPM),提供 CLI 交互、代码生成、审查、Git 提交等能力,并内置丰富斜杠命令与自动更新机制。
4294 0
|
16天前
|
存储 人工智能 机器人
OpenClaw是什么?阿里云OpenClaw(原Clawdbot/Moltbot)一键部署官方教程参考
OpenClaw是什么?OpenClaw(原Clawdbot/Moltbot)是一款实用的个人AI助理,能够24小时响应指令并执行任务,如处理文件、查询信息、自动化协同等。阿里云推出的OpenClaw一键部署方案,简化了复杂配置流程,用户无需专业技术储备,即可快速在轻量应用服务器上启用该服务,打造专属AI助理。本文将详细拆解部署全流程、进阶功能配置及常见问题解决方案,确保不改变原意且无营销表述。
6258 6
|
18天前
|
人工智能 JavaScript 应用服务中间件
零门槛部署本地AI助手:Windows系统Moltbot(Clawdbot)保姆级教程
Moltbot(原Clawdbot)是一款功能全面的智能体AI助手,不仅能通过聊天互动响应需求,还具备“动手”和“跑腿”能力——“手”可读写本地文件、执行代码、操控命令行,“脚”能联网搜索、访问网页并分析内容,“大脑”则可接入Qwen、OpenAI等云端API,或利用本地GPU运行模型。本教程专为Windows系统用户打造,从环境搭建到问题排查,详细拆解全流程,即使无技术基础也能顺利部署本地AI助理。
7769 17