谷歌、OpenAI学者谈AI:语言模型正在努力「攻克」数学

简介: 谷歌、OpenAI学者谈AI:语言模型正在努力「攻克」数学

作者:Dan Garisto

机器之心编译

编辑:陈萍

AI 到底擅不擅长数学,还得具体问题具体分析。


如果问计算机擅长什么,在所有的答案里,数学必须榜上有名。在经历了漫长的研究之后,顶尖学者们在研究计算机关于数学计算方面的发展,取得了令人惊讶的成绩。


就拿去年来说,来自加州大学伯克利分校、OpenAI 和 Google 的研究人员在语言模型方面取得了长足的进步,GPT-3、DALL·E 2 等被开发出来。然而,直到现在,语言模型还无法解决一些简单的、用语言描述的数学问题,例如「Alice 比 Bob 多五个球,Bob 在给 Charlie 四个球后有两个球。问 Alice 有几个球?」这对语言模型来说,想要给出正确答案,可能就有点「吃力」了。


「当我们说计算机非常擅长数学时,意思是它们非常擅长特定的、具体的事情,」来自谷歌的机器学习专家 Guy Gur-Ari 表示。计算机擅长算术是不假,但在特定的模式之外,计算机就无能为力了,简单的文字描述题都回答不了。


谷歌研究员 Ethan Dyer 曾经表示:做数学研究的人有一套僵化的推理系统,对于他们熟知的和不了解的内容,这两者之间有着明显的鸿沟。


解决文字问题或定量推理问题很棘手,因为不同于其他问题,这两者需要鲁棒性和严谨性。如果过程中的任何一步出现错误,将会导致错误的答案。DALL·E 在绘画方面令人印象深刻,尽管它生成的图像有时会很奇怪,可能遗漏人的手指、眼睛长得奇怪…… 这些我们都能接受,但是它在数学方面出现了错误,我们的容忍度就会非常小。来自 OpenAI 的机器学习专家 Vineet Kosaraju 也曾表达过这种想法,「我们对语言模型所犯的数学错误(比如将 10 误解为 1 和 0,而不是 10)容忍性还是比较小的。」


「我们研究数学仅仅是因为我们发现它独立且非常有趣,」OpenAI 机器学习专家 Karl Cobbe 说。


随着机器学习模型在更大的数据样本上训练而成,它们的鲁棒性更好、出错也更少。但扩大模型规模似乎只能通过定量推理进行。研究人员意识到,对于语言模型所犯的错误似乎需要更有针对性的方法来解决。


去年,加州大学伯克利分校和 OpenAI 的两个研究团队分别发布了数据集 MATH 和 GSM8K,这两个数据集包含几何、代数、初等数学等数千个数学问题。「我们想看看这是否是数据集的问题,」从事数学工作的 AI 安全中心研究员 Steven Basart 说。众所周知,语言模型不擅长单词问题,在这个问题上它们表现的有多糟糕,是否可以通过引入格式更好、更大的数据集来解决?


在 MATH 数据集上,顶级语言模型的准确率为 7%,而人类研究生的准确率为 40%,奥林匹克冠军的准确率为 90%。在 GSM8K 数据集上(小学级别的问题),模型达到了 20% 的准确率。实验中 OpenAI 使用了微调和验证这两种技术,结果表明模型可以看到很多自身错误的例子,这一发现很有价值。


当时,OpenAI 的模型需要在 100 倍以上的数据上进行训练,才能在 GSM8K 上达到 80% 的准确率。但在今年 6 月,谷歌发布了 Minerva,达到 78% 的准确率。这一结果超出了预期,研究者表示,比预想的时间来的更快。


论文地址:https://arxiv.org/pdf/2206.14858.pdf


Minerva 基于谷歌自研的 Pathways 语言模型 (PaLM),具有更多的数学数据集,包含 arXiv、 LaTeX 等数学格式。Minerva 还采用了其他策略,在思维链提示(chain-of-thought prompting)中,Minerva 将更大的问题分解成小块。此外,Minerva 还使用多数投票(majority voting),不是要求模型给出一个答案,而是要求它提出 100 种答案。在这些答案中,Minerva 选择最常见的一种答案。


这些新策略的收益是巨大的,Minerva 在 MATH 上的准确率高达 50%,在 GSM8K 以及 MMLU(包括化学和生物学在内的一组更通用的 STEM 问题)上的准确率接近 80%。当 Minerva 被要求重做稍微调整过的问题时,它的表现同样很好,这表明它的能力不仅仅是来自记忆。


Minerva 可能有奇怪、混乱的推理,但仍然得出正确的答案。尽管像 Minerva 这样的模型可能会得出与人类相同的答案,但它们所遵循的实际过程可能大不相同。


谷歌机器学习专家 Ethan Dyer 表示,「我认为存在这样一种观念,即数学相关人士有一些严格的推理系统,了解某事和不了解某事之间存在明显的区别。」但人们给出的答案不一致,会犯错误,也无法应用核心概念。在机器学习前沿中,边界是模糊的。


原文链接:https://spectrum.ieee.org/large-language-models-math

相关文章
|
弹性计算 应用服务中间件 网络安全
阿里云服务器Tomcat无法从外部访问
阿里云服务器Tomcat无法从外部访问
816 0
阿里云服务器Tomcat无法从外部访问
|
2月前
|
存储 运维 安全
阿里云无影云电脑免费试用与新购活动参考:免费试用1个月,新购59元3个月起
阿里云无影云电脑免费试用及新购特惠活动,符合条件的新客户可享1次免费试用,含1个月个人版及数据盘、系统盘和网络带宽。无影云电脑打破传统PC界限,实现云上办公,降低IT成本,提高资源利用率,保障数据安全。无影云电脑产品配置多样,计费灵活,优势包括极致安全、高效运维、灵活接入和丰富应用场景,广泛适用于多个行业领域,为企业提供高效、安全、灵活的云上办公解决方案。
|
4月前
|
运维 自然语言处理 供应链
企业前台机器人OEM厂家全景扫描:猎户星空等头部企业定制能力解析
在数字化转型浪潮下,企业前台机器人正从“科技展示”迈向“效率工具”。本文系统解析国内OEM市场三大梯队,聚焦技术实力、定制能力与服务保障,重点推荐具备全链路自研、大模型赋能和深度场景适配的猎户星空,助力企业高效选型,实现智能化升级。
|
5月前
|
数据采集 监控 NoSQL
Airflow调度爬虫任务:从零搭建高效定时采集系统
Airflow以DAG实现爬虫任务依赖管理,支持分钟级调度与Web监控,解决crontab无依赖控制、Jenkins不灵活等问题。结合PythonOperator、动态参数传递与分布式架构,可构建高可用、易扩展的自动化采集系统,适用于电商价格监控等场景。
278 0
|
6月前
|
存储 数据可视化 安全
无代码开发实践 | 基于权限管理能力快速开发人力资源管理系统
本系统基于smardaten平台构建,实现人力资源管理中人员任职与认证活动的全流程线上化。涵盖基础信息、认证管理及权限控制等模块,支持组织架构灵活配置、菜单与操作权限精细化管控,并通过数据权限实现部门级与字段级数据隔离,确保安全合规。系统以可视化方式快速搭建,助力企业高效、专业地管理员工任职资格,提升人力资源管理效率与准确性。(239字)
无代码开发实践 | 基于权限管理能力快速开发人力资源管理系统
|
7月前
|
Web App开发 测试技术 Linux
文件上传测试用例
测试一个文件上传组件,从客户端(Windows操作系统)向服务器端(Linux操作系统)上传一个图片文件(先选择要上传的文件,再点击【上传】按键进行上传),格式必须是JPG、PNG(大小写不敏感),文件大小必须控制在500M之内。上传后图片的名称不发生变化。请设计测试用例,测试这个文件上传组件。以下是针对文件上传组件的测试用例设计,主要涵盖了不同的上传场景,以确保组件在各种情况下都能正常工作
313 1
|
6月前
|
数据采集 弹性计算 供应链
阿里云服务器ECS抢占式实例介绍:灵活、高效、低成本的选择
阿里云ECS抢占式实例价格优惠,最高可省90%,按小时计费,适合无状态、容错性强的应用,如大数据分析、测试等。但存在被释放风险,不适用于数据库等有状态服务,需注意数据备份与使用限制。
283 0
|
消息中间件 数据采集 监控
ELK搭建(七):搭建PostgreSQL慢查询、错误日志监控平台
PostgreSQL是一款功能非常强大的的关系性数据库,适用于需要执行复杂查询的系统。市面上越来越多的公司开始采用PostgreSQL作为主数据库。 今天我们就来讲解如何搭建一个PostgreSQL的慢日志、错误日志监控平台,实时了解到数据库的日志情况,来帮助我们快速排错及优化。
1247 0
ELK搭建(七):搭建PostgreSQL慢查询、错误日志监控平台
|
前端开发
HTMl+CSS制作二级菜单或二级导航栏
 二级菜单的实现思路为: 1.在默认状态下,使用display:none;将二级菜单隐藏。  2.当一级菜单中的列表标签li获取焦点(hover)后,使用display:blick;将二级菜单显示出来。  3.使用position: relative;和position: absolute;分别得一级菜单和二级菜单设置相对定位和绝对定位。
1591 0
HTMl+CSS制作二级菜单或二级导航栏
|
新零售 人工智能 监控
【技术精华汇总】不一样的技术创新——阿里巴巴2016双11背后的技术
  每年的“双11”是阿里技术的大阅兵和创新能力的集中检阅。2016年的“双11”背后,更是蕴藏了异常丰富的技术实践与突破。   历经1个月的编写,最终27篇精华技术文章入册《不一样的技术创新-阿里巴巴2016双11背后的技术》(以下简称《不一样的技术创新》)一书。这27篇“2
16065 0

热门文章

最新文章