谷歌微型AI模型“Gemma 2 2B”正出人意料地挑战科技巨头

简介: 谷歌微型AI模型“Gemma 2 2B”正出人意料地挑战科技巨头

本文来源:企业网D1net


谷歌最新发布的Gemma 2 2B是一款紧凑但功能强大的AI模型,尽管仅有26亿参数,但其性能却可与OpenAI的GPT-3.5和Mistral AI的Mixtral 8x7B等大型模型媲美甚至超越。Gemma 2 2B在大规模多任务语言理解(MMLU)和Python编程(MBPP)基准测试中表现优异,显示出在创建更高效、更易于部署的AI系统方面的重大进步,这款多语言模型经过先进TPU硬件的训练,适用于设备端和边缘计算。谷歌通过开源Gemma 2 2B,推动了AI技术的普及,强调模型压缩和蒸馏技术的重要性,展示了未来AI开发的新方向。


谷歌刚刚发布了Gemma 2 2B,这是一款紧凑但功能强大的AI模型,尽管其规模显著较小,但在性能上却可与行业领先者媲美甚至超越,这个新语言模型仅包含26亿参数,但其表现与规模更大的对手(包括OpenAI的GPT-3.5和Mistral AI的Mixtral 8x7B)相当或更优。


在谷歌开发者博客上宣布的Gemma 2 2B代表了在创建更易于访问和部署的AI系统方面的重大进步,其小巧的体积使其特别适合于设备上的应用,可能对移动AI和边缘计算产生重大影响。


小而强大的AI:超越其重量级别



AI研究组织LMSYS的独立测试显示,Gemma 2 2B在他们的评估中获得了1130分,这一结果略高于GPT-3.5-Turbo-0613(1117分)和Mixtral-8x7B(1114分),这两个模型的参数数量是Gemma 2 2B的十倍。


该模型的能力不仅仅在于其效率。谷歌报告称,Gemma 2 2B在MMLU(大规模多任务语言理解)基准测试中得分为56.1,在MBPP(主要是基础Python编程)中得分为36.6,比其前代产品有显著提升。


这一成就挑战了AI开发中更大模型固有表现更好的传统智慧。Gemma 2 2B的成功表明,复杂的训练技术、高效的架构和高质量的数据集可以弥补参数数量的不足,这一突破可能对该领域产生深远影响,可能会将焦点从追求越来越大的模型转向精炼更小、更高效的模型。


压缩巨人:AI压缩的艺术



Gemma 2 2B的开发还强调了模型压缩和蒸馏技术的重要性。通过有效地将大模型中的知识蒸馏到小模型中,研究人员可以创建更易于访问的AI工具,而不牺牲性能,这种方法不仅减少了计算需求,还解决了训练和运行大型AI模型对环境的影响。


谷歌使用其先进的TPU v5e硬件在一个包含2万亿标记的大规模数据集上训练了Gemma 2 2B,这个多语言模型增强了其在全球应用中的潜力。


这一发布符合行业对更高效AI模型的日益关注。随着对大语言模型环境影响和可访问性的关注增加,科技公司正专注于创建可以在消费级硬件上运行的更小、更高效的系统。


开源革命:让AI普及大众



通过将Gemma 2 2B开源,谷歌重申了其在AI领域透明和协作开发的承诺。研究人员和开发人员可以通过Gradio在Hugging Face上访问该模型,并且可以在包括PyTorch和TensorFlow在内的各种框架中实现。



版权声明:本文为企业网D1Net编译,转载需在文章开头注明出处为:企业网D1Net,如果不注明出处,企业网D1Net将保留追究其法律责任的权利。封面图片来源于摄图网


(来源:企业网D1Net)


image.png

如果您在企业IT、网络、通信行业的某一领域工作,并希望分享观点,欢迎给企业网D1Net投稿。

投稿邮箱:

editor@d1net.com

合作电话:

010-58221588(北京公司)

021-51701588(上海公司)

合作邮箱:

Sales@d1net.com


企业网D1net旗下信众智是CIO(首席信息官)的专家库和智力输出及资源分享平台,有五万多CIO专家,也是目前最大的CIO社交平台。


信众智对接CIO为CIO服务,提供数字化升级转型方面的咨询、培训、需求对接等落地实战的服务。也是国内最早的toB共享经济平台。同时提供猎头,选型点评,IT部门业绩宣传等服务。

相关文章
|
2月前
|
云安全 人工智能 自然语言处理
阿里云x硅基流动:AI安全护栏助力构建可信模型生态
阿里云AI安全护栏:大模型的“智能过滤系统”。
1757 120
|
3月前
|
人工智能 Java API
AI 超级智能体全栈项目阶段一:AI大模型概述、选型、项目初始化以及基于阿里云灵积模型 Qwen-Plus实现模型接入四种方式(SDK/HTTP/SpringAI/langchain4j)
本文介绍AI大模型的核心概念、分类及开发者学习路径,重点讲解如何选择与接入大模型。项目基于Spring Boot,使用阿里云灵积模型(Qwen-Plus),对比SDK、HTTP、Spring AI和LangChain4j四种接入方式,助力开发者高效构建AI应用。
1591 122
AI 超级智能体全栈项目阶段一:AI大模型概述、选型、项目初始化以及基于阿里云灵积模型 Qwen-Plus实现模型接入四种方式(SDK/HTTP/SpringAI/langchain4j)
|
2月前
|
人工智能 搜索推荐 程序员
当AI学会“跨界思考”:多模态模型如何重塑人工智能
当AI学会“跨界思考”:多模态模型如何重塑人工智能
304 120
|
3月前
|
机器学习/深度学习 人工智能 自然语言处理
AI Compass前沿速览:Qwen3-Max、Mixboard、Qwen3-VL、Audio2Face、Vidu Q2 AI视频生成模型、Qwen3-LiveTranslate-全模态同传大模型
AI Compass前沿速览:Qwen3-Max、Mixboard、Qwen3-VL、Audio2Face、Vidu Q2 AI视频生成模型、Qwen3-LiveTranslate-全模态同传大模型
649 13
AI Compass前沿速览:Qwen3-Max、Mixboard、Qwen3-VL、Audio2Face、Vidu Q2 AI视频生成模型、Qwen3-LiveTranslate-全模态同传大模型
|
3月前
|
人工智能 负载均衡 API
Vercel 发布 AI Gateway 神器!可一键访问数百个模型,助力零门槛开发 AI 应用
大家好,我是Immerse,独立开发者、AGI实践者。分享编程、AI干货、开源项目与个人思考。关注公众号“沉浸式趣谈”,获取独家内容。Vercel新推出的AI Gateway,统一多模型API,支持自动切换、负载均衡与零加价调用,让AI开发更高效稳定。一行代码切换模型,告别接口烦恼!
401 1
Vercel 发布 AI Gateway 神器!可一键访问数百个模型,助力零门槛开发 AI 应用
|
3月前
|
人工智能 IDE 开发工具
CodeGPT AI代码狂潮来袭!个人完全免费使用谷歌Gemini大模型 超越DeepSeek几乎是地表最强
CodeGPT是一款基于AI的编程辅助插件,支持代码生成、优化、错误分析和单元测试,兼容多种大模型如Gemini 2.0和Qwen2.5 Coder。免费开放,适配PyCharm等IDE,助力开发者提升效率,新手友好,老手提效利器。(238字)
826 1
CodeGPT AI代码狂潮来袭!个人完全免费使用谷歌Gemini大模型 超越DeepSeek几乎是地表最强
|
3月前
|
机器学习/深度学习 人工智能 自然语言处理
如何让AI更“聪明”?VLM模型的优化策略与测试方法全解析​
本文系统解析视觉语言模型(VLM)的核心机制、推理优化、评测方法与挑战。涵盖多模态对齐、KV Cache优化、性能测试及主流基准,助你全面掌握VLM技术前沿。建议点赞收藏,深入学习。
824 8
|
机器学习/深度学习 人工智能 Kubernetes
【热点】谷歌的AI协同平台
关注公众号“达摩院首座”,了解开发者最真实生活
905 0
【热点】谷歌的AI协同平台