12年来最大飞跃!黄仁勋发布史上最强GPU,世界首个实时光线追踪新一代图灵架构

简介: 刚刚,英伟达CEO黄仁勋在SIGGRAPH 2018上大秀肌肉,推出世界首个实时光线追踪GPU,基于图灵架构,这是自2006年以来GPU实现的最最重大的飞跃,每秒处理高达10GB Rays,这将彻底改变整个计算机图形处理界的工作流程。

“我们努力了十年。”黄仁勋说:“这是GPU自2006年以来最重大的飞跃。”

在刚刚的SIGGRAPH 2018主旨演讲中,黄仁勋将英伟达的GPU实力展现得淋漓尽致。

虽然摩尔定律已见终点,但对于英伟达GPU来说,似乎完全不存在。黄仁勋认为,历史正处于一个转折点,存在一个全新的定律——“GPU加速定律”(注:不是黄教主本人说的)。

307890cdb86b0ea6ae79e2fb9f2ea100da96b823

在演讲中,黄仁勋发布了世界首款实时光线追踪GPU——NVDIA QUADRO RTX,每秒处理高达10GB Rays,做AI能够达到每秒500 Trillion Tensor Ops,16TFLOPS + 16TIPS,使用NVLink 扩展后,每秒处理速度最高能达到100GB。


在长达5分钟的时间里,黄仁勋骄傲地举起实物,“以前有谁曾用GB做过单位?有谁曾经想过能够用GB做单位?”

黄仁勋自豪地重复了很多遍:“每秒10 GB Rays!”

735f3e774467edcf1a74dd974b677f46c6450d0b

实时渲染光线在环境中的反射和散射,是计算机图形处理界的“圣杯”,这个过程非常复杂,涉及光线在各种不同介质上的多次反射和散射。在上世纪70年代,相关算法年首次提出时,一小时只能模拟一帧,相当于每小时处理60像素。

而现在,英伟达让它提升到了“每秒10 GB Rays”。

这样得益于两大核心技术:英伟达全新研发的基于图灵架构的升级版光线实时追踪RT Core,以及深度学习Tensor Core。

4c1441dff2a0082076beec04a5909adb1e97e76f

黄仁勋感叹,为了设计RT Core架构,英伟达用了整整十年时间研发,终于实现了在一块GPU上进行光线实时追踪,这个以前业界曾经认为不可能的事情。

全新的Turing架构,“这是GPU自2006年以来最重大的飞跃。”黄仁勋说。

从Step-function到Realism,全新的混合渲染模型,光线追踪、计算以及AI,现在好用,也考虑到了未来。

英伟达再一次,实力展现了深度学习时代GPU超乎想象的计算力。

c042baf9b251932371ff326311cfc62c8643b325

实时渲染光线变化效果

全新图灵架构,全球首个实时光线追踪GPU!

黄仁勋表示,英伟达RTX是首款基于 Turing™架构的 GPU,革新了 5000 万设计师和艺术家的工作,使他们能够实时渲染逼真的场景,为其工作流程添加基于 AI 的新功能,享受复杂模型和场景的交互性。

dd301fa8478b035a3eaba41e201b479a9c8f0e23

PASCAL和TURING架构对比

cdf954ec59cc034836a2e80276f4b8734bac45bb

关键在于结合深度学习(Tensor Core)和全新实时光线追踪架构(RT Core)

4c92298d9d420a4bf5a5070a56155e81743aa7a8

图灵架构相比PASCAL实现6倍速度提升


黄仁勋还发布了NVIDIA Quadro RTX 8000Quadro RTX 6000Quadro RTX 5000,实现不同性能的硬件加速光线追踪、AI、先进的阴影和模拟等。

27a012d4271ef74261ebe1db5faca697fa7a4024

同时推出的还有完整的软件堆栈:

105e9e734614d3e45492041252de56470df3b217

以及 Quadro RTX Server,这是一种参考架构,用于从数据中心提供高度可配置、按需呈现和虚拟工作站解决方案。

504a8ef547e7e7c0e8e620ebb3de391099cb77aa

在展示Quadro RTX Server时,黄仁勋在现场展示了他最喜欢的前后对比:

71b1ccb8ef6ffdf521115927ed81975f28efa1ac

现在的渲染集群

3e7586a82bc9b7eaa5a6ddd14fda9061348d1610

使用英伟达RTX服务器

只要1万美元,简直是抢钱啊,”黄仁勋感叹,然后是那句经典的:

“你买得越多,省得越多。”

提前5年实现,彻底革新计算机图形处理

英伟达专业可视化副总裁 Bob Pette 表示:“Quadro RTX 标志着全球计算机图形行业新纪元的开始。”

“用户现在可以享受的强大功能,原来被认为至少是 5 年后才可能实现的。设计师和艺术家现在可以通过光线追踪照片写实的细节,实现复杂的设计和视觉效果。电影工作室和制片公司现在可以通过渲染工作负载实现更高的吞吐量,从而大大节省时间和成本。”

e4f01e54bcd7ab466881c7ddd6e87ca0fd913fe9

Quadro RTX 专业 GPU

Quadro RTX GPU 专为要求最苛刻的视觉计算工作负载而设计,例如用于电影和视频内容创建; 汽车和建筑设计; 以及科学可视化。

它们突破性的技术远远超过上一代,包括:

新的 RT Cores ,可以通过物理上精确的阴影、反射、折射和全局光照,实时跟踪物体和环境的光线。
Turing Tensor Cores 可加速深度神经网络训练和推理,这对于 AI 增强的渲染、产品和服务至关重要。
新的 Turing Streaming Multiprocessor 架构 ,具有多达 4608 个 CUDA 内核,可并行提供高达每秒 16 万亿次浮点运算和每秒 16 万亿次整数运算,可加速真实世界的复杂模拟。
先进的 可编程着色技术 ,可提高复杂视觉效果和图形密集型体验的性能。
首次实现超高速三星 16Gb GDDR6 内存 ,支持更复杂的设计,庞大的建筑数据集,8K 电影内容等。
NVIDIANVLink 将两个 GPU 与一个高速链路结合,可将内存容量扩展至 96GB,并通过高达 100GB/s 的数据传输提高驱动性能。
提供 USB Type-C和 VirtualLink的硬件支持 ,这是一种新的开放行业标准,旨在通过单个 USB-C™连接器满足下一代 VR 耳机的功率,显示和带宽要求。
提高 VR 应用性能的新技术 ,包括可变速率着色、多视图渲染和 VRWorks 音频。

Quadro RTX 服务器

Quadro RTX 服务器为数据中心的按需渲染定义了一个新标准,可以轻松配置按需渲染节点以进行批处理和交互式渲染。

Quadro RTX 服务器将 Quadro RTX GPU 与新的 Quadro Infinity 软件(将在 2019 年第一季度推出)相结合,提供强大而灵活的架构,以满足创意专业人士的需求。Quadro Infinity 将允许多个用户通过虚拟工作站访问单个 GPU,从而显着提高数据中心的密度。最终用户还可以根据他们的特定需求轻松配置渲染节点和工作站。

Quadro RTX 服务器预装了业界领先的内容创建和渲染软件,提供功能强大且易于部署的渲染解决方案,可从小型安装扩展到最大的数据中心,成本仅为只有 CPU 渲染的四分之一。

e4e454178f4a727b446ee2d462650d8698cf3d27


原文发布时间为:2018-08-14本文来自云栖社区合作伙伴新智元,了解相关信息可以关注“AI_era”。原文链接: 12年来最大飞跃!黄仁勋发布史上最强GPU,世界首个实时光线追踪新一代图灵架构
相关实践学习
在云上部署ChatGLM2-6B大模型(GPU版)
ChatGLM2-6B是由智谱AI及清华KEG实验室于2023年6月发布的中英双语对话开源大模型。通过本实验,可以学习如何配置AIGC开发环境,如何部署ChatGLM2-6B大模型。
相关文章
|
7月前
|
存储 机器学习/深度学习 数据库
阿里云服务器X86/ARM/GPU/裸金属/超算五大架构技术特点、场景适配参考
在云计算技术飞速发展的当下,云计算已经渗透到各个行业,成为企业数字化转型的关键驱动力。选择合适的云服务器架构对于提升业务效率、降低成本至关重要。阿里云提供了多样化的云服务器架构选择,包括X86计算、ARM计算、GPU/FPGA/ASIC、弹性裸金属服务器以及高性能计算等。本文将深入解析这些架构的特点、优势及适用场景,以供大家了解和选择参考。
1207 61
|
8月前
|
机器学习/深度学习 并行计算 PyTorch
英伟达新一代GPU架构(50系列显卡)PyTorch兼容性解决方案
本文记录了在RTX 5070 Ti上运行PyTorch时遇到的CUDA兼容性问题,分析其根源为预编译二进制文件不支持sm_120架构,并提出解决方案:使用PyTorch Nightly版本、更新CUDA工具包至12.8。通过清理环境并安装支持新架构的组件,成功解决兼容性问题。文章总结了深度学习环境中硬件与框架兼容性的关键策略,强调Nightly构建版本和环境一致性的重要性,为开发者提供参考。
4674 64
英伟达新一代GPU架构(50系列显卡)PyTorch兼容性解决方案
|
8月前
|
存储 机器学习/深度学习 算法
阿里云X86/ARM/GPU/裸金属/超算等五大服务器架构技术特点、场景适配与选型策略
在我们选购阿里云服务器的时候,云服务器架构有X86计算、ARM计算、GPU/FPGA/ASIC、弹性裸金属服务器、高性能计算可选,有的用户并不清楚他们之间有何区别。本文将深入解析这些架构的特点、优势及适用场景,帮助用户更好地根据实际需求做出选择。
|
9月前
|
并行计算 PyTorch 算法框架/工具
融合AMD与NVIDIA GPU集群的MLOps:异构计算环境中的分布式训练架构实践
本文探讨了如何通过技术手段混合使用AMD与NVIDIA GPU集群以支持PyTorch分布式训练。面对CUDA与ROCm框架互操作性不足的问题,文章提出利用UCC和UCX等统一通信框架实现高效数据传输,并在异构Kubernetes集群中部署任务。通过解决轻度与强度异构环境下的挑战,如计算能力不平衡、内存容量差异及通信性能优化,文章展示了如何无需重构代码即可充分利用异构硬件资源。尽管存在RDMA验证不足、通信性能次优等局限性,但该方案为最大化GPU资源利用率、降低供应商锁定提供了可行路径。源代码已公开,供读者参考实践。
811 3
融合AMD与NVIDIA GPU集群的MLOps:异构计算环境中的分布式训练架构实践
|
图形学 异构计算
Siemens NX何时支持GPU光线追踪与图形加速?
NX的Ray Tracing Studio在NX 1847及更早版本中不支持NVIDIA RTX板的GPU加速,仅依赖CPU,性能较慢。从NX 1872起支持GPU加速。自2023年6月版起,若无GPU,NX将显示图形配置错误并记录到syslog文件,建议使用支持的GPU以避免未定义行为。更多支持的硬件和图形信息,请参阅鼎森电脑整理的文件“NX-Graphics-Certification-Table_20241207.xlsx”。链接:https://pan.baidu.com/s/1_FpOoJU_IrExnhVXyzB4cw?pwd=676s 提取码: 676s
466 1
|
机器学习/深度学习 弹性计算 人工智能
阿里云服务器架构有啥区别?X86计算、Arm、GPU异构、裸金属和高性能计算对比
阿里云ECS涵盖x86、ARM、GPU/FPGA/ASIC、弹性裸金属及高性能计算等多种架构。x86架构采用Intel/AMD处理器,适用于广泛企业级应用;ARM架构低功耗,适合容器与微服务;GPU/FPGA/ASIC专为AI、图形处理设计;弹性裸金属提供物理机性能;高性能计算则针对大规模并行计算优化。
904 7
|
2月前
|
Cloud Native Serverless API
微服务架构实战指南:从单体应用到云原生的蜕变之路
🌟蒋星熠Jaxonic,代码为舟的星际旅人。深耕微服务架构,擅以DDD拆分服务、构建高可用通信与治理体系。分享从单体到云原生的实战经验,探索技术演进的无限可能。
微服务架构实战指南:从单体应用到云原生的蜕变之路
|
弹性计算 API 持续交付
后端服务架构的微服务化转型
本文旨在探讨后端服务从单体架构向微服务架构转型的过程,分析微服务架构的优势和面临的挑战。文章首先介绍单体架构的局限性,然后详细阐述微服务架构的核心概念及其在现代软件开发中的应用。通过对比两种架构,指出微服务化转型的必要性和实施策略。最后,讨论了微服务架构实施过程中可能遇到的问题及解决方案。
|
5月前
|
缓存 Cloud Native Java
Java 面试微服务架构与云原生技术实操内容及核心考点梳理 Java 面试
本内容涵盖Java面试核心技术实操,包括微服务架构(Spring Cloud Alibaba)、响应式编程(WebFlux)、容器化(Docker+K8s)、函数式编程、多级缓存、分库分表、链路追踪(Skywalking)等大厂高频考点,助你系统提升面试能力。
288 0