龙蜥社区智算联盟发布《智算集群基础设施运维通用技术要求》(附下载链接)

简介: 该技术要求的制定旨在打通智算软硬件、跨主体运维断点,补齐 AI 智能体底层算力协同短板,为支撑智算集群基础设施稳定运行,提供运维体系架构、关键运维功能的标准化建议。

随着全国一体化算力网建设、算力互联互通行动计划的稳步推进,2026 年“十五五”规划纲要对算力基础设施建设提出了更高的要求:加快国家枢纽算力设施集群建设,论证建设超大规模智算集群,推动绿色电力与算力协同布局,降低中小企业用算成本。

然而,在智算基础设施建设飞速发展、集群规模不断扩大的同时,基础设施运维的痛点也日益突显。软硬件协同断层、跨产品运维壁垒、智能运维技术应用碎片化、面向 AI 智能体的算力支撑功能缺失等问题,正成为制约产业高质量发展的关键瓶颈。

为破解上述难题龙蜥社区智算联盟以社区为平台,联合智算硬件设备商、集群软件厂商、软件集成商、科研院校单位,深入研究智算集群基础设施运维体系。联盟通过分析具体应用场景,结合实际运维痛点,总结发布了《智算集群基础设施运维通用技术要求》(以下简称“技术要求”)。该技术要求的制定旨在打通智算软硬件、跨主体运维断点,补齐 AI 智能体底层算力协同短板,为支撑智算集群基础设施稳定运行,提供运维体系架构、关键运维功能的标准化建议。

技术要求首先提出了面向用户、端到端、可异构、可扩展的智算集群基础设施运维参考架构,明确了四大设计原则:分层解耦——运维能力按对象分层,组件间松耦合,可分可合;可扩展——覆盖智算项目建设全场景与业务全流程;云原生化——支持微服务化部署;面向用户——按需提供场景化、可组装的运维解决方案。

(图/智算集群基础设施运维参考架构)

主要运维组件包括:

  • 硬件管理:提供计算、存储、网络硬件基础设施统一管理与运维功能。
  • GPU 运维:提供 GPU 关键算力资源的基础监控,故障诊断、性能压测等增强运维功能。
  • 智算集群运维:提供虚拟化、云原生智算集群软件底座平台运维管理功能。
  • 网络运维:提供多层次、多平面的网络拓扑监控,网络故障诊断、网络性能调优等增强运维功能。
  • 作业运维:提供训推任务关联模型、算子、网络以及云原生工作负载监控数据的跨域整合,从业务视角跨层联动软硬件基础设施,实现端到端运维。

该技术要求能为智算集群软硬件产品生产商、系统集成商在系统设计、产品制造、运维集成方面提供指导,为第三方测评机构实施智算集群运维体系和功能的测试与评价提供参考。

随着超大规模智算集群的建设加速和 AI 智能体技术的快速演进,智算集群基础设施运维将面临更加复杂的挑战。龙蜥社区智算联盟将持续迭代技术要求,在智能化运维、AI 智能体算力协同、绿色运维等方向深入探索,推动智算运维生态的标准化与成熟化。

《智算集群基础设施运维通用技术要求》下载链接:

https://openanolis.cn/assets/static/AI_Infra_O&M_GTR.pdf

—— 完 ——


相关文章
|
Linux Perl
Linux 系统快速分析日志定位故障原因的 10 个方法
在 Linux 系统中,日志是一种非常重要的资源。系统管理员可以通过日志记录的内容来检测系统的运行状况,分析问题,做出相应的调整和优化。由于日志文件数量庞大,内容复杂,因此需要使用一些工具和技术帮助管理员进行快速分析和查找。 本文将介绍 Linux 系统中快速分析日志、定位故障的 10 个方法。
4890 1
|
Linux 网络安全 KVM
CentOS7 KVM环境下制作qcow2格式镜像
CentOS7 KVM环境下制作qcow2格式镜像
1998 0
CentOS7 KVM环境下制作qcow2格式镜像
|
Shell 容器 Perl
Back-off restarting failed container 问题解决
Back-off restarting failed container 问题解决
4174 0
|
11天前
|
人工智能 监控 API
Token Plan个人版功能介绍:三档套餐定价、Credits抵扣规则与Qwen3.8限时折扣实操教程
随着大模型应用从原型验证转向常态化开发,按量计费模式带来账单不可控、高频调用成本高昂、多模态工具单独扣费等痛点,大量独立开发者、小型创作团队亟需固定包月、统一计量、覆盖全模型的订阅方案。2026年7月,百炼正式推出Token Plan个人版订阅服务,面向独立AI从业者、编程开发者、智能体搭建爱好者提供标准化包月套餐,一套订阅覆盖文本、图像、视频多模态模型,内置联网检索、数据解析等Harness增强工具,原生兼容Cursor、OpenClaw、Hermes、Qoder等主流AI开发框架,依托统一Credits计量单位统一抵扣全部调用消耗,固定月费无隐形超额账单。同步上线2.4万亿参数Qwen3.
205 0
|
人工智能 固态存储 安全
一文告诉你CXL是什么,有什么新的机会 (上)
> 1. 大数据AI/ML应用爆发驱动大内存需求,但内存增长受限,CXL互联方案应运而生 > 2. CXL分为1.0/2.0/3.0版本,分别提供直连、池化、Fabric能力,预计在2022年/203年/2025年之后市场可用,目前看来池化对于软件的影响最大 > 3. CXL更多是对于已有架构的性能优化,全新的机会不多,较大的机会在于系统软件、内存即服务,以及内存数据库和内存云结构 > 4. CXL大概率将成为跨计算引擎的内存结构标准,短期利好云厂商,长期会数据中心架构产生结构性的变革
4901 0
|
4月前
|
自然语言处理 前端开发 API
如何在Trae中接入阿里百炼Qwen3.6-Plus大模型,让编程体验更畅快?
Trae排队太慢?阿里云百炼Qwen3.6-Plus模型助你告别等待!响应秒级,支持Agentic/Vibe编程、原生多模态与100万上下文。API调用低至2元/百万输入Tokens,新用户赠百万Tokens,三步即可接入,编程体验丝滑升级!
|
人工智能 监控 测试技术
阿里云磐久服务器稳定性实践之路
阿里云服务器质量智能管理体系聚焦自研服务器硬件层面的极致优化,应对高并发交付、短稳定性周期、早问题发现和快修复四大挑战。通过“三个重构”(质量标准、开发流程、交付模式)、“六个归一”(架构、硬件、软件、测试、部件、制造)策略,实现芯片、整机和云同步发布,确保快速稳定上量。此外,全场景测试体系与智能预警、分析、修复系统协同工作,保障服务器在萌芽阶段发现问题并及时解决,提升整体质量水平。未来,阿里云将继续深化大数据驱动的质量管理,推动服务器行业硬件质量的持续进步。

热门文章

最新文章