AI 场景下如何构建运维的标准化能力?SOMA 智能运维计划发布 | 2024 龙蜥大会

简介: 欢迎加入龙蜥社区系统运维联盟(SOMA) 智能运维计划。

8 月 30 日,2024 龙蜥操作系统大会(OpenAnolis Conference)在北京盛大召开。 与此同时,由龙蜥社区运营委员会副主席、龙腾计划生态负责人金美琴,阿里云智能集团高级技术专家毛文安,云杉网络 VP 向阳联合出品的系统运维联盟闭门会也圆满举办。本次闭门会上,来自云杉网络、阿里云、信通院、浪潮信息、凝思软件、中科院、基流科技、必示科技以及北京邮电大学等企业和高校的 14 位大咖,聚焦 AI 场景下如何构建与提升运维的标准化能力,共同探讨当前智算运维在落地过程中的难题及合作路径。会上也隆重举行了 SOMA 智能运维计划发起仪式,龙蜥社区理事长马涛也参与了该计划的讨论和发起。

(图/SOMA智能运维计划发起合照)


会议伊始,龙蜥社区技术委员会主席杨勇开场致辞。杨勇指出,未来,中国有两大机遇,一个机遇是 CentOS 的国产替代,让国内的一些操作系统生态能够被更多的人认可。另外一个机遇就是 AI 的基础设施建设。从千卡集群到万卡集群,规模越来越大,将来的推理也会有更多的应用,而且它是基于天然的云原生的分布式系统去部署这些应用,这就需要有强大的智能运维能力。同时也希望更多企业和个人加入到系统运维联盟的智能运维计划,抓住这个千载难逢的 AI 机遇。

(图/杨勇)


闭门会上,云杉网络 VP 向阳分享了主题为《AI 基础设施需要什么样的可观测性》的演讲。向阳分析了 AI 训练和推理面临的基础设施稳定性和可靠性需求,总结了传统可观测性工具的痛点和缺陷,分享了 DeepFlow 使用 eBPF 技术在 AI 基础设施可观测性方面进行的探索和实践,介绍了使用 eBPF 能够实现的全栈智算可观测性效果,并分享了 DeepFlow 在国内头部券商企业通义千问智算集群中的落地实践。

(图/向阳)


阿里云智能集团技术专家、龙蜥社区系统运维 SIG Maintainer 陈诗雁做了《基于 LLM Agent 的 SysOM 智能诊断机器人》主题分享。陈诗雁介绍了系统运维的现状和难点、智能对话机器人的发展、大模型在系统运维的应用、基于大模型智能体的诊断机器人设计,并演示了 SysOM 智能诊断机器人。智能机器人和运维平台是相辅相成的关系,运维平台的诊断能力成就了智能机器人解决实际问题的能力,智能机器人帮助运维平台更好地发挥和展示运维能力。

(图/陈诗雁)


本次闭门会上,现场嘉宾针对“大模型+运维:标准化方向探索”、“运维 for AI:如何让 LLM 基础设施更高效”、“AI for 运维:如何让运维更智能”等当下热门话题展开讨论。现场交流异常热烈,嘉宾们纷纷给出了他们的建议和看法。龙蜥社区标准化 SIG 董翰文主持讨论“大模型+运维:标准化方向探索”,邀请嘉宾分享自己眼中的智能运维,其发展方向和标准化工作发表看法。中国信通院云计算与大数据研究所高级业务主管王海清认为框架类标准能有效提升用户对智能运维的认知,引领和促进整个行业的发展。中国科学院计算机网络信息中心副研究员裴昶华认为协同是标准的重要作用,数据格式、交互接口、标准化模块等都是现在智能运维需要的标准方向。龙蜥社区系统运维 SIG 负责人毛文安表示标准化的工作极为重要,智能运维涉及到指标采集和分析加工等方方面面。当前,业界也相当迫切地需要一套标准化的评测和打分流程。浪潮信息首席工程师、人工智能算法研究员李峰指出智能运维底层就是“三自”的智能系统,即自组织、自适应、自学习。数据语义标准是智能运维标准需要的方向。凝思软件解决方案总监田辉表示,数据集和评测标准是目前智能运维所需的标准,但是不同领域中运维的关注重点不同,这加大了智能运维标准制定的难度。


云杉网络 VP 向阳主持“运维 for AI:如何让 LLM 基础设施更高效”话题。嘉宾们就自己在 LLM 基础设施性能优化和稳定性保障方面的工作进行了介绍,从基础设施供应商、科研院校、操作系统内核开源社区不同的视角分享了 LLM 基础设施的高性能和稳定性需求。基流科技研发 VP 陈维介绍了基流科技在搭建网卡集群过程中积累下来的行之有效的性能和稳定性保障机制,并对未来 AIOps 赋能从而进一步降低运维成本表达了非常积极的预期。北京邮电大学博士研究生刘克非表示智算网络对整个 LLM 基础设施的稳定性和性能所发挥着至关重要的作用。龙蜥社区跟踪诊断技术 SIG Maintainer 陆扬介绍了龙蜥在 eBPF GPU Profiling、PyTorch Profiling 等方面的探索,并分享了龙蜥社区未来一年的亮眼 Milestone。


“AI for 运维:如何让运维更智能话题”必示科技产品总监温希道主持,就 AIOPS 这么多年的 good case 和 bad case、未来可能出现的 good case 和怎么去走向更大量的 good case 和嘉宾做了深入的探讨。龙蜥社区系统运维联盟主席冯富秋结合历史对大模型现状进行了分析, 表示当年深度神经网络得益于对垂直领域的研究(图像卷积、音频梅尔倒频谱等)效果得到显著的改进, 大模型基础模型也需要结合垂直领域特征进行增强。阿里云智能集团技术专家陈诗雁分享了大模型的知识检索和知识沉淀对于智能运维工作的帮助,通过大模型进一步提升运维效率。但他也提到,大模型当前存在信任问题,或许建立权威的评测手段可以帮助我们实现这一点。浪潮信息运维专家张鹏将目光更多地放在服务器的单机可用性和集群可用性上,他结合自身经验分享了大模型的回答出现错误的问题,并表示,无论是大模型还是小模型,解决监控失误、诊断失准、预测时效和可解释性的问题都迫在眉睫。


(图/圆桌讨论环节嘉宾发言)


值得一提的是,会上,龙蜥社区联合系统运维联盟生态合作伙伴,共同发起了“SOMA 智能运维计划”,该计划分成四个部分:第一智能运维标准和评测系统的建立;第二搭建一个运维知识库,第三搭建联盟的智能运维机器人,第四解决在 AI 场景和架构下性能问题。龙蜥社区系统运维联盟诚挚地邀请广大企业、专家以及高校老师一起畅想、落实该计划。

感谢本次闭门会出品团队:金美琴、向阳、毛文安、刘寅、董翰文、卫硕、贺迪、李会佳。

视频回放、课件获取:

「系统运维联盟闭门会」直播回放及技术 PPT上线啦,欢迎点击下方链接观看~

回放链接:https://openanolis.cn/video/#983718373609714341

技术 PPT :关注龙蜥公众号【OpenAnolis 龙蜥】,回复“龙蜥课件”获取。

—— 完 ——


相关文章
|
5天前
|
人工智能 自然语言处理 算法
具身智能高校实训解决方案 ----从AI大模型+机器人到通用具身智能
在具身智能的发展历程中,AI 大模型的出现成为了关键的推动力量。高校作为培养未来科技人才的摇篮,需要紧跟这一前沿趋势,开展具身智能实训课程。通过将 AI 大模型与具备 3D 视觉的机器人相结合,为学生搭建一个实践平台。
126 64
|
17天前
|
机器学习/深度学习 人工智能 运维
智能化运维####
本文深入探讨了智能化运维的前沿趋势与实践,通过融合大数据、人工智能等先进技术,重塑传统IT运维模式。我们分析了智能化运维的核心价值,包括提升效率、减少故障响应时间及增强系统稳定性,并通过具体案例展示了其在现代企业中的应用成效。对于追求高效、智能运维管理的组织而言,本文提供了宝贵的洞见和策略指导。 ####
|
2天前
|
人工智能 JSON 自然语言处理
智能化AI工具-语言翻译与本地化
在全球化发展的背景下,语言翻译与本地化需求日益增长。无论是跨境电商、国际合作,还是本地化应用开发,都需要高效、准确的翻译解决方案。阿里云通义千问作为一款强大的大语言模型,不仅具备出色的自然语言理解能力,还能够在多语言翻译和本地化场景中发挥重要作用。本博客将详细介绍如何基于阿里云通义千问开发语言翻译与本地化工具,包括产品介绍、程序代码以及阿里云相关产品的具体使用流程。
25 10
|
5天前
|
机器学习/深度学习 人工智能 运维
智能化运维:提升IT系统管理效率的新范式####
在数字化转型加速的今天,企业IT系统的复杂性日益增加,传统的运维模式已难以满足高效、稳定的业务需求。本文探讨了智能化运维(AIOps)如何通过融合人工智能、大数据分析和自动化工具,重塑IT运维流程,显著提升管理效率和服务质量,为企业带来前所未有的运营洞察力和响应速度。 ####
|
15天前
|
人工智能 文字识别 运维
AI多模态的5大核心关键技术,让高端制造实现智能化管理
结合大模型应用场景,通过AI技术解析高端制造业的复杂设备与文档数据,自动化地将大型零件、机械图纸、操作手册等文档结构化。核心技术包括版面识别、表格抽取、要素抽取和文档抽取,实现信息的系统化管理和高效查询,大幅提升设备维护和生产管理的效率。
|
19天前
|
机器学习/深度学习 数据采集 人工智能
智能化运维在现代IT基础设施中的应用与价值####
本文探讨了智能化运维(AIOps)在现代IT基础设施管理中的实际应用、面临的挑战及其带来的深远影响。通过引入先进的算法和机器学习模型,智能化运维不仅提高了故障检测与响应的速度,还显著优化了资源配置,降低了运营成本,为企业数字化转型提供了强有力的技术支撑。 ####
|
17天前
|
机器学习/深度学习 人工智能 运维
智能运维在现代IT系统中的应用与挑战####
本文深入探讨了智能运维(AIOps)在现代IT系统中的关键作用,通过具体案例分析,揭示了其在提升系统稳定性、优化资源配置及自动化故障处理方面的显著优势。同时,文章也指出了实施智能运维过程中面临的数据安全、技术整合及人员技能转型等挑战,并提出了相应的解决策略,为读者提供了全面而深刻的见解。 ####
43 6
|
16天前
|
运维 监控
构建高效运维体系:从理论到实践
在当今快速发展的信息化时代,高效的运维体系是保障企业信息系统稳定运行的关键。本文旨在探讨如何构建一个高效、可靠的运维体系,通过分析当前运维面临的挑战,提出相应的解决策略,并结合实际案例,展示这些策略的实施效果。文章首先介绍了高效运维的重要性,接着分析了运维过程中常见的问题,然后详细阐述了构建高效运维体系的策略和步骤,最后通过一个实际案例来验证这些策略的有效性。
|
19天前
|
机器学习/深度学习 运维 监控
智能化运维:从被动响应到主动预防的转型之路####
本文深入探讨了智能化运维(AIOps)如何引领信息技术管理从传统的被动响应模式向主动预防机制转变,强调了大数据、人工智能算法与机器学习技术在提升系统稳定性和效率中的关键作用。通过分析智能化运维的核心价值、实施策略及面临的挑战,本文为读者揭示了一个更加智能、高效且灵活的IT运维未来蓝图。 ####
|
17天前
|
人工智能 运维 监控
智能运维在现代数据中心的应用与挑战
随着云计算和大数据技术的迅猛发展,现代数据中心的运维管理面临着前所未有的挑战。本文探讨了智能运维技术在数据中心中的应用,包括自动化监控、故障预测与诊断、资源优化等方面,并分析了当前面临的主要挑战,如数据安全、系统集成复杂性等。通过实际案例分析,展示了智能运维如何帮助数据中心提高效率、降低成本,并提出了未来发展趋势和建议。