龙蜥 AI Infra 新力量:T-Head SAIL 软件栈正式开源

简介: T-Head SAIL 已基于龙蜥 Anolis Cloud Kernel (ANCK)内核完成原生驱动适配,支持开箱即用。

7月18日,平头哥自研软件栈 T-Head SAIL® 正式开源,向全球开发者开放高效、开放的 AI 算力基础设施核心能力。

作为自主算力新标杆,真武 AI 芯片凭借卓越算力与数据中心系统级全栈协同生态,高效助力将 AI 算力落地为生产力,为千行百业智能化进程注入澎湃动能。T-Head SAIL 是平头哥为真武系列 AI 芯片打造的软件栈,拥有自主知识产权、全面兼容主流 AI 生态。软件栈覆盖 OS 层、SDK 层与接口层的完整链路——向下释放真武硬件算力,向上承接上层应用需求。

AI 算力基础设施的价值释放,离不开操作系统这一关键枢纽——只有让芯片驱动与系统内核深度协同,才能真正打通从硬件到应用的高效通路。在操作系统生态层面,T-Head SAIL 已基于龙蜥 Anolis Cloud Kernel (ANCK)内核完成原生驱动适配,覆盖 Anolis OS 7、Anolis OS 8 及其衍生版 Alibaba Cloud Linux(简称 Alinux)系列 Alinux 3 、 Alinux 4 等主流服务器系统,支持开箱即用。同时,平头哥产品已优先与龙蜥操作系统完成相互兼容性测试认证,进一步夯实双方在 AI 基础设施领域的协同创新能力。

截止今年 4 月,真武 AI 芯片已累计出货 56 万片,服务 20 多个行业 400 多家客户。真武 AI 芯片及 T-Head SAIL 软件栈已在阿里云及多家头部客户的真实生产环境中历经深度打磨,扛过大规模流量、复杂场景以及严苛 SLA 的多重考验。

今天,平头哥将这套经过严苛生产验证的 T-Head SAIL 软件栈方案开放给整个开发者社区。

T-Head SAIL - 真武 AI 芯片开发完整基座

从底层驱动到上层工具,T-Head SAIL 软件栈由五层完整的技术栈组成,致力为开发者提供完整、可靠、开箱即用的开发体验。

  • Driver 与 Runtime 层:PPU Driver 分为内核态的 KMD 与用户态的 UMD,配合 PPU Runtime 提供统一的设备管理和内存管理接口;
  • 编程语言层:完整支持 C/C++ 与 Python,开发者无需学习新的语言或编程范式,支持现有代码资产平滑迁移;
  • 编译器层:包含 Compiler 与 Debugger 两大组件,构建完整的开发闭环;
  • 高性能库层:全面覆盖主流计算需求,为各类计算场景提供对应的高性能实现
  • 计算库涵盖 acBLAS、acDNN、acFFT、acRAND、acSOLVER、acSPARSE 六大核心数学库,为大模型训练与推理提供支撑;
  • 编解码库覆盖 HGDEC、HGENC、HGJPEG 与 HGPP,满足多模态数据处理的高吞吐需求;
  • 集合通信库包含 PCCL 与 sailSHMEM,专为多卡、多机分布式训练设计,助力突破通信瓶颈;
  • 此外配备 acext 扩展库与 HGML 机器学习库,拓展丰富功能边界
  • 开发者工具层:丰富相应配套工具,赋能从单卡调试到千卡运维的全链路掌控
  • Asight Compute 支持算子级精细性能分析,帮助定位微观瓶颈;
  • Asight Systems 面向系统级全栈 Profiling,提供宏观视角;
  • PPU-SMI 实现设备实时监控与管理;
  • PPU-DCGM 支撑集群级别的资源智能调度。

面向开发者体验的软件栈

从第一行代码的创建开始,T-Head SAIL 的建设始终秉持“以开发者体验为中心”的核心理念。通过零代码修改迁移、同频生态适配与全量框架覆盖三大核心能力,T-Head SAIL 助力开发者实现三大“无需妥协”,致力于将开发过程中的效率提升与成本节约转化为可量化、可感知的业务增长。

无需重写代码,让既有资产无缝延续

T-Head SAIL 兼容主流 AI 生态,主流模型即开即用,算子库完整对标,主流编程模型高度兼容。开发者过去积累的经验、代码、调优技巧,在 T-Head SAIL上都能直接复用,业务迁移仅需极少量代码适配修改、平滑顺畅。

无需等待适配,与前沿生态同频演进

AI 技术迭代日新月异,平头哥自研推理引擎提供开箱即用的生产级性能,同时T-Head SAIL 已完善建立与主流社区同频的响应机制,框架跟进、新模型适配速度迅捷极速。目前主流 AI 推理框架,T-Head SAIL 平均适配时间<7 天,开发者无需额外适配和调优,即可使用前沿最新的算子、特性与优化手段。

无需绑定框架平台,为开发提供灵活选择

T-Head SAIL 已全面适配 PyTorch、TensorFlow、vLLM、SGLang 等 260 余个主流训练与推理框架,开发者获取源码后即可直接编译运行,无需额外适配。T-Head SAIL 支持按需灵活选用工具链,不绑定任何特定技术路线,保障技术选型的自主与开放。

智算无界,共行致远

目前,平头哥开发者社区网站现已上线,汇聚 T-Head SAIL 全栈技术文档,提供 SDK 软件包、内核驱动、性能分析和调试工具下载,为开发者提供一站式服务。

社区网站地址:https://developer.t-head.cn/

面向未来,平头哥将持续加码社区建设,与龙蜥共同推进内核与驱动的协同优化,充分释放新时代智算基础设施的极致效能。

—— 完 ——

相关文章
|
人工智能 缓存 并行计算
技术改变AI发展:Ada Lovelace架构解读及RTX 4090性能测试分析(系列三)
简介:随着人工智能(AI)的迅速发展,越来越多的应用需要巨大的GPU计算资源。Ada lovelace(后面简称Ada)是NVIDIA最新的图形处理器架构,随2022年9月20日发布的RTX 4090一起公布。
145695 62
技术改变AI发展:Ada Lovelace架构解读及RTX 4090性能测试分析(系列三)
|
弹性计算 安全 网络协议
VPC的基本原理|学习笔记
快速学习VPC的基本原理
|
14天前
|
人工智能 开发工具 开发者
真武AI芯片 T-Head SAIL® 软件栈正式开源开放!
今天,真武AI芯片软件栈 T-Head SAIL® 正式开源,向全球开发者开放高效、开放的AI算力基础设施核心能力。
|
11天前
|
人工智能 自然语言处理 算法
面向RISC-V的跨架构代码迁移智能实践:从“能跑”到“跑得快”,效率提升6倍
展示了一套从代码扫描、AI 生成、仿真验证到性能优化的全链路闭环体系,为 RISC-V 代码迁移提供了一条“端到端”的自动化路径。
|
人工智能 安全 机器人
OpenClaw(原 Clawdbot)钉钉对接保姆级教程 手把手教你打造自己的 AI 助手
OpenClaw(原Clawdbot)是一款开源本地AI助手,支持钉钉、飞书等多平台接入。本教程手把手指导Linux下部署与钉钉机器人对接,涵盖环境配置、模型选择(如Qwen)、权限设置及调试,助你快速打造私有、安全、高权限的专属AI助理。(239字)
40273 184
|
4月前
|
存储 人工智能 JavaScript
Prompt、Context、Harness:AI Agent 工程的三层架构解析
2023年重“Prompt”(如何说),2025年重“Context”(看到什么),2026年跃升至“Harness”(系统级约束与验证)。三者非替代而是分层:Prompt优化表达,Context管理信息环境,Harness构建可信执行系统——模型是马,Harness才是缰绳、马鞍与路。
1230 10
Prompt、Context、Harness:AI Agent 工程的三层架构解析
|
缓存 测试技术 API
解锁开源模型高性能服务:SGLang Runtime 应用场景与实践
SGLang 是一个用于大型语言模型和视觉语言模型的推理框架。
|
人工智能 运维 安全
更低成本、更高效、更安全!阿里云与钉钉联合推出协同办公AI解决方案
阿里云与钉钉携手推出了全新的“钉钉·AI Stack一体机”,以“低成本、高安全、零门槛”为核心,为用户提供基于钉钉,从模型部署到全员落地的AI解决方案,开启智能化办公的“一键加速”。
2181 1
|
缓存 容灾 架构师
极客时间架构实战营总结
极客时间架构实战营总结
1032 0
|
存储 固态存储 文件存储
并行文件存储在大模型训练中的探索与实践
阿里云智能集团存储产品专家何邦剑分享了并行文件存储CPFS在大模型训练中的应用。CPFS针对大模型训练的IO特点,优化性能、降低成本、提升用户体验。它支持多计算平台共享访问,具备数据分层存储、生命周期管理、缓存加速等特性,实现高效的数据处理与管理,显著提升训练效率和资源利用率。尤其在大规模集群中,CPFS提供了高吞吐、低延迟及灵活扩展的能力,助力客户如零一万物实现高性能训练。

热门文章

最新文章