《OpenACC并行程序设计:性能优化实践指南》一 3.5 在应用程序执行期间记录性能信息

简介: 本节书摘来自华章出版社《OpenACC并行程序设计:性能优化实践指南》一 书中的第3章,第3.5节,作者:[美] 罗布·法伯(Rob Farber),更多章节内容可以访问云栖社区“华章计算机”公众号查看。

3.5 在应用程序执行期间记录性能信息

应用程序将自动使用第一个插装事件启动Score-P性能监视器。使用几个环境变量来配置性能监视器。为了尽量减小运行时间扰动,Score-P默认设置产生一个基于性能分析的事件,这个事件不包含任何加速器活动。为了设置Score-P来记录PCIonGPU示例相关的活动,图3-5展示了与设置有关的环境变量。为了在Score-P 3.0版本中跟踪OpenACC API活动,将环境变量SCOREP_OPENACC_ENABLE设置为“yes”。Score-P文档中描述了其他可用的选项。

screenshot

程序执行完后,在当前工作目录下包含一个新的子文件夹,以scorep-<程序执行时间戳>命名。如图3-6所示,在这个文件夹里,可以找到分析(profile.cubex)和跟踪文件(trace.otf2)。

screenshot

生成的分析是了解应用程序行为的非常有价值的方法。对事件率未知或预期非常大的应用程序,建议开始仅生成分析,并扩展跟踪以覆盖所需的信息。这个需要通过限制插装或记录过滤来实现。查看“cube”文件可以可视化分析(profile.cubx),如图3-7所示。

screenshot

查看器显示了应用程序运行的多度量分析(最左列)。中间列显示的是最左列选中度量在程序函数间的情况。最右列显示的是中间列所选函数在应用程序运行期间的进程和线程情况。追踪文件允许对分析数据和时间上下文进行深入分析。如何使用它来优化PIConGPU应用参见以下章节。有关Score-P设置更详细说明参见安装手册。

相关文章
|
3天前
|
数据采集 人工智能 安全
|
12天前
|
云安全 监控 安全
|
4天前
|
自然语言处理 API
万相 Wan2.6 全新升级发布!人人都能当导演的时代来了
通义万相2.6全新升级,支持文生图、图生视频、文生视频,打造电影级创作体验。智能分镜、角色扮演、音画同步,让创意一键成片,大众也能轻松制作高质量短视频。
1042 151
|
4天前
|
编解码 人工智能 机器人
通义万相2.6,模型使用指南
智能分镜 | 多镜头叙事 | 支持15秒视频生成 | 高品质声音生成 | 多人稳定对话
|
17天前
|
机器学习/深度学习 人工智能 自然语言处理
Z-Image:冲击体验上限的下一代图像生成模型
通义实验室推出全新文生图模型Z-Image,以6B参数实现“快、稳、轻、准”突破。Turbo版本仅需8步亚秒级生成,支持16GB显存设备,中英双语理解与文字渲染尤为出色,真实感和美学表现媲美国际顶尖模型,被誉为“最值得关注的开源生图模型之一”。
1731 9
|
9天前
|
人工智能 自然语言处理 API
一句话生成拓扑图!AI+Draw.io 封神开源组合,工具让你的效率爆炸
一句话生成拓扑图!next-ai-draw-io 结合 AI 与 Draw.io,通过自然语言秒出架构图,支持私有部署、免费大模型接口,彻底解放生产力,绘图效率直接爆炸。
680 152
|
11天前
|
人工智能 安全 前端开发
AgentScope Java v1.0 发布,让 Java 开发者轻松构建企业级 Agentic 应用
AgentScope 重磅发布 Java 版本,拥抱企业开发主流技术栈。
644 13
|
6天前
|
SQL 自然语言处理 调度
Agent Skills 的一次工程实践
**本文采用 Agent Skills 实现整体智能体**,开发框架采用 AgentScope,模型使用 **qwen3-max**。Agent Skills 是 Anthropic 新推出的一种有别于mcp server的一种开发方式,用于为 AI **引入可共享的专业技能**。经验封装到**可发现、可复用的能力单元**中,每个技能以文件夹形式存在,包含特定任务的指导性说明(SKILL.md 文件)、脚本代码和资源等 。大模型可以根据需要动态加载这些技能,从而扩展自身的功能。目前不少国内外的一些框架也开始支持此种的开发方式,详细介绍如下。
406 4