RocketMQ 高可用创新论文入选 ACM FSE:无需复制业务数据,实现有状态服务秒级接管

简介: 面向云上有状态服务高可用,提出无需额外业务数据复制的秒级故障接管机制,在不牺牲成本和稳态性能的前提下,实现云上有状态消息服务的快速恢复。

作者:金融通


近日,阿里云消息团队发表的 Apache RocketMQ 高可用创新论文 《无业务数据复制的故障接管:面向有状态服务的协议级安全接管》(英文原名:Replication-Free Failover: Protocol-Fenced Takeover for Stateful Services)入选 FSE 2026 Industry Papers Track


ACM FSE(The ACM International Conference on the Foundations of Software Engineering)是享有盛誉的国际学术会议,被《中国计算机学会推荐国际学术会议和期刊目录》列为 CCF-A 类软件工程顶级会议。FSE 2026 于 2026 年 7 月 5 日至 9 日在加拿大蒙特利尔举行,Industry Papers Track 重点关注软件工程研究在真实工业场景中的创新与应用。


此次入选论文来自阿里云消息团队长期建设和运维大规模云上消息服务的实践。面对数千个租户隔离的 RocketMQ 有状态集群,团队提出 Replication-Free Failover,旨在低成本、高稳态性能和快速恢复之间取得更好的平衡。

FSE 2026 官方论文页面

创新亮点:不复制业务数据,也能安全接管有状态服务

云上有状态服务通常希望同时获得低成本、高稳态性能和快速恢复,但三者很难兼得。围绕这一工程难题,论文的创新主要体现在以下几个方面。

1. 无需额外业务数据复制,正常数据路径保持不变

方案继续使用单副本、单机文件系统和具备存储侧冗余能力的云块存储,不在 RocketMQ 服务层增加额外业务数据副本,也不引入额外写放大;同时无需重写 CommitLog / WAL,尽可能保留原有的成本与稳态性能优势,并最大程度保持与 Apache RocketMQ 社区版本的兼容性。

2. 协议级安全接管,并可验证所有权转移

方案利用多挂载(Multi-Attach)提前使磁盘对候选节点可见,并通过 NVMe Persistent Reservation(NVMe PR)将写权限控制下沉至存储协议层。在此基础上,引入持有者校验、原子化抢占、关键阶段标记和退避机制,避免文件系统恢复过程中写权限被再次抢占。

3. 面向本地文件系统的接管一致性闭环

方案将确认写权限、清理接管节点的旧缓存、挂载文件系统、执行文件系统日志回放与应用崩溃恢复,以及通过就绪检查恢复流量纳入同一状态机,解决共享盘对新节点可见以后,如何安全恢复持久化状态和服务的问题。

4. 基于持久化进展的去中心化故障探测

方案通过共享盘中租约(lease)记录的版本进展判断当前主节点是否仍能完成持久化,而不仅仅判断进程或者节点是否存活。因此,它能够识别 I/O 卡顿(I/O hang)等“节点仍然存活,但持久化状态已经停止推进”的故障,并减少对集中式控制面的依赖;在网络分区等场景下,则由存储协议层的写隔离保证接管后的单写安全。

5. 最小权限、可审计的生产级端到端落地

方案将 NVMe PR、缓存处理和挂载等高权限操作收敛到节点侧 Agent,业务容器无需获得系统级权限;同时将故障发现、写权限切换、应用恢复和流量恢复串联起来,形成可观测、可审计、可持续演练的端到端恢复流程。


区别于通过重构存储引擎、引入共享 WAL 和对象存储,使节点无状态化的技术路线,本方案选择保留 RocketMQ 已有的单机文件系统和正常读写语义,只重新设计故障接管路径。由于高可用机制不替换正常存储引擎,既能继续复用成熟的 CommitLog、文件系统缓存和崩溃恢复能力,也使后续新增存储特性无需为高可用路径单独重构。


由此,方案既降低了对 Broker 核心代码的侵入和改造范围,也减少了后续社区版本升级与长期维护成本,更适合已经运行在生产环境中的单主有状态服务。

Replication-Free Failover 整体架构图

评估与生产验证:从分钟级恢复压缩到秒级

论文以 Apache RocketMQ 为代表性工作负载进行评估。结果表明,该方案可以将节点故障后的恢复时间从常见 Kubernetes 单副本云盘方案的分钟级缩短至秒级,同时保持接近原生单副本部署的吞吐和延迟表现


论文还报告了方案的生产验证:系统已完成数万次灾备演练,并在生产环境运行。该工作将阿里云消息团队在节点宕机、I/O 卡顿和网络分区等真实故障中的实践,沉淀为一种适用于单主、单写有状态服务的高可用设计,为云上基础软件在成本、性能和恢复速度之间提供了新的工程化选择。


随着 AI Infra 对可靠消息传递和有状态服务的需求增长,这类高可用能力也具备进一步的复用价值。产品能力与配置说明可参见阿里云官方文档:云消息队列 RocketMQ 版实例容灾 [ 1]


面向未来,阿里云消息团队将继续围绕 Apache RocketMQ 的云原生、高可用、弹性伸缩和智能运维能力展开探索,把大规模生产经验转化为可复用的技术能力,为企业级消息系统提供更稳定、更高效、更低成本的基础设施支撑。


附论文信息:

论文题目:《无业务数据复制的故障接管:面向有状态服务的协议级安全接管》(英文原名:Replication-Free Failover: Protocol-Fenced Takeover for Stateful Services)

作者: 金融通、古崟佑、季俊涛、傅玉宝、刘涛、赖福智、蔡高扬、林清山(均来自阿里云)


论文概述: 本文面向云上单主有状态服务,提出一种无需额外业务数据复制的故障接管机制。方案保持单副本单机文件系统的正常数据路径不变,并通过存储协议层的写隔离缩短恢复链路。实验与生产实践表明,该方案能够在保持接近单副本稳态性能的同时实现秒级恢复。


相关链接:

[1] 云消息队列 RocketMQ 版实例容灾产品能力与配置说明

https://help.aliyun.com/zh/apsaramq-for-rocketmq/cloud-message-queue-rocketmq-5-x-series/security-and-compliance/instance-disaster-recovery#h3-data-ha

[2] FSE 2026 官方论文详情页

https://conf.researchr.org/details/fse-2026/fse-2026-industry-papers/25/Replication-Free-Failover-Protocol-Fenced-Takeover-for-Stateful-Services

[3] ACM Digital Library 完整论文下载

https://dl.acm.org/doi/10.1145/3803437.3805226


欢迎关注 Apache RocketMQ 中文社区https://rocketmq-learning.com/,了解 RocketMQ 最新版本、技术文章、最佳实践与社区活动。


也欢迎加入 Apache RocketMQ 开发者交流群(钉钉群号:44552972),与社区开发者一起交流 RocketMQ 在高可用、云原生架构与 AI 原生消息场景中的实践。

image.png

相关文章
|
6天前
|
云安全 人工智能 运维
阿里云联动百位企业安全专家,共识Agent防御最佳实践
当Agent成为新员工,你的安全边界在哪里?
1908 6
阿里云联动百位企业安全专家,共识Agent防御最佳实践
|
4天前
|
存储 人工智能 关系型数据库
阿里云AI产品与云产品最新组合套餐:Token Plan、AI coding及云服务器和建站等组合优惠价
阿里云推出全新“算力+模型+应用”一站式云与AI组合套餐活动,覆盖从个人开发者到中大型企业的全场景需求。核心亮点为分三档定价的Token Plan订阅服务,支持Qwen3.8-Max-Preview大模型调用,错峰时段最低可享0.2折优惠。活动同步推出AI Coding、智能体部署、云电脑托管、0代码建站等十余类场景化组合,搭配99元/年的普惠云服务器、88元/年的入门数据库等经典特惠产品,还为企业提供1V1定制化AI转型方案,大幅降低了不同用户群体拥抱AI的技术门槛与采购成本。
638 110
|
14天前
|
人工智能 JSON 安全
Fastjson远程代码执行漏洞,阿里云AI安全为您保驾护航
阿里云AI安全产品联动防御Fastjson攻击
2521 13
Fastjson远程代码执行漏洞,阿里云AI安全为您保驾护航
|
14天前
|
人工智能 自然语言处理 数据挖掘
Qwen3.8-Max-Preview深度全解析:2.4万亿参数旗舰MoE模型+Token Plan限时优惠完整落地指南
2026年7月,全新旗舰级混合专家大模型Qwen3.8-Max-Preview正式开放抢先体验,作为通义千问Qwen3系列规格最高、综合推理能力顶尖的新一代模型,该模型总参数量达到2.4万亿(2.4T),是当前线上可调用的原生多模态旗舰模型,综合推理水准对标海外顶级Fable 5模型,在复杂工程开发、长文档深度分析、多步骤智能体自治、跨境多语言创作、海量数据挖掘五大高难度业务场景实现跨越式性能提升。
1378 2
|
12天前
|
人工智能 前端开发 Linux
Codex 桌面版安装 + CC Switch 接入第三方 API 完整教程(2026 最新)
2026最新教程:手把手教你安装Codex桌面版,通过CC Switch v3.17.0一键接入Fenno等国产API(兼容OpenAI Responses格式),跳过账号登录,完整启用代码审查、多步任务与上下文感知功能。零基础友好,全程图文实操。(239字)
1292 2
|
16天前
|
人工智能
Qwen3.8抢先体验!正式版即将发布并开源!
千问Qwen3.8即将开源,参数达2.4T,进化速度以“天”计,实力媲美Fable 5。预览版Qwen3.8-Max已上线阿里Token Plan等平台,限时优惠:日间Credits低至1折,夜间更优,个人/团队版月付仅35元起!
1413 54
|
12天前
|
自然语言处理 测试技术 API
通义千问Qwen3.8-Max-Preview全功能解析:2.4万亿参数旗舰模型深度使用指南
在大模型技术持续迭代的当下,通义千问推出的Qwen3.8-Max-Preview作为新一代旗舰预览版模型,凭借2.4万亿参数的超大规模、多模态融合能力与全场景适配特性,成为开发者与企业用户探索AI应用的核心工具。该模型采用稀疏混合专家(MoE)架构,是通义千问首个突破万亿参数的多模态模型,可同时处理文本、图像、视频与文档等多种数据形态,在全栈代码开发、复杂逻辑推理、长文档分析与多智能体协作等场景实现跨越式升级。本文将全面拆解Qwen3.8-Max-Preview的核心功能,详解API调用流程与配置方法,覆盖多场景实战技巧,帮助用户快速掌握这款旗舰模型的使用方法,充分释放其性能潜力。
666 2

热门文章

最新文章