百度使用自主研发系统工具hdoctor 使SATA盘返修率低于SAS盘

简介: 据了解,百度近三年来一直使用其主导研发的系统工具hdoctor。该创新工具的应用,使SATA 硬盘的故障返修率低于比其成本及可靠性更高的SAS硬盘,有效地解决了在大数据时代,大规模大容量SATA硬盘应用背景下的高故障率、低运维效率和存储成本控制等难题,并对大幅降低云存储购置成本奠定坚实基础。

据了解,百度近三年来一直使用其主导研发的系统工具hdoctor。该创新工具的应用,使SATA 硬盘的故障返修率低于比其成本及可靠性更高的SAS硬盘,有效地解决了在大数据时代,大规模大容量SATA硬盘应用背景下的高故障率、低运维效率和存储成本控制等难题,并对大幅降低云存储购置成本奠定坚实基础。


大数据促硬盘故障问题凸显

如今,数据量迅速膨胀,据IDC统计,2012年全球数据总量已达到2.8ZB,而到2020年,预计将达到40ZB,相当于地球上所有海滩沙粒数量的57倍,地球上人均将拥有5247GB数据。海量数据让全球面临着数据存储方面的严峻挑战,这里面既有技术上的难题,也有来自成本方面的压力。而硬盘作为数据中心存储数据的核心部件之一,其返修率高、成本昂贵成为众多挑战中的主要难题。


据统计,在数据中心中,硬盘相关的故障占全部硬件故障的85%以上。随着大数据时代的到来,服务器数量大幅度增长,更多的存储需求、更低成本硬盘的使用,以及高温、高存储密度等技术的应用,硬盘故障及报废规模呈明显增加趋势。这对业务稳定、存储成本和运维效率都造成了严重的影响。如何降低返修率一直困扰业界。


因为存储着上百PB数据,百度——这家全球最大的中文搜索引擎公司拥有着数百万块硬盘,解决返修率问题极其迫切。也正是在这样的背景下,百度于三年前就自主创新,主导研发了系统工具hdoctor。


百度hdoctor五维度融合创新

hdoctor 最主要的成果是让SATA硬盘的返修率低于SAS硬盘。


众所周知,SATA硬盘的返修率高出SAS硬盘近40%以上,拿业界某知名硬盘厂商最新产品为例:企业级10k SAS硬盘的年返修率(AFR)是0.44%;近线级的7.2k SATA 硬盘的AFR为0.63%。而百度使用该工具后,不仅减少了60%的SATA硬盘返修率,实现了全部硬盘故障处理及报废擦除的全流程自动化,还通过与存储系统的调度管理集成,提前处理潜在故障的硬盘,大幅缩小了故障对业务影响,有效降低运维成本,及人力、物力投入。可以说,百度用更低成本得到了更高的质量保证。


之所以能实现如上成果,主要得益于hdoctor从五个维度融合创新:


第一,硬盘故障检测。hdoctor 通过日志增量监控,整合系统设置、报错类型、硬盘运行状态等检查环节,可在10秒内监控99% 的故障,覆盖全部的机型;经过多次验证,准确度与硬盘厂商采用的硬件检测分析方法(FA)相当。


第二,硬盘故障修复。能在60秒内修复SATA硬盘60%的故障,包括潜在故障扇区修复、文件系统坏块屏蔽、硬盘及阵列状态设置校正、硬盘状态未就绪或超时的处理、数据/硬件故障排除、盘符前后漂移复位等常见的运维故障处理。而在未使用hdoctor的情况下,因业务稳定性要求,一旦出现报错,业界的通常做法是更换硬盘,这使得维护代价十分高昂。


第三,硬盘故障预警。基于数十万片硬盘近30个月的硬盘运行及故障大数据,使用机器学习技术,挖掘、分析海量数据,打造了可自动迭代的故障预测系统,支持全部厂商所有型号的 SATA 硬盘故障预测,准确率超过98%;同时与系统调度集成,能够提前避免故障对业务造成不良影响,有效降低云存储系统的平均故障修复时间(MTTR)。


第四,硬盘报废擦除。终捍卫云端数据安全,集成三种国际认证的安全擦除方案,可在JBOD、RAID环境下,快速、高效、安全擦除包括SATA、SAS、SSD、Flash在内的各种存储介质。


第五,自动运维支持。hdoctor提供所有类型硬盘的故障检测、修复、上线、下线、报修、结单检测等全方位的自动化运维API,同时定期维护和校正硬盘的状态运行信息,而且工具本身的运行机制也是自反馈和自维护的。


据了解,hdoctor已历经了三个年头。基于每月积累的故障记录,以及与硬盘相关的预警、负载、功耗、性能、温度等数十亿级别的大数据,该工具不断地迭代升级,在降低故障率,提升运维效率和云存储系统可靠性的同时,有效助力硬盘资源调度、功耗管理、存储分级等软硬件协同工作,大规模降低云存储运营成本。


业内分析人士指出,百度hdoctor的创新成果具有极为重要的产业意义。它解决了大规模大容量SATA硬盘应用背景下的高故障率、低运维效率和存储成本控制等难题,为业界实现更低成本、更高质量数据存储起到示范与引领作用;更具未来发展意义的是,该工具的使用对未来将云盘、归档盘等低成本存储介质引入数据中心奠定了基础,能够使云存储购置成本大幅降低。百度的创新技术,打破了云计算和大数据产业发展中的一大阻碍,将有效推动产业更高速成长。


相关实践学习
基于MaxCompute的热门话题分析
Apsara Clouder大数据专项技能认证配套课程:基于MaxCompute的热门话题分析
相关文章
|
安全 Java
jdk9模块化
本文介绍了JDK 9引入的模块化系统,解释了模块化的概念、好处,包括提高安全性、可维护性和减少冲突及加快启动时间,并举例说明了如何使用module-info.java文件来定义模块依赖和暴露的包。
407 2
|
6月前
|
Ubuntu Linux 开发者
Linux发行版比较:选择适合你的操作系统
在做出选择之前,建议您先在虚拟机或双系统环境中尝试不同的发行版,根据自己的体验和需求做出决策。选择适合自己的Linux发行版是一个个人化和主观的过程,最重要的是找到符合自己需求和喜好的发行版,让您在使用Linux系统时感到舒适和方便。
|
存储 SQL 安全
API 数据接口使用与安全指南
本文介绍了API数据接口的基础知识、使用流程及安全要点。首先,定义了API及其在现代技术生态中的重要性,接着详细阐述了API使用的六个步骤:明确需求、搜索筛选、注册获取密钥、解读文档、环境搭建与集成、数据处理与应用集成。最后,强调了API安全的重要性,包括身份验证、数据加密、防范攻击及安全监控等方面,确保API的安全稳定运行。
|
机器学习/深度学习 传感器 人工智能
智慧无人机AI算法方案
智慧无人机AI算法方案通过集成先进的AI技术和多传感器融合,实现了无人机的自主飞行、智能避障、高效数据处理及多机协同作业,显著提升了无人机在复杂环境下的作业能力和安全性。该方案广泛应用于航拍测绘、巡检监测、应急救援和物流配送等领域,能够有效降低人工成本,提高任务执行效率和数据处理速度。
2829 2
智慧无人机AI算法方案
|
自然语言处理 搜索推荐 机器人
langchain 简介
langchain 简介
1099 1
|
存储 人工智能 安全
阿里云oss简介和如何对接使用
阿里云对象存储服务(Alibaba Cloud Object Storage Service,简称OSS)是阿里云提供的一种安全、稳定、高效的对象存储服务。它支持多元数据存储、持久化存储和共享访问,并且具有无限的扩展性和备份恢复能力。阿里云OSS适用于各类场景,如云计算、大数据分析、人工智能等,并且具备高可用性、高可扩展性和低成本等优势。
15697 2
|
存储 前端开发 数据管理
为LTO磁带而生的文件系统LTFS|主线任务—夺回"秋雅"
在LTO第一代到第四代,如果我们想要访问LTO磁带的内容,都需要厂商提供的特殊软件来支持,软件需要全部加在整个磁带的内容,才能展示你要查找的文件,保存文件的过程也需要特有的软件来处理。提供的磁带存储的厂商还有多个这就导致用户在使用磁带过程中,非常的痛苦地面对来回之间复杂的搬运场景。
|
Linux 测试技术
Linux内核版本要求
【8月更文挑战第9天】Linux内核版本要求
443 5
|
设计模式 JavaScript 安全
【TypeScript 技术专栏】TypeScript 性能优化与代码质量提升
【4月更文挑战第30天】探索 TypeScript 性能优化与代码质量提升:合理使用类型注解,减少不必要的类型断言,优化模块导入,避免过度封装;遵循编码规范,加强注释,运用设计模式,进行代码审查。在追求性能与质量间找平衡,通过案例分析实践优化策略,持续提升项目体验与可持续发展。一起打造优质 TypeScript 项目!
482 0
|
人工智能
【AI大模型应用开发】【LangChain系列】实战案例5:用LangChain实现灵活的Agents+RAG,该查时查,不该查时就别查
【AI大模型应用开发】【LangChain系列】实战案例5:用LangChain实现灵活的Agents+RAG,该查时查,不该查时就别查
1395 0