朱晔的互联网架构实践心得S1E3:相辅相成的存储五件套

本文涉及的产品
云数据库 MongoDB,独享型 2核8GB
推荐场景:
构建全方位客户视图
云数据库 RDS MySQL,集群系列 2核4GB
推荐场景:
搭建个人博客
RDS MySQL Serverless 基础系列,0.5-2RCU 50GB
简介: 朱晔的互联网架构实践心得S1E3:相辅相成的存储五件套 【下载本文PDF进行阅读】 这里所说的五件套是指关系型数据库、索引型数据库、时序型数据库、文档型数据库和缓存型数据库。   上图显示了一套读写服务搭配这五种类型数据库的例子: 1.    这里只是说明了我们可以这么来搭配这些类型的数据库,不是说我们所有的应用都需要用到这些类型的数据库。

朱晔的互联网架构实践心得S1E3:相辅相成的存储五件套

下载本文PDF进行阅读

这里所说的五件套是指关系型数据库索引型数据库时序型数据库文档型数据库缓存型数据库

 

上图显示了一套读写服务搭配这五种类型数据库的例子:

1.    这里只是说明了我们可以这么来搭配这些类型的数据库,不是说我们所有的应用都需要用到这些类型的数据库。

2.    同步写服务负责第一时间把重要的数据落地和落缓存。

3.    异步写服务通过监听MQ来感知数据的变化,然后重新读取最新的数据来把数据写入其它次要数据源,比如文档性数据库和索引型数据库,需要的话可以在缓存中回写一个状态。

4.    由一个专门的数据查询服务来根据需求做数据路由,根据需求和性能因素,从不同的数据源读取数据。

5.    数据聚合服务根据需求从次要数据源进一步读取数据以时间维度进行聚合,聚合到时间序列数据库,供监控查询服务查询。

下面我们来具体说说这些存储系统。

关系型数据库

毫无疑问,强事务性的数据写入MySQL之类的关系型数据库是最可靠的,搭配SSD盘的使用,关系型数据库也很容易达到万级的QPS。对于超大数据量加上超大并发的应用来说,单表的数据量过千万伴随着数万的QPS很难以单体数据库来支撑,我们需要对数据表进行Sharding分片处理,把数据按照一定的维度切分到比如128个数据表,然后分散在8套甚至16套数据集群,这样每一台MySQL的实例只需要承受1/8或1/16的请求压力而且数据量更小。随之带来的问题是,我们需要对应用进行改造,使之只能按照一定的查询条件来查询这个切片后的表,如果不带条件或带任意条件的话,我们是无法知道数据实际存储在哪个表哪个实例上的。

这确实是一个比较麻烦的地方,我们的查询条件可能有十几个,只能按照一个维度来查询满足不了我们的需求。一个折中的方式是我们引入所谓的Index数据表,也就是在写入实际的完整数据到Sharding的数据表的同时,我们把数据表里需要查询的字段写入一个专门的没有经过Sharding处理的Index数据表,这个数据表里存放的几乎没有varchar类型的数据,全部是各种bigint的各类业务ID或是tinyint类型的各种状态,以及时间。由于这个表非常亲,虽然数据条数多但是表空间几乎可以在数据库的缓存中容纳,性能会高不少。对于实时性要求非常强的基于条件的查询可以从这个数据表来进行查询。而Sharding后的数据只能用于按ShardKey来进行查询。

 

缓存数据库

Redis是最常用的分布式缓存解决方案,几乎在任何互联网应用中都会用到,特点是:

1.    能持久化数据,但是我的观点是缓存数据库还是仅仅作为缓存的好,要能够承受丢失数据的风险,否则可能会死的比较难看。因为RDB或主从复制导致的一些事故也是层出不穷的。

2.    丰富的数据结构是一定要利用的,丰富的数据结构代表了可以依赖丰富的API在服务端做复杂的运算,性能比反序列化取出后运算再序列化存入效率高的多。有的时候甚至可以把这些数据结构和API组合在一起碰撞出绝妙的方案以极高效的方式实现一个高性能的业务逻辑。可以看看《Redis实战》一书。

3.    超高的性能(当然了,配合一些集群方案比如codis就更上一层楼了)足以抵挡任何业务请求的直接访问,很多时候缓存的方案挂是挂在因为各种各样的原因穿透缓存而不是Redis档不住。

4.    丰富的集群和高可用方案以及各类各种实用的功能(管道、事务、Lua脚本),5.0的版本还推出了Stream特性来替代少有人关注的Disque值得关注。

所以Redis的应用也很广泛:

  • 数据缓存
  • 分布式锁
  • 消息队列
  • 服务端运算

在上图的架构中,我们通过同步写服务对数据库和缓存进行双写,目的也就是为了让缓存中能有新鲜热数据,不管是对内还是对外这种单条数据的查询可以直接路由到缓存。

 

文档型数据库

文档型数据库的代表就是耕耘多年的Mongodb,我在一些非重要业务的场景使用过Mongodb几次,我的评价如下(最近1年多没有碰过Mongodb,也可能评价有失偏颇):

1.    超高的写入性能,非常不错的读取性能(和Redis是不能比的,性质不同),数据量增多后可能会有很厉害的性能衰退,不是Hbase那种无底洞型的存储,不维护就往里面一直堆数据进去最后的性能可能比如MySQL。

2.    因为存的是文档,所以是弱结构的,存一些事先不能确定的数据非常非常合适,而且以后要查的时候可以任何加索引对需要的数据进行搜索查询。一个很实用的场景就是作为爬虫的数据源,数据变化多端而且不那么重要,而且写入性能很重要。

3.    不太可靠和稳定,可能会丢数据,强烈不建议作为核心数据存储,建议作为一个旁路数据库用在非关键的业务。比如在上图的架构图中,我们可能会拿到核心数据后再从其它地方去补一些数据然后进行适当的加工,保存到Mongodb作为一个监控数据库或者面向后台的数据库来用(MEAN套件之一,可以想象对于简单的应用来说配合脚本语言用起来多舒服了),挂了也就挂了,没挂的话可以分担很多MySQL的压力。

4.    玩法虽然多,什么Sharding、复制、集群都有,但随着数据量的增多运维可能是一个大坑,很可能遇到集群全军覆没无法启动的情况,数据的恢复耗时很长。内存的使用相当疯狂,对硬件的使用总感觉性价比不高。

 

索引型数据库

ElasticSearch作为其代表是最近几年的黑马。ELK集群各大互联网公司都有使用,只要集群配置得当,每秒几十万的写入不是大问题,毕竟彻底的分布式化理论上可以有无限高的写入能力。ES的特点如下:

1.    非常丰富的查询API,不仅仅是全文索引查询,普通的查询API丰富多样,组合起来可以在服务端完成各种业务逻辑,基本上SQL+MySQL可以实现的,ES查询都可以实现,而且还多了更强大的全文搜索。当然,查询的语法稍显晦涩肯定没有SQL来的直挂。

2.    类似于Mongodb的schema-free,无需实现定义表结构。

3.    还算强大的写入和读取能力,当然,索引多的话写入文档的效率肯定会降低。这也是图中对于ES的写入由专门的异步流程进行的原因。

4.    ES天生的分布式配置决定了,在写入亿、十亿的数据量之后,还能在相当可以接受的时间内(比如10秒)完成一个多条件复杂查询,对于MySQL这个量级下这样的查询可能需要10分钟甚至100分钟的时间来执行,完全不能接受。

5.    ES对嵌套型数据的查询支持不错,经过测试我们倾向于把多标关联的数据作为一个大的嵌套的JSON拍扁了直接存入ES,比如我们可以把用户个人唯独的基本信息+充值订单+提现订单+投资订单,一人一个JSON存进去,然后对于嵌套的下层JSON数据也是可以方便的利用查询API进行查询。

因为这些特点,在这个架构图上,我们把ES也作为了查询服务的数据源,对于满足下面这些条件的查询,我们可以走ES:

  • 对数据延迟不敏感,可以接受一段时间查不到新鲜数据
  • 查询特别复杂,或是全文搜索,不能走Sharding后的RouteKey,Index表也无法满足需求
  • 查询的结果也不仅仅是单表的数据而是比较丰富的数据,查询数据库需要查询多个表多次

索引型数据库和文档型数据库的底层存储结构是截然不同的,虽然现在有很多人使用ES来完全替代Mongodb,但是个人觉得ES适合存比Mongodb更大的一个数据量,分布式不利用起来发挥不了ES,Mongodb还是适合中型数据非Sharding的存储。

 

时序型数据库

InfluxDb是时序型数据库的代表。对于按照时间段进行Group By查询的话,不管是ES还是MySQL还是Mongodb在API层面当然都是支持的,但是查询效率不堪入目。因此对于诸如下面的需求首当其中可以考虑时序型数据库:

  • 监控图表
  • 按时间维度聚合
  • 查询的时间维度可以跨度很长
  • 需要定期归档

如果使用传统方案的话,我们往往会以固定的时间维度来聚合保存数据,如果我们要查1小时和1年的维度,都使用5秒的聚合粒度显然不合适,我们需要在写入数据到时候针对不同的粒度进行聚合,需要一定的工作量,使用时间序列数据库可以少一些这样的烦恼。而且InfluxDb之类的数据库的性能是非常高的,写入数据的性能堪比Redis,单节点甚至可以承受十万指标的写入,基本可以满足大部分应用场景的需求。对于一些业务指标的监控,业务事件的打点,业务数据的时间维度聚合,我们完全可以考虑引入专门的时序型数据库。

 

综上所述,这里的架构图只是体现了几个重要思想:

1.    使用专门的服务来做数据的写入和读取,方便进行路由。

2.    合理规划好Sharding的方式,以及想好RDBMS在Sharding后的全套查询方案。

3.    数据的写入区分主要数据源的同步写入和次要数据源的异步写入,让主流程更快。

4.    合理利用不同数据源的特性,组合使用发挥所长,避免所短。

5.    数据的加工可以是一个层级的关系,可以由专门业务中间件来进行数据加工。

6.    RDBMS以外的数据库如果打算作为主核心存储引擎的话千万慎重思考。

7.    采用丰富的数据源意味着维护成本的增多,数据不同步的问题在所难免,需要考虑一下我们是否可以接受一定层度的数据不一致。

 

作者: lovecindywang
本文版权归作者和博客园共有,欢迎转载,但未经作者同意必须保留此段声明,且在文章页面明显位置给出原文连接,否则保留追究法律责任的权利。
相关实践学习
基于Redis实现在线游戏积分排行榜
本场景将介绍如何基于Redis数据库实现在线游戏中的游戏玩家积分排行榜功能。
云数据库 Redis 版使用教程
云数据库Redis版是兼容Redis协议标准的、提供持久化的内存数据库服务,基于高可靠双机热备架构及可无缝扩展的集群架构,满足高读写性能场景及容量需弹性变配的业务需求。 产品详情:https://www.aliyun.com/product/kvstore     ------------------------------------------------------------------------- 阿里云数据库体验:数据库上云实战 开发者云会免费提供一台带自建MySQL的源数据库 ECS 实例和一台目标数据库 RDS实例。跟着指引,您可以一步步实现将ECS自建数据库迁移到目标数据库RDS。 点击下方链接,领取免费ECS&RDS资源,30分钟完成数据库上云实战!https://developer.aliyun.com/adc/scenario/51eefbd1894e42f6bb9acacadd3f9121?spm=a2c6h.13788135.J_3257954370.9.4ba85f24utseFl
相关文章
|
2天前
|
运维 负载均衡 监控
深入探索微服务架构的核心要素与实践策略
在当今软件开发领域,微服务架构已成为构建灵活、可扩展企业级应用的首选模式。本文旨在剖析微服务架构的设计理念,通过实例阐述其核心组件如服务注册与发现、配置管理、熔断机制等如何协同工作,以提升系统的敏捷性和维护性。同时,探讨了在实践中应对分布式系统复杂性的最佳策略,包括负载均衡、服务监控和日志聚合等关键技术,旨在为后端开发者提供一套完整的微服务实施指南。
15 1
|
8天前
|
机器学习/深度学习 人工智能 自然语言处理
赋能百业:多模态处理技术与大模型架构下的AI解决方案落地实践
【9月更文挑战第4天】赋能百业:多模态处理技术与大模型架构下的AI解决方案落地实践
赋能百业:多模态处理技术与大模型架构下的AI解决方案落地实践
|
3天前
|
消息中间件 缓存 监控
优化微服务架构中的数据库访问:策略与实践
随着微服务架构的普及,如何高效管理和优化数据库访问成为了关键挑战。本文探讨了在微服务环境中优化数据库访问的策略,包括数据库分片、缓存机制、异步处理等技术手段。通过深入分析实际案例和最佳实践,本文旨在为开发者提供实际可行的解决方案,以提升系统性能和可扩展性。
|
7天前
|
运维 Cloud Native Devops
云原生架构的崛起与实践云原生架构是一种通过容器化、微服务和DevOps等技术手段,帮助应用系统实现敏捷部署、弹性扩展和高效运维的技术理念。本文将探讨云原生的概念、核心技术以及其在企业中的应用实践,揭示云原生如何成为现代软件开发和运营的主流方式。##
云原生架构是现代IT领域的一场革命,它依托于容器化、微服务和DevOps等核心技术,旨在解决传统架构在应对复杂业务需求时的不足。通过采用云原生方法,企业可以实现敏捷部署、弹性扩展和高效运维,从而大幅提升开发效率和系统可靠性。本文详细阐述了云原生的核心概念、主要技术和实际应用案例,并探讨了企业在实施云原生过程中的挑战与解决方案。无论是正在转型的传统企业,还是寻求创新的互联网企业,云原生都提供了一条实现高效能、高灵活性和高可靠性的技术路径。 ##
18 3
|
3天前
|
缓存 负载均衡 数据管理
深入探索微服务架构的核心要素与实践策略在当今软件开发领域,微服务架构以其独特的优势和灵活性,已成为众多企业和开发者的首选。本文将深入探讨微服务架构的核心要素,包括服务拆分、通信机制、数据管理等,并结合实际案例分析其在不同场景下的应用策略,旨在为读者提供一套全面、深入的微服务架构实践指南。**
**微服务架构作为软件开发领域的热门话题,正引领着一场技术革新。本文从微服务架构的核心要素出发,详细阐述了服务拆分的原则与方法、通信机制的选择与优化、数据管理的策略与挑战等内容。同时,结合具体案例,分析了微服务架构在不同场景下的应用策略,为读者提供了实用的指导和建议。
|
6天前
|
设计模式 消息中间件 监控
深入探索微服务架构的核心要素与实践策略
本文旨在解析微服务架构的关键概念、优势以及实施过程中的最佳实践。通过对微服务架构的基本原则、组件和技术选型的讨论,帮助读者理解如何构建高效、可扩展的微服务系统。同时,文章还将探讨在实践中可能遇到的挑战和解决方案,以期为后端开发者提供有价值的参考。
|
7天前
|
存储 负载均衡 数据库
探索后端技术:从服务器架构到数据库优化的实践之旅
在当今数字化时代,后端技术作为支撑网站和应用运行的核心,扮演着至关重要的角色。本文将带领读者深入后端技术的两大关键领域——服务器架构和数据库优化,通过实践案例揭示其背后的原理与技巧。无论是对于初学者还是经验丰富的开发者,这篇文章都将提供宝贵的见解和实用的知识,帮助读者在后端开发的道路上更进一步。
|
23天前
|
Kubernetes Cloud Native Docker
云原生之旅:从容器到微服务的架构演变
【8月更文挑战第29天】在数字化时代的浪潮下,云原生技术以其灵活性、可扩展性和弹性管理成为企业数字化转型的关键。本文将通过浅显易懂的语言和生动的比喻,带领读者了解云原生的基本概念,探索容器化技术的奥秘,并深入微服务架构的世界。我们将一起见证代码如何转化为现实中的服务,实现快速迭代和高效部署。无论你是初学者还是有经验的开发者,这篇文章都会为你打开一扇通往云原生世界的大门。
|
12天前
|
监控 负载均衡 应用服务中间件
探索微服务架构下的API网关设计与实践
在数字化浪潮中,微服务架构以其灵活性和可扩展性成为企业IT架构的宠儿。本文将深入浅出地介绍微服务架构下API网关的关键作用,探讨其设计原则与实践要点,旨在帮助读者更好地理解和应用API网关,优化微服务间的通信效率和安全性,实现服务的高可用性和伸缩性。
31 3
|
15天前
|
存储 Java Maven
从零到微服务专家:用Micronaut框架轻松构建未来架构
【9月更文挑战第5天】在现代软件开发中,微服务架构因提升应用的可伸缩性和灵活性而广受欢迎。Micronaut 是一个轻量级的 Java 框架,适合构建微服务。本文介绍如何从零开始使用 Micronaut 搭建微服务架构,包括设置开发环境、创建 Maven 项目并添加 Micronaut 依赖,编写主类启动应用,以及添加控制器处理 HTTP 请求。通过示例代码展示如何实现简单的 “Hello, World!” 功能,并介绍如何通过添加更多依赖来扩展应用功能,如数据访问、验证和安全性等。Micronaut 的强大和灵活性使你能够快速构建复杂的微服务系统。
39 5

热门文章

最新文章