【云计算与大数据计算】大数据物理、集成、安全架构及阿里云飞天系统架构讲解(超详细)

本文涉及的产品
对象存储 OSS,20GB 3个月
对象存储 OSS,内容安全 1000次 1年
云原生大数据计算服务MaxCompute,500CU*H 100GB 3个月
简介: 【云计算与大数据计算】大数据物理、集成、安全架构及阿里云飞天系统架构讲解(超详细)

一、物理架构

物理架构 - 企业大数据系统的各层次系统最终要部署到主机节点中,这些节点通过网络连接成 为一个整体,为企业的大数据应用提供物理支撑 ,企业大数据系统由多个逻辑层组成,多个逻辑层可以映射到一个物理节点上,也可以映射到多个物理节点上

在映射时需要考虑三个方面的问题:一是是否容易识别,二是是否足够集约,三是是否能够同构

二、集成架构

集成架构 - 企业大数据系统由多个系统集成而成,每个系统都提供了多种协议和接口, 以便企业大数据系统的内部系统间集成和外部系统与大数据系统的集成

企业大数据系统的集成可以分为总体集成和专项集成,总体集成是指各组成系统间的集成,通过总体集成可以构成高校,可靠,安全运行的企业大数据系统,若企业大数据系统之外的某个应用系统或大数据系统之内的某个应用系统只想与存储系统,调度系统等进行集成,那么可通过调用这些系统开放的接口来实现,这种集成方式就是专项集成

三、安全架构

安全架构 - 由于企业大数据系统的数据资源和计算资源广泛地分布在多个节点上,所以用户的 身份、权限等安全,数据资源的存储、传输、访问等安全,以及计算资源的访问、监控、调整、恢复等安全,都是企业大数据系统在进行安全架构设计时需要考虑的问题

一般来讲,企业大数据的安全架构由针对三层的安全设计构成,这三层分别是用户层,应用层和数据层,针对每一层的关键行为加入安全因素的设计,以确保系统的整体安全

四、阿里云飞天系统体系架构

飞天(Apsara)是由阿里云自主研发、服务全球的超大规模通用计 算操作系统  

它可以将遍布全球的百万级服务器连成一台超级计算机、以在线公共服务的方式为社会提供计算能力  

7年过去,飞天已经为全球200多个国家和地区的创新创业企业、政府、机构等提供服务

阿里云飞天整体架构 - 飞天平台的体系架构如图所示,整个飞天平台包括飞天内核和飞天开发服务两大部分

飞天管理着互联网规模的基础设施。其最底层是遍布全球的几十个数据中心和数百个PoP节点

飞天内核跑在每个数据中心里面,它负责统一管理数据中心内的通用服务器集 群,调度集群的计算、存储资源,支撑分布式应用的部署和执行

安全管理根植在飞天内核最底层。飞天内核提供的授权机制能够有效实现“最小权限原则 (principle of least privilege)”,同时还建立了自主可控的全栈安全体系

监控报警诊断是飞天内核最基本的能力之一。飞天内核对上层应用提供了非常详细的、无间断的监控数据和系统事件采集

在基础公共模块之上有两个最核心的服务,一个叫盘古,一个叫伏羲

天基是飞天的自动化运维服务,负责飞天各个子系统的部署、升级、扩容以及故障迁移

阿里云飞天平台内核可以分成以下几个部分

分布式系统底层服务 - 其提供分布式环境下所需要的分布式协调服务、远程过程调用服务、安全管理、分布式资源调度等功能

盘古分布式文件系统 - 盘古(Pangu)是一个分布式文件系统, 盘古系统 的设计目标是将大量通用机器的存储资源聚合在一起,为用户提供大规模、高可靠、高可用、高吞吐量和可扩展的存储服务

伏羲任务调度系统 - 该系统为集群中的任务提供调度服务,同时支持强调响应速度的在线 服务(Online Service)和强调处理数据吞吐量的离线任务(Batch Processing Job)

集群监控和部署 - 神农(Shennong )是飞天平台内核中负责信息收集 、监控和诊断的模块,大禹 (Dayu)是飞天内核中负责提供配置管理和部署的模块

飞天开放服务

包括弹性计算 (ECS)、阿里云对象存储(OSS)、表格存储服 务(Table Store)、关系型数据库服务(RDS)、流式计算服务 (Stream Compute)和大数据计算服务(MaxCompute)等

弹性计算 (ECS) - 云服务器ECS(Elastic Compute Service)是一种云计算服务 , 它的管理方式比物理服务器更加简单、高效

阿里云对象存储(OSS) - 阿里云对象存储 (Object Storage Service, OSS)是阿里云对外提供的海量、安全、低成本、高可靠的云存储服务

表格存储 (Table Store) -  它是构建在阿里云飞天分布式系统之上的NoSQL数据存储服务,提供海量结构化数据的存储和实时访问

大数据计算服务(MaxCompute) - 大数据计算服务(MaxCompute,原名 ODPS)是一种快速、完全托管的TB/PB级数据仓库解决方案

阿里云飞天 OpenStack 和 Hadoop 的不同

OpenStack和 Hadoop是软件,它们并没有解决客户的CAPEX 投入问题、运维人员投入问题,需要部署到自有的硬件上,一般只用于单个企业的内部环境

飞天上面提供了基于 Hadoop、EMR、Mongo等开源软件的托管服务,这是飞天开放 能力的体现

阿里云飞天与 VMware 、华为 FusionSphere 的不同

虚拟化不等于云计算,云的实时在线、海量弹性、多租户隔离、专业运维都是传统虚拟化软件所欠缺的

VMware的三大件主要解决了计算的效率问题,但是没有解决计算的规模问题

华为的 FusionSphere 其实是基于开源软件进行定制并适配华为硬件的软件系统,飞天内核在规模、性能、稳定性和通用性上都超越了 FusionSphere

五、主流大数据厂商

Cloudera

Cloudera是一家专业从事基于Apache Hadoop的数据管理软 件销售和服务的公司 , 它发布的实时查询开源项目Impala比基于 MapReduce的HiveSQL的查询速度提升了3~90 倍

Hortonworks

Hortonworks的开放式互联平台帮助企业管理所拥有的数据(动态数据以及静态 数据),为用户组织启用可操作情报。

Amazon

Amazon 的 AWS 本身就是最完整的大数据平台, Amazon Web Services 提供了一系列广泛的服务,可以快速 、轻松地构建和部署大数据分析应用程序

Google

Google提出的 MapReduce计算框架在很多大数据领域得到了非常广泛的应用

微软

微软推出的商业数据分析系统 Microsoft Analytics Platform System 能够通过其扩充的大规模平行处理整合式系统支持混合格式的数据仓库,借此适应数据仓库环境不断发展的需求

阿里云数加平台

数加是阿里云为企业大数据的实施提供的一套完整的一站式大数据解决方案,

数加平台由大数据计算服务(MaxCompute)、分析型数据库(Analytic DB)、流计算 (StreamCompute)共同组成了底层强大的计算引擎, 速度更快, 成本更低  

创作不易 觉得有帮助请点赞关注收藏~~~

相关实践学习
基于MaxCompute的热门话题分析
本实验围绕社交用户发布的文章做了详尽的分析,通过分析能得到用户群体年龄分布,性别分布,地理位置分布,以及热门话题的热度。
SaaS 模式云数据仓库必修课
本课程由阿里云开发者社区和阿里云大数据团队共同出品,是SaaS模式云原生数据仓库领导者MaxCompute核心课程。本课程由阿里云资深产品和技术专家们从概念到方法,从场景到实践,体系化的将阿里巴巴飞天大数据平台10多年的经过验证的方法与实践深入浅出的讲给开发者们。帮助大数据开发者快速了解并掌握SaaS模式的云原生的数据仓库,助力开发者学习了解先进的技术栈,并能在实际业务中敏捷的进行大数据分析,赋能企业业务。 通过本课程可以了解SaaS模式云原生数据仓库领导者MaxCompute核心功能及典型适用场景,可应用MaxCompute实现数仓搭建,快速进行大数据分析。适合大数据工程师、大数据分析师 大量数据需要处理、存储和管理,需要搭建数据仓库?学它! 没有足够人员和经验来运维大数据平台,不想自建IDC买机器,需要免运维的大数据平台?会SQL就等于会大数据?学它! 想知道大数据用得对不对,想用更少的钱得到持续演进的数仓能力?获得极致弹性的计算资源和更好的性能,以及持续保护数据安全的生产环境?学它! 想要获得灵活的分析能力,快速洞察数据规律特征?想要兼得数据湖的灵活性与数据仓库的成长性?学它! 出品人:阿里云大数据产品及研发团队专家 产品 MaxCompute 官网 https://www.aliyun.com/product/odps 
相关文章
|
7天前
|
分布式计算 大数据 Apache
ClickHouse与大数据生态集成:Spark & Flink 实战
【10月更文挑战第26天】在当今这个数据爆炸的时代,能够高效地处理和分析海量数据成为了企业和组织提升竞争力的关键。作为一款高性能的列式数据库系统,ClickHouse 在大数据分析领域展现出了卓越的能力。然而,为了充分利用ClickHouse的优势,将其与现有的大数据处理框架(如Apache Spark和Apache Flink)进行集成变得尤为重要。本文将从我个人的角度出发,探讨如何通过这些技术的结合,实现对大规模数据的实时处理和分析。
32 2
ClickHouse与大数据生态集成:Spark & Flink 实战
|
20天前
|
缓存 Devops jenkins
专家视角:构建可维护的测试架构与持续集成
【10月更文挑战第14天】在现代软件开发过程中,构建一个可维护且易于扩展的测试架构对于确保产品质量至关重要。本文将探讨如何设计这样的测试架构,并将单元测试无缝地融入持续集成(CI)流程之中。我们将讨论最佳实践、自动化测试部署、性能优化技巧以及如何管理和扩展日益增长的测试套件规模。
40 3
|
6天前
|
人工智能 Cloud Native 数据管理
媒体声音|重磅升级,阿里云发布首个“Data+AI”驱动的一站式多模数据平台
在2024云栖大会上,阿里云瑶池数据库发布了首个一站式多模数据管理平台DMS:OneMeta+OneOps。该平台由Data+AI驱动,兼容40余种数据源,实现跨云数据库、数据仓库、数据湖的统一数据治理,帮助用户高效提取和分析元数据,提升业务决策效率10倍。DMS已服务超10万企业客户,降低数据管理成本高达90%。
|
7天前
|
分布式计算 Java 开发工具
阿里云MaxCompute-XGBoost on Spark 极限梯度提升算法的分布式训练与模型持久化oss的实现与代码浅析
本文介绍了XGBoost在MaxCompute+OSS架构下模型持久化遇到的问题及其解决方案。首先简要介绍了XGBoost的特点和应用场景,随后详细描述了客户在将XGBoost on Spark任务从HDFS迁移到OSS时遇到的异常情况。通过分析异常堆栈和源代码,发现使用的`nativeBooster.saveModel`方法不支持OSS路径,而使用`write.overwrite().save`方法则能成功保存模型。最后提供了完整的Scala代码示例、Maven配置和提交命令,帮助用户顺利迁移模型存储路径。
|
8天前
|
分布式计算 大数据 OLAP
AnalyticDB与大数据生态集成:Spark & Flink
【10月更文挑战第25天】在大数据时代,实时数据处理和分析变得越来越重要。AnalyticDB(ADB)是阿里云推出的一款完全托管的实时数据仓库服务,支持PB级数据的实时分析。为了充分发挥AnalyticDB的潜力,将其与大数据处理工具如Apache Spark和Apache Flink集成是非常必要的。本文将从我个人的角度出发,分享如何将AnalyticDB与Spark和Flink集成,构建端到端的大数据处理流水线,实现数据的实时分析和处理。
37 1
|
30天前
|
消息中间件 存储 缓存
大数据-71 Kafka 高级特性 物理存储 磁盘存储特性 如零拷贝、页缓存、mmp、sendfile
大数据-71 Kafka 高级特性 物理存储 磁盘存储特性 如零拷贝、页缓存、mmp、sendfile
42 3
|
30天前
|
存储 消息中间件 大数据
大数据-70 Kafka 高级特性 物理存储 日志存储 日志清理: 日志删除与日志压缩
大数据-70 Kafka 高级特性 物理存储 日志存储 日志清理: 日志删除与日志压缩
35 1
|
2月前
|
人工智能 分布式计算 DataWorks
连续四年!阿里云领跑中国公有云大数据平台
近日,国际数据公司(IDC)发布《中国大数据平台市场份额,2023:数智融合时代的真正到来》报告——2023年中国大数据平台公有云服务市场规模达72.2亿元人民币,其中阿里巴巴市场份额保持领先,占比达40.2%,连续四年排名第一。
186 12
|
2月前
|
SQL 人工智能 大数据
阿里云牵头起草!首个大数据批流融合国家标准发布
近日,国家市场监督管理总局、国家标准化管理委员会正式发布大数据领域首个批流融合国家标准GB/T 44216-2024《信息技术 大数据 批流融合计算技术要求》,该标准由阿里云牵头起草,并将于2025年2月1日起正式实施。
80 7
|
2月前
|
监控 Android开发 iOS开发
深入探索安卓与iOS的系统架构差异:理解两大移动平台的技术根基在移动技术日新月异的今天,安卓和iOS作为市场上最为流行的两个操作系统,各自拥有独特的技术特性和庞大的用户基础。本文将深入探讨这两个平台的系统架构差异,揭示它们如何支撑起各自的生态系统,并影响着全球数亿用户的使用体验。
本文通过对比分析安卓和iOS的系统架构,揭示了这两个平台在设计理念、安全性、用户体验和技术生态上的根本区别。不同于常规的技术综述,本文以深入浅出的方式,带领读者理解这些差异是如何影响应用开发、用户选择和市场趋势的。通过梳理历史脉络和未来展望,本文旨在为开发者、用户以及行业分析师提供有价值的见解,帮助大家更好地把握移动技术发展的脉络。
76 6