备案控制台

开发者社区数据库文章正文

Hadoop MapReduce概念学习系列之mr程序组件全貌（二十）

2017-11-15 1108

版权

版权声明：

本文内容由阿里云实名注册用户自发贡献，版权归原作者所有，阿里云开发者社区不拥有其著作权，亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容，填写侵权投诉表单进行举报，一经查实，本社区将立刻删除涉嫌侵权内容。

简介：

其实啊,spilt是，控制Apache Hadoop Mapreduce的map并发任务数，详细见http://www.cnblogs.com/zlslch/p/5713652.html

map，是mapper代码

reduce，是reducer代码

缓存，分组，排序，转发，

最重要的是，mr程序的组件InputFormat和OutputFormat啊！（重要的话，说三遍）

最重要的是，mr程序的组件InputFormat和OutputFormat啊！

最重要的是，mr程序的组件InputFormat和OutputFormat啊！

我们知道，在大数据里，数据源是非常之广，比如，hdfs(默认，而且还是TextInputFormat)，数据库，文件，ftp，网页，网络端口.....

那么，对于用户来说，不需要具体去管，特推出mr程序的组件-------InputFormat

　　往数据库、HBase、ftp、hdfs（默认是往hdfs写，而且还是TextOutputFormat），文件，，，用户不用管，特推出mr程序的组件------OutputFormat

But，在生产环境，可是最重要的是具体业务...

注意：

　　比如，对于图片，视频，，，这些，InputFormat，就不能了。

　　可以看到，DBInputFormat是去数据库里读，

可以看到，DBOutputFormat是往数据库里写。

　　其它更深以后会补上。。。。。

本文转自大数据躺过的坑博客园博客，原文链接：http://www.cnblogs.com/zlslch/p/5713872.html，如需转载请自行联系原作者

文章标签：

数据库

大数据

分布式计算

Hadoop

Hbase

Apache

缓存

分布式数据库

关键词：

hadoop mapreduce

hadoop组件

hadoop概念

hadoop学习

mapreduce hadoop

技术小哥哥

目录

相关文章

武子康

|

分布式计算资源调度 Hadoop

大数据-80 Spark 简要概述系统架构部署模式与Hadoop MapReduce对比

大数据-80 Spark 简要概述系统架构部署模式与Hadoop MapReduce对比

武子康

297 2 2

小白学大数据

|

数据采集分布式计算 Hadoop

使用Hadoop MapReduce进行大规模数据爬取

使用Hadoop MapReduce进行大规模数据爬取

小白学大数据

210 1 1

zzy的aly

|

分布式计算 Hadoop 大数据

大数据体系知识学习（一）：PySpark和Hadoop环境的搭建与测试

这篇文章是关于大数据体系知识学习的，主要介绍了Apache Spark的基本概念、特点、组件，以及如何安装配置Java、PySpark和Hadoop环境。文章还提供了详细的安装步骤和测试代码，帮助读者搭建和测试大数据环境。

zzy的aly

466 1 1

武子康

|

分布式计算 Hadoop Unix

Hadoop-28 ZooKeeper集群 ZNode简介概念和测试数据结构与监听机制持久性节点持久顺序节点事务ID Watcher机制

Hadoop-28 ZooKeeper集群 ZNode简介概念和测试数据结构与监听机制持久性节点持久顺序节点事务ID Watcher机制

武子康

245 1 1

武子康

|

存储 SQL 消息中间件

Hadoop-26 ZooKeeper集群 3台云服务器基础概念简介与环境的配置使用架构组成分布式协调框架 Leader Follower Observer

Hadoop-26 ZooKeeper集群 3台云服务器基础概念简介与环境的配置使用架构组成分布式协调框架 Leader Follower Observer

武子康

210 0 0

武子康

|

SQL 分布式计算关系型数据库

Hadoop-24 Sqoop迁移 MySQL到Hive 与 Hive到MySQL SQL生成数据 HDFS集群 Sqoop import jdbc ETL MapReduce

Hadoop-24 Sqoop迁移 MySQL到Hive 与 Hive到MySQL SQL生成数据 HDFS集群 Sqoop import jdbc ETL MapReduce

武子康

338 0 0

武子康

|

SQL 分布式计算关系型数据库

Hadoop-23 Sqoop 数据MySQL到HDFS(部分) SQL生成数据 HDFS集群 Sqoop import jdbc ETL MapReduce

Hadoop-23 Sqoop 数据MySQL到HDFS(部分) SQL生成数据 HDFS集群 Sqoop import jdbc ETL MapReduce

武子康

214 0 0

Echo_Wish

|

9月前

|

存储分布式计算 Hadoop

从“笨重大象”到“敏捷火花”：Hadoop与Spark的大数据技术进化之路

从“笨重大象”到“敏捷火花”：Hadoop与Spark的大数据技术进化之路

Echo_Wish

452 79 80

武子康

|

分布式计算 Kubernetes Hadoop

大数据-82 Spark 集群模式启动、集群架构、集群管理器 Spark的HelloWorld + Hadoop + HDFS

大数据-82 Spark 集群模式启动、集群架构、集群管理器 Spark的HelloWorld + Hadoop + HDFS

武子康

519 6 6

栈江湖

|

12月前

|

存储分布式计算大数据

Flume+Hadoop：打造你的大数据处理流水线

本文介绍了如何使用Apache Flume采集日志数据并上传至Hadoop分布式文件系统（HDFS）。Flume是一个高可用、可靠的分布式系统，适用于大规模日志数据的采集和传输。文章详细描述了Flume的安装、配置及启动过程，并通过具体示例展示了如何将本地日志数据实时传输到HDFS中。同时，还提供了验证步骤，确保数据成功上传。最后，补充说明了使用文件模式作为channel以避免数据丢失的方法。

栈江湖

624 4 4

热门文章

最新文章

Hadoop配置LDAP集成Kerberos

自建Hadoop迁移MaxCompute

一面数据： Hadoop 迁移云上架构设计与实践

干翻Hadoop系列文章【02】：Hadoop、Hive、Spark的区别和联系

Hadoop使用lzo压缩格式

完全分布模式hadoop集群安装配置之一安装第一个节点

hadoop组件介绍（转载）

【大数据技术Hadoop+Spark】Flume、Kafka的简介及安装（图文解释超详细）

hadoop学习笔记--集群搭建

Hadoop概念学习系列之分布式数据集的容错性（二十七）

Hadoop MapReduce 调优参数

MapReduce分布式编程

Hadoop MapReduce计算框架

大数据实战——基于Hadoop的Mapreduce编程实践案例的设计与实现

java与大数据：Hadoop与MapReduce

DataWorks产品使用合集之在DataWorks中，在MapReduce作业中指定两个表的所有分区如何解决

【Hive】所有的Hive任务都会有MapReduce的执行吗？

Hadoop【基础知识 01+02】【分布式文件系统HDFS设计原理+特点+存储原理】（部分图片来源于网络）【分布式计算框架MapReduce核心概念+编程模型+combiner&partitioner+词频统计案例解析与进阶+作业的生命周期】（图片来源于网络）

Hadoop【基础知识 02】【分布式计算框架MapReduce核心概念+编程模型+combiner&partitioner+词频统计案例解析与进阶+作业的生命周期】（图片来源于网络）

请描述一下MapReduce的工作流程。

相关课程

更多

大数据实战项目：反爬虫系统（Lua+Spark+Redis+Hadoop框架搭建）第一阶段

大数据实战项目：反爬虫系统（Lua+Spark+Redis+Hadoop框架搭建）第五阶段

大数据实战项目 - 反爬虫系统（Lua+Spark+Redis+Hadoop框架搭建）第七阶段

大数据Hadoop快速入门

Hadoop快速入门

Hadoop企业优化及扩展案例

相关电子书

更多

《构建Hadoop生态批流一体的实时数仓》

零基础实现hadoop 迁移 MaxCompute 之数据

CIO 指南:如何在SAP软件架构中使用Hadoop

相关实验场景

更多

搭建Hadoop环境

下一篇

「直播预告」Streaming Lakehouse Meetup EP.2｜Paimon × StarRocks 共话实时湖仓