文档备案控制台

开发者社区大数据文章正文

[Spark][Python]Spark Join 小例子

2017-12-11 1158

版权

版权声明：

本文内容由阿里云实名注册用户自发贡献，版权归原作者所有，阿里云开发者社区不拥有其著作权，亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容，填写侵权投诉表单进行举报，一经查实，本社区将立刻删除涉嫌侵权内容。

简介：

[training@localhost ~]$ hdfs dfs -cat people.json

{"name":"Alice","pcode":"94304"}
{"name":"Brayden","age":30,"pcode":"94304"}
{"name":"Carla","age":19,"pcoe":"10036"}
{"name":"Diana","age":46}
{"name":"Etienne","pcode":"94104"}
[training@localhost ~]$

hdfs dfs -cat pcodes.json

{"pcode":"10036","city":"New York","state":"NY"}
{"pcode:"87501","city":"Santa Fe","state":"NM"}
{"pcode":"94304","city":"Palo Alto","state":"CA"}
{"pcode":"94104","city":"San Francisco","state":"CA"}

sqlContext = HiveContext(sc)
peopleDF = sqlContext.read.json("people.json")

sqlContext = HiveContext(sc)
pcodesDF = sqlContext.read.json("pcodes.json")

mydf001=peopleDF.join(pcodesDF,"pcode")

mydf001.limit(5).show()

+-----+----+-------+----+---------------+-------------+-----+
|pcode| age| name|pcoe|_corrupt_record| city|state|
+-----+----+-------+----+---------------+-------------+-----+
|94304|null| Alice|null| null| Palo Alto| CA|
|94304| 30|Brayden|null| null| Palo Alto| CA|
|94104|null|Etienne|null| null|San Francisco| CA|
+-----+----+-------+----+---------------+-------------+-----+

本文转自健哥的数据花园博客园博客，原文链接：http://www.cnblogs.com/gaojian/p/7630003.html，如需转载请自行联系原作者

文章标签：

Python

分布式计算

Spark

关键词：

Python join

apache spark Python

Python spark

python apache spark

apache spark join

嗯哼9925

目录

相关文章

土木林森

|

分布式计算 Hadoop 大数据

大数据技术与Python：结合Spark和Hadoop进行分布式计算

【4月更文挑战第12天】本文介绍了大数据技术及其4V特性，阐述了Hadoop和Spark在大数据处理中的作用。Hadoop提供分布式文件系统和MapReduce，Spark则为内存计算提供快速处理能力。通过Python结合Spark和Hadoop，可在分布式环境中进行数据处理和分析。文章详细讲解了如何配置Python环境、安装Spark和Hadoop，以及使用Python编写和提交代码到集群进行计算。掌握这些技能有助于应对大数据挑战。

土木林森

1282 1 2

站大爷

|

7月前

|

数据库连接 API 数据安全/隐私保护

Python字符串处理：超越split与join的五大高效技巧

本文介绍Python字符串处理的五大高效技巧：strip家族精准去字符、partition分割结构化数据、count统计子串、高级比较方法及正则应用，结合真实案例与性能对比，提升开发效率。

站大爷

306 0 0

攒了一袋星辰

|

监控 Python

python对于守护进程join , 以及daemon 的使用条件

python对于守护进程join , 以及daemon 的使用条件

攒了一袋星辰

315 1 1

wishCoding

|

机器学习/深度学习分布式计算数据处理

在Python中应用Spark框架

在Python中应用Spark框架

wishCoding

383 1 1

拓端数据部落

|

SQL 分布式计算数据可视化

数据分享|Python、Spark SQL、MapReduce决策树、回归对车祸发生率影响因素可视化分析

数据分享|Python、Spark SQL、MapReduce决策树、回归对车祸发生率影响因素可视化分析

拓端数据部落

275 4 4

叫做饺子

|

分布式计算 Apache Spark

Python与Apache Spark：实时AI的大数据引擎——Spark Streaming实战

7月更文挑战第9天

叫做饺子

657 0 0

肥猪lele01

|

分布式计算 Shell 调度

看看airflow怎样调度python写的spark任务吧

看看airflow怎样调度python写的spark任务吧

肥猪lele01

547 0 0

拓端数据部落

|

新零售分布式计算数据可视化

数据分享|基于Python、Hadoop零售交易数据的Spark数据处理与Echarts可视化分析

数据分享|基于Python、Hadoop零售交易数据的Spark数据处理与Echarts可视化分析

拓端数据部落

1388 0 0

华章计算机

|

Python

《Python数据科学实践指南》——0.4　一个简单的例子

华章计算机

1488 0 0

华章计算机

|

JavaScript Python

《Python数据科学实践指南》一0.4　一个简单的例子

下面是一段用Python编写的有趣的代码，这里所用的模块并不会在本书中进行讲解，仅仅是向购买本书的你表示我的感激。

华章计算机

1227 0 0

热门文章

最新文章

Spark SQL性能优化

Spark SQL玩起来

阿里巴巴瑾谦/沐远：云HBaseSQL及分析——Phoenix&Spark

【译】使用Spark SQL 运行大规模基因组工作流

【大数据】计算引擎：Spark核心概念

EMR Serverless Spark：一站式全托管湖仓分析利器

Spark编程实验一：Spark和Hadoop的安装使用

5月14日Apache Spark中国社区技术直播【Analytics Zoo上的分布式TensorFlow训练AI玩FIFA足球游戏】

原创 | 以Spark性能调优为例，说说如何书写简历项目的技术难点

Spark Streaming中的操作函数分析

基于python大数据的台风灾害分析及预测系统

基于Python大数据的热门游戏推荐系统

基于python大数据的青少年网络使用情况分析及预测系统

2026版基于python大数据的电影分析可视化系统

基于Python大数据的的电商用户行为分析系统

基于python大数据技术的医疗数据分析与研究

基于python大数据深度学习的酒店评论文本情感分析系统

Python SQLAlchemy模块：从入门到实战的数据库操作指南

基于python大数据的的海洋气象数据可视化平台

基于Python大数据的主流汽车价格分析可视化系统

相关课程

更多

大数据实战项目：反爬虫系统（Lua+Spark+Redis+Hadoop框架搭建）第二阶段

大数据实战项目：反爬虫系统（Lua+Spark+Redis+Hadoop框架搭建）第三阶段

大数据实战项目：反爬虫系统（Lua+Spark+Redis+Hadoop框架搭建）第四阶段

大数据实战项目 - 反爬虫系统（Lua+Spark+Redis+Hadoop框架搭建）第六阶段

大数据实战项目 - 反爬虫系统（Lua+Spark+Redis+Hadoop框架搭建）第七阶段

大数据实时计算框架Spark快速入门

相关电子书

更多

Hybrid Cloud and Apache Spark

Scalable Deep Learning on Spark

Comparison of Spark SQL with Hive

推荐镜像

更多

python-release

下一篇

阿里云正式发布 Agentic 代码安全：AI驱动的双Agent协同引擎