开源大数据EMR_个人页

开源大数据EMR

文章

260

问答

视频

个人介绍

暂无个人介绍

擅长的技术

Java
Python
前端开发
Linux
数据库

获得更多能力

通用技术能力：

暂时未有相关通用技术能力~

云产品技术能力：

暂时未有相关云产品技术能力~

阿里云技能认证

详细说明

高分内容

最新动态

文章
问答
视频

...

暂无更多信息

发表了文章 2020-07-17

Apache Spark 3.0 中的向量化 IO
发表了文章 2020-07-17

7月23日社区直播【TFPark: Distributed TensorFlow in Production on Apache Spark】
发表了文章 2020-07-16

大神带练， 0基础Spark训练营限时免费抢报！
发表了文章 2020-07-15

SparkSQL中产生笛卡尔积的几种典型场景以及处理策略
发表了文章 2020-07-14

再出王牌：阿里云 Jindo DistCp 全面开放使用，成为阿里云数据迁移利器
发表了文章 2020-06-16

EMR Spark-SQL性能极致优化揭秘 Native Codegen Framework
发表了文章 2020-06-16

我们欠国内Spark开发者的，用一场掷地有声的中文峰会来还
发表了文章 2020-06-12

Spark Packages寻宝（一）：简单易用的数据准备工具Optimus
发表了文章 2020-06-11

直播 | Delta Lake 如何帮助云用户解决数据实时入库问题
发表了文章 2020-06-09

6月11日 JindoFS 系列直播【JindoFS 存储策略和读写优化】
发表了文章 2020-06-09

Spark-TFRecord: Spark将全面支持TFRecord
发表了文章 2020-06-08

不通过 Spark 获取 Delta Lake Snapshot
发表了文章 2020-06-04

直播 | 阿里、快手、Databricks、网易云音乐...国内外大数据大佬齐聚一堂要聊啥？
发表了文章 2020-06-04

阿里云发起首届 Spark “数字人体” AI 挑战赛 — 聚焦上班族脊柱健康
发表了文章 2020-05-21

首届 Apache Spark AI智能诊断大赛重磅来袭！
发表了文章 2020-05-20

SparkSQL与Hive metastore Parquet转换
发表了文章 2020-05-19

5月21日 Spark 社区直播【Spark on Zeppelin】
发表了文章 2020-05-18

物化视图在 SparkSQL 中的实践
发表了文章 2020-05-14

招聘！招聘！招聘！计算平台解决方案架构师专场
发表了文章 2020-05-14

Spark + AI Summit 2020 中文议题有奖征集

正在加载, 请稍后...

滑动查看更多

回答了问题 2020-03-16

怎样进钉钉2个群

赞0 踩0 评论0
提交了问题 2019-05-05

请教一下，delta是不是可以理解为，是基于hdfs的行级别的数据库？然后对于更新数据对于hdfs产生小文件的解决方案是他会提供merge机制？
提交了问题 2019-05-05

workflow这个功能很期待，想问下他的工作流之间的依赖关系是怎么建立的，是用户自己定义么？
提交了问题 2019-05-05

spark 与 tensorflow 结合有没有方案？
回答了问题 2019-07-17

请教一下，delta是不是可以理解为，是基于hdfs的行级别的数据库？然后对于更新数据对于hdfs产生小文件的解决方案是他会提供merge机制？

是的，可以大致这样理解。是行级别的，但下面存储格式基本上还是以 Parquet/ORC 列式为主；delta 小文件要及时合并的，否则性能很差。数据库这个提法不一定好，因为并不会用于 OLTP；可以说是数据仓库，OLAP 场景为主的。关于这个区别，我的一篇文章里面讲得比较细。可以看看。https://yq.aliyun.com/articles/699919?spm=a2c4e.11153959.0.0.4f427507ntu6fX

赞0 踩0 评论0
回答了问题 2019-07-17

workflow这个功能很期待，想问下他的工作流之间的依赖关系是怎么建立的，是用户自己定义么？

这个问题很高级，你们是不是已经在玩了？不过工作流的定义过程里面，必然会形成各个工作流节点之间的依赖关系，定义工作流本身就是定义各个节点和他们之间的上下游关系，也就形成了这些依赖关系。如果你问的是多个工作流之间是不是还可以形成更高层次的依赖关系，我没有深入去看，感觉目前还比较早一点，不一定已经支持了。

赞1 踩0 评论0
回答了问题 2019-07-17

spark 与 tensorflow 结合有没有方案？

分享里面(4月28日钉钉群分享）提到的 Hydrogen 项目就是要系统支持这些深度学习框架的。Spark 3.0 会包含进去。你找到相关 SPIP，JIRA 和 PPT 挖一下。

赞0 踩0 评论0
提交了问题 2019-04-26

E-MapReduce 集群 header 节点有公网 IP，存在安全风险，是否可以通过 ECS 控制台关闭公网 IP，关闭公网 IP 是否会对 E-MapReduce 服务产生影响?
提交了问题 2019-04-26

如何登陆 Core 节点，并进行 root 权限操作
提交了问题 2019-04-26

E-Mapreduce 主节点不允许安装其它软件？
提交了问题 2019-04-26

已有/现存 ECS 是否可以用到 EMR 集群中
提交了问题 2019-04-26

自动续费
提交了问题 2019-04-26

集群续费问题
提交了问题 2019-04-26

创建集群失败，构建失败 "The specified instance Type exceeds the maximum limit for the PostPaid instances. "
提交了问题 2019-04-26

创建大数据机型（D1）的问题
提交了问题 2019-04-26

高安全集群
提交了问题 2019-04-26

E-MapReduce 按量高配节点问题
提交了问题 2019-04-26

错误提示：指定的 InstanceType 未授权使用
提交了问题 2019-04-26

错误提示：zone 或者 Cluster 的库存不够了
提交了问题 2019-04-26

错误提示：The Node Controller is temporarily unavailable

正在加载, 请稍后...

滑动查看更多

正在加载, 请稍后...

暂无更多信息

热门

活动广场

任务中心

开发者评测

高校计划

乘风者计划

训练营

阿里云MVP

话题

直播

下载

镜像站

技术资料

插件

开源大数据EMR_个人页

个人介绍

擅长的技术

Apache Spark 3.0 中的向量化 IO

7月23日社区直播【TFPark: Distributed TensorFlow in Production on Apache Spark】

大神带练， 0基础Spark训练营限时免费抢报！

SparkSQL中产生笛卡尔积的几种典型场景以及处理策略

再出王牌：阿里云 Jindo DistCp 全面开放使用，成为阿里云数据迁移利器

EMR Spark-SQL性能极致优化揭秘 Native Codegen Framework

我们欠国内Spark开发者的，用一场掷地有声的中文峰会来还

Spark Packages寻宝（一）：简单易用的数据准备工具Optimus

直播 | Delta Lake 如何帮助云用户解决数据实时入库问题

6月11日 JindoFS 系列直播【JindoFS 存储策略和读写优化】

Spark-TFRecord: Spark将全面支持TFRecord

不通过 Spark 获取 Delta Lake Snapshot

直播 | 阿里、快手、Databricks、网易云音乐...国内外大数据大佬齐聚一堂要聊啥？

阿里云发起首届 Spark “数字人体” AI 挑战赛 — 聚焦上班族脊柱健康

首届 Apache Spark AI智能诊断大赛重磅来袭！

SparkSQL与Hive metastore Parquet转换

5月21日 Spark 社区直播【Spark on Zeppelin】

物化视图在 SparkSQL 中的实践

招聘！招聘！招聘！计算平台解决方案架构师专场

Spark + AI Summit 2020 中文议题有奖征集

5月14日Apache Spark中国社区技术直播【Analytics Zoo上的分布式TensorFlow训练AI玩FIFA足球游戏】

EMR Spark-SQL性能极致优化揭秘 RuntimeFilter Plus

5月8日 JindoFS 系列直播 第五讲【JindoFS Fuse 支持】

EMR Spark-SQL性能极致优化揭秘 概览篇

Hadoop社区比 Ozone 更重要的事情

EMR Spark-SQL性能极致优化揭秘 概览篇

4月29日Spark社区直播【用Analytics-Zoo实现基于深度学习的胸腔疾病AI诊疗辅助】

阿里云EMR计算速度提升2.2倍 连续两年打破大数据领域最难竞赛世界纪录！

Delta Lake Presto Integration & Manifests 机制

Delta Lake 分区表覆盖写入操作

SparkSQL DatasourceV2 之 Multiple Catalog

4月23日JindoFS系列直播【大规模文件元数据下的耗时操作优化】

Spark在云原生时代的发展

阿里云智能事业群 EMR团队招人啦！

Delta Lake 平台化实践（离线篇)

3月26日Spark社区技术直播【Office Depot利用Analytics Zoo构建智能推荐系统的实践分享 】

通过Job Committer保证Mapreduce/Spark任务数据一致性

不可不知的Spark调优点

3月19日JindoFS系列直播【关于 JindoFS 最新的 OTS 方案】

3月19日JindoFS系列直播【关于 JindoFS 最新的 OTS 方案】

Spark 3.0 终于支持 event logs 滚动了

Delta Lake，让你从复杂的Lambda架构中解放出来

【译】Databricks使用Spark Streaming和Delta Lake对流式数据进行数据质量监控介绍

【译】Delta Lake 0.5.0介绍

Delta Lake - 数据湖的数据可靠性

核桃编程Delta Lake实时数仓应用实践

Apache iceberg：Netflix 数据仓库的基石

深入探讨HBASE

Apache Kylin 云原生架构的思考及规划

浅析Hive/Spark SQL读文件时的输入任务划分

Apache Spark 3.0 中的向量化 IO

7月23日社区直播【TFPark: Distributed TensorFlow in Production on Apache Spark】

大神带练， 0基础Spark训练营限时免费抢报！

SparkSQL中产生笛卡尔积的几种典型场景以及处理策略

再出王牌：阿里云 Jindo DistCp 全面开放使用，成为阿里云数据迁移利器

EMR Spark-SQL性能极致优化揭秘 Native Codegen Framework

我们欠国内Spark开发者的，用一场掷地有声的中文峰会来还

Spark Packages寻宝（一）：简单易用的数据准备工具Optimus

直播 | Delta Lake 如何帮助云用户解决数据实时入库问题

6月11日 JindoFS 系列直播【JindoFS 存储策略和读写优化】

Spark-TFRecord: Spark将全面支持TFRecord

不通过 Spark 获取 Delta Lake Snapshot

直播 | 阿里、快手、Databricks、网易云音乐...国内外大数据大佬齐聚一堂要聊啥？

5月8日 JindoFS 系列直播第五讲【JindoFS Fuse 支持】

EMR Spark-SQL性能极致优化揭秘概览篇

EMR Spark-SQL性能极致优化揭秘概览篇

阿里云EMR计算速度提升2.2倍连续两年打破大数据领域最难竞赛世界纪录！

3月26日Spark社区技术直播【Office Depot利用Analytics Zoo构建智能推荐系统的实践分享】