【大数据技巧】MaxCompute优化去重计算的性能
转载自dachuan源代码是最好的文档
随着双十一数据量的暴增,之前用distinct去重可以简单处理的场景,现在消耗的时间成倍增长。如果用了multiple distinct,那就更要警惕,因为多重去重本身会带来数据量的成倍增长,很可能10分钟的任务,在双十一期间会跑上几个小时都没有结果。
这
佰腾科技的专利大数据的云上裂变之路
在票选最美云上大数据暨大数据技术峰会上,来自江苏佰腾科技有限公司的许鹏通过介绍佰腾专利大数据平台的演化、上云前后的平台结构和任务处理流程,为大家分享了专利大数据的云上裂变之路,解释了非专业人士也能进行专利信息的检索与统计,即专利信息的大众化。
天任务依赖分钟任务
本文主要是描述天任务依赖分钟任务的一个业务流程,数据同步每天5分钟跑一次,下游依赖一个天任务来计算今天所有同步任务的数据。
专家教你使用MaxCompute玩转大数据分析!
摘要传统的数据分析经常使用的工具是Hadoop或Spark在使用之前环境是需要用户自己去搭建的。随着业务逐渐向云迁移如何在云上进行大数据分析是需要解决的问题。为此阿里云提供了一项很重要的服务——大数据计算服务MaxCompute。
新老DataHub迁移手册
原Odps版内测DataHub,于2016年11月21日起已经处于维护状态,新版DataHub届时已经开启公测,公测至今已有一年时间,我们决定开始逐步下线老DataHub服务,老版部分用户需要迁移至新版DataHub。
MaxCompute大数据实践,电商数据仓库的星型模型和传统星型的区别
作者:王永伟
在Kimball所著的《数据仓库工具箱》一书中,对于维度模型设计采用的4步设计方法:1.选择业务过程 2.声明粒度 3.确定维度 4.确定事实。
在当前的互联网大数据环境下,面对复杂的业务场景,为了更有效准确地进行维度模型建设,基于Kimball的4步维度建模方法,我们进行了更进一步的改进。
语音识别pipeline建设
和其他机器学习一样,语音识别是一个science和engineer美妙结合的任务。Science推动语音识别基本技术的升级,engineer扩充语音识别的场景和语言。本节主要讨论在机器学习的engineering方面我们做了什么。