深入 rdd 初始案例 | 学习笔记

简介: 快速学习 深入 rdd 初始案例

开发者学堂课程【大数据 Spark 2020版(知识精讲与实战演练)第三阶段深入 rdd 初始案例】学习笔记,与课程紧密联系,让用户快速学习知识。

课程地址:https://developer.aliyun.com/learning/course/689/detail/11957


深入 rdd 初始案例


内容介绍:

一、第一步:明确思路

二、第二步:查看编码结构

三、第三步:明确编码步骤

四、第四步:编写代码

 

一、第一步:明确思路

大数据工程师一个重要工作之一是统计网站的访问日志,对于日志进行分析,能得到很多指标,来得到运营状况。

做一个案例,有一些步骤,在进行任何的数据分析时,应该先去明确自己的需求。明确数据集的格式,然后开始进行。此案例种,第一步是明确需求,需求是在访问日志中统计独立IP数,目的是为了了解哪些 IP 的访问次数最多。本质上去 top10。接下里查看数据结构,明确编码步骤,最后一步进行编码

 

二、第二步:查看编码结构

打开数据集,第一项是 IP 地址,第二项是访问时间,第三项是访问的 http ,是 get postdelatecooperations是如何访问的,紧接着的部分是url

image.png

将上述内容汇总之后,导入脑图之中,数据结构分为 IP、时间戳、httpmethodurl 等等。

 

三、第三步:明确编码步骤

第一步是取出 IP,生成一个只有IP的数据集,第二步:对 IP 进行简单清洗,第三步是统计 IP 出现次数,第四步按照IP 出现的次数进行排序,取出前十。

 

四、第四步:编写代码。

第一步:拷贝数据集,其次是创建文件。首先打开目录,找到 spark 目录,再找到 files 的目录,其中有一个access_log_samples,拷贝下此文件复制到 ideas 中,打开 idea,进行复制。复制完成后,会看到一个新文件去编写代码,此文件取名为:accesslogagg,创建完文件后,也将方法创建出来:def ipagg

package cn.itcast.spark.rdd

import org.junit.Test

class AccessLogAgg

@Test

def ipAgg(): Unit=

)

相关文章
|
3天前
|
数据采集 人工智能 安全
|
12天前
|
云安全 监控 安全
|
4天前
|
自然语言处理 API
万相 Wan2.6 全新升级发布!人人都能当导演的时代来了
通义万相2.6全新升级,支持文生图、图生视频、文生视频,打造电影级创作体验。智能分镜、角色扮演、音画同步,让创意一键成片,大众也能轻松制作高质量短视频。
1045 151
|
4天前
|
编解码 人工智能 机器人
通义万相2.6,模型使用指南
智能分镜 | 多镜头叙事 | 支持15秒视频生成 | 高品质声音生成 | 多人稳定对话
|
17天前
|
机器学习/深度学习 人工智能 自然语言处理
Z-Image:冲击体验上限的下一代图像生成模型
通义实验室推出全新文生图模型Z-Image,以6B参数实现“快、稳、轻、准”突破。Turbo版本仅需8步亚秒级生成,支持16GB显存设备,中英双语理解与文字渲染尤为出色,真实感和美学表现媲美国际顶尖模型,被誉为“最值得关注的开源生图模型之一”。
1732 9
|
9天前
|
人工智能 自然语言处理 API
一句话生成拓扑图!AI+Draw.io 封神开源组合,工具让你的效率爆炸
一句话生成拓扑图!next-ai-draw-io 结合 AI 与 Draw.io,通过自然语言秒出架构图,支持私有部署、免费大模型接口,彻底解放生产力,绘图效率直接爆炸。
682 152
|
11天前
|
人工智能 安全 前端开发
AgentScope Java v1.0 发布,让 Java 开发者轻松构建企业级 Agentic 应用
AgentScope 重磅发布 Java 版本,拥抱企业开发主流技术栈。
646 12
|
6天前
|
SQL 自然语言处理 调度
Agent Skills 的一次工程实践
**本文采用 Agent Skills 实现整体智能体**,开发框架采用 AgentScope,模型使用 **qwen3-max**。Agent Skills 是 Anthropic 新推出的一种有别于mcp server的一种开发方式,用于为 AI **引入可共享的专业技能**。经验封装到**可发现、可复用的能力单元**中,每个技能以文件夹形式存在,包含特定任务的指导性说明(SKILL.md 文件)、脚本代码和资源等 。大模型可以根据需要动态加载这些技能,从而扩展自身的功能。目前不少国内外的一些框架也开始支持此种的开发方式,详细介绍如下。
408 4