最终整体回顾(代码-离线计算)|学习笔记

简介: 快速学习最终整体回顾(代码-离线计算)

开发者学堂课程【大数据实战项目 - 反爬虫系统(Lua+Spark+Redis+Hadoop框架搭建)第七阶段最终整体回顾(代码-离线计算)】学习笔记,与课程紧密联系,让用户快速学习知识。

课程地址:https://developer.aliyun.com/learning/course/675/detail/11745


最终整体回顾(代码-离线计算)


内容简介

一、数据备份

二、数据恢复

三、离线数据支撑

四、离线计算


一、数据备份

需求

为反之 redis 中的数据丢失,所以将数据备份于 HDFS

把数据再录到 redis 的同时,收集过来数据,然后把它写到 HDFS 上面,就备份好了。


二、数据恢复

需求

数据丢失需要恢复

代码:

黑名单 Redis 数据恢复

BlackListToRedis.blackListDataToRedis(jedis,sc,sqlContext)

在这个界面,如果需要恢复,那我们就去把这个值逻辑词里面这个值改成 yes 就可以了,然后,它就自动就恢复过来了。这个是恢复的代码。


三、离线数据支撑

从 Kafka 当中读取过来预处理后的数据,拿过来直接写到HDFS里面,这个就是写入到 HDFS 的过程。

然后再拿了一个预处理后的数据写到 HDFS,写完以后,我们又做了一个监控,而这个监控指的是爬虫识别的监控,而这个爬虫识别的监控与数据预处理的监控,他们的这个逻辑思想和和这个代码基本上是一致的,只有很小一部分不一样。


四、离线计算

因为一开始的数据用不了,所以要先进行处理

处理完以后,我们去进行离线分析,先把数据分为两批数据,一个是爬虫这个数据预处理后的结果,还有一个是计算出来的爬虫数据,这两个爬虫数据让他们俩去进行碰撞碰撞,然后筛选出一些纯爬虫数据

然后再往后过滤字段啊,可能有二十几个字的,就用6个就够了,写了两个自定义函数定义函数。

根据把前面写的这两个字对应函数用起来,拿到以后利用这6个字段去进行离线报表的计算,这里面国内查询的国际查询的转化率,这几个转化率我们带着一个一个走了一遍,包括这里面先过滤出,哪一个操作第1步先过滤从哪个操作第2步用谁除以谁,这边写的清清楚楚。

注意:

1代表国际数据,0代表国内数据。

这两个点的变化。第2个国际查询和国内查询是一样的,一样的操作就换一下,上面是国内,这个是国际,换一下这个值就可以。

国内航班选择、国际航班选择爬虫转化率、正常用户转化率全部用合理的后面的代码,离线计算就统计完了。

相关文章
|
3天前
|
数据采集 人工智能 安全
|
13天前
|
云安全 监控 安全
|
4天前
|
自然语言处理 API
万相 Wan2.6 全新升级发布!人人都能当导演的时代来了
通义万相2.6全新升级,支持文生图、图生视频、文生视频,打造电影级创作体验。智能分镜、角色扮演、音画同步,让创意一键成片,大众也能轻松制作高质量短视频。
1090 152
|
18天前
|
机器学习/深度学习 人工智能 自然语言处理
Z-Image:冲击体验上限的下一代图像生成模型
通义实验室推出全新文生图模型Z-Image,以6B参数实现“快、稳、轻、准”突破。Turbo版本仅需8步亚秒级生成,支持16GB显存设备,中英双语理解与文字渲染尤为出色,真实感和美学表现媲美国际顶尖模型,被誉为“最值得关注的开源生图模型之一”。
1756 9
|
10天前
|
人工智能 自然语言处理 API
一句话生成拓扑图!AI+Draw.io 封神开源组合,工具让你的效率爆炸
一句话生成拓扑图!next-ai-draw-io 结合 AI 与 Draw.io,通过自然语言秒出架构图,支持私有部署、免费大模型接口,彻底解放生产力,绘图效率直接爆炸。
697 152
|
12天前
|
人工智能 安全 前端开发
AgentScope Java v1.0 发布,让 Java 开发者轻松构建企业级 Agentic 应用
AgentScope 重磅发布 Java 版本,拥抱企业开发主流技术栈。
661 13
|
6天前
|
SQL 自然语言处理 调度
Agent Skills 的一次工程实践
**本文采用 Agent Skills 实现整体智能体**,开发框架采用 AgentScope,模型使用 **qwen3-max**。Agent Skills 是 Anthropic 新推出的一种有别于mcp server的一种开发方式,用于为 AI **引入可共享的专业技能**。经验封装到**可发现、可复用的能力单元**中,每个技能以文件夹形式存在,包含特定任务的指导性说明(SKILL.md 文件)、脚本代码和资源等 。大模型可以根据需要动态加载这些技能,从而扩展自身的功能。目前不少国内外的一些框架也开始支持此种的开发方式,详细介绍如下。
448 5