网站流量日志埋点收集--系统部署架构图和采集流程梳理|学习笔记

简介: 快速学习网站流量日志埋点收集--系统部署架构图和采集流程梳理

开发者学堂课程【大数据分析之企业级网站流量运营分析系统开发实战(第一阶段)网站流量日志埋点收集--系统部署架构图和采集流程梳理】学习笔记,与课程紧密联系,让用户快速学习知识。

课程地址https://developer.aliyun.com/learning/course/693/detail/12179


网站流量日志埋点收集--系统部署架构图和采集流程梳理


本节内容我们学习埋点采集用户行为数据怎么系统搭建和部署。

系统环境部署

在正式安装之前,我们先画部署图从理论层面梳理系统到底怎样埋点收集用户行为数据。

部署图:

一台服务器 www.itcast.cn/indox.html 模仿首页即正常浏览网站的页面,用户通过浏览器肯定要访问这个页面,所以接下来学习用户打开页面会经过哪些流程。

第一步用户要想访问页面首先要通过浏览器输入地址,发送 request 请求,请求打开页面时页面预先埋入了一段埋点代码,所以打开页面后埋点代码开始执行。

所以第二步是用户打开页面,埋点代码匿名函数自调用执行,自己调用自己并且只调用一次,匿名函数自调用需要将真正收集数据的 js 引入页面。

第三步是把真正收集数据的 js 引入页面。(collect.js)

第四步是收集数据的 js 通过我们内置的对象采集我们页面的相关属性信息数据。

第五步是把收集的数据拼接成图片形式发送 ( <img arc=“collect.itcast.cn/log.gif?item=1111&name=allen”> )

另一台服务器 collect.itcast.cn,专门用于接受请求,它是一台特殊的服务器,特殊在它是 nginx(基于lua)。当中会有两个 location 模块,一个是 location/log.gif,另一个是 location/i-log。

所以第六步为以请求图片的形式把采集的数据发送到指定的收集数据服务器上,通过 location 匹配进行处理。第一个 location 功能是生成cookie和生成图片 log.gif。

第七步需要进行 subrequest,第二个 location 是内部模块,它做的事是解析参数和保存数据到日志文件中。

第八步是 response(图片,cookie)。

image.png

以上就完成了整个页面的交互,也是架构。

从用户的角度他们能感受到的只要打开页面,显示页面,实质上在打开页面的同时埋点代码开始执行,在后台进行一系列的操作。拉取我们的js,进行数据收集,发送参数数据,保存等,这是后端所做的事情。

自带服务器

这样就贴近于实战,也比较符合类似于京东,天猫等进行数据采集的系统。这就是埋点数据收集的架构图,结合之前剖析的原理认真理解某些模块,哪些知识点在执行什么职责。

相关实践学习
【涂鸦即艺术】基于云应用开发平台CAP部署AI实时生图绘板
【涂鸦即艺术】基于云应用开发平台CAP部署AI实时生图绘板
相关文章
WGLOG日志管理系统是怎么收集日志的
WGLOG通过部署Agent客户端采集日志,Agent持续收集指定日志文件并上报Server,Server负责展示与分析。Agent与Server需保持相同版本。官网下载地址:www.wgstart.com
|
3月前
|
Prometheus 监控 Cloud Native
基于docker搭建监控系统&日志收集
Prometheus 是一款由 SoundCloud 开发的开源监控报警系统及时序数据库(TSDB),支持多维数据模型和灵活查询语言,适用于大规模集群监控。它通过 HTTP 拉取数据,支持服务发现、多种图表展示(如 Grafana),并可结合 Loki 实现日志聚合。本文介绍其架构、部署及与 Docker 集成的监控方案。
405 122
基于docker搭建监控系统&日志收集
|
4月前
|
消息中间件 Java Kafka
Java 事件驱动架构设计实战与 Kafka 生态系统组件实操全流程指南
本指南详解Java事件驱动架构与Kafka生态实操,涵盖环境搭建、事件模型定义、生产者与消费者实现、事件测试及高级特性,助你快速构建高可扩展分布式系统。
272 7
|
5月前
|
人工智能 Kubernetes 数据可视化
Kubernetes下的分布式采集系统设计与实战:趋势监测失效引发的架构进化
本文回顾了一次关键词监测任务在容器集群中失效的全过程,分析了中转IP复用、调度节奏和异常处理等隐性风险,并提出通过解耦架构、动态IP分发和行为模拟优化采集策略,最终实现稳定高效的数据抓取与分析。
Kubernetes下的分布式采集系统设计与实战:趋势监测失效引发的架构进化
|
6月前
|
监控 API 开发工具
HarmonyOS Next的HiLog日志系统完全指南:从入门到精通
本文深入解析HarmonyOS Next的HiLog日志系统,涵盖日志级别、核心API、隐私保护与高级回调功能,助你从入门到精通掌握这一重要开发工具。
404 1
|
3月前
|
消息中间件 数据采集 NoSQL
秒级行情推送系统实战:从触发、采集到入库的端到端架构
本文设计了一套秒级实时行情推送系统,涵盖触发、采集、缓冲、入库与推送五层架构,结合动态代理IP、Kafka/Redis缓冲及WebSocket推送,实现金融数据低延迟、高并发处理,适用于股票、数字货币等实时行情场景。
387 3
秒级行情推送系统实战:从触发、采集到入库的端到端架构
|
3月前
|
Ubuntu
在Ubuntu系统上设置syslog日志轮替与大小限制
请注意,在修改任何系统级别配置之前,请务必备份相应得原始档案并理解每项变更可能带来得影响。
350 2
|
8月前
|
数据采集 运维 Serverless
云函数采集架构:Serverless模式下的动态IP与冷启动优化
本文探讨了在Serverless架构中使用云函数进行网页数据采集的挑战与解决方案。针对动态IP、冷启动及目标网站反爬策略等问题,提出了动态代理IP、请求头优化、云函数预热及容错设计等方法。通过网易云音乐歌曲信息采集案例,展示了如何结合Python代码实现高效的数据抓取,包括搜索、歌词与评论的获取。此方案不仅解决了传统采集方式在Serverless环境下的局限,还提升了系统的稳定性和性能。
251 0
|
5月前
|
存储
WGLOG日志管理系统可以采集网络设备的日志吗
WGLOG日志审计系统提供开放接口,支持外部获取日志内容后发送至该接口,实现日志的存储与分析。详情请访问:https://www.wgstart.com/wglog/docs9.html
|
10月前
|
存储 前端开发 数据可视化
Grafana Loki,轻量级日志系统
本文介绍了基于Grafana、Loki和Alloy构建的轻量级日志系统。Loki是一个由Grafana Labs开发的日志聚合系统,具备高可用性和多租户支持,专注于日志而非指标,通过标签索引而非内容索引实现高效存储。Alloy则是用于收集和转发日志至Loki的强大工具。文章详细描述了系统的架构、组件及其工作流程,并提供了快速搭建指南,包括准备步骤、部署命令及验证方法。此外,还展示了如何使用Grafana查看日志,以及一些基本的LogQL查询示例。最后,作者探讨了Loki架构的独特之处,提出了“巨型单体模块化”的概念,即一个应用既可单体部署也可分布式部署,整体协同实现全部功能。
3805 70
Grafana Loki,轻量级日志系统