大数据-101 Spark Streaming DStream转换窗口操作状态跟踪操作附带多个案例（一）-阿里云开发者社区

大数据-101 Spark Streaming DStream转换窗口操作状态跟踪操作附带多个案例（一）

2024-10-14 293

版权

本文内容由阿里云实名注册用户自发贡献，版权归原作者所有，阿里云开发者社区不拥有其著作权，亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容，填写侵权投诉表单进行举报，一经查实，本社区将立刻删除涉嫌侵权内容。

简介： 大数据-101 Spark Streaming DStream转换窗口操作状态跟踪操作附带多个案例（一）

点一下关注吧！！！非常感谢！！持续更新！！！

目前已经更新到了：

Hadoop（已更完）

HDFS（已更完）

MapReduce（已更完）

Hive（已更完）

Flume（已更完）

Sqoop（已更完）

Zookeeper（已更完）

HBase（已更完）

Redis （已更完）

Kafka（已更完）

Spark（正在更新！）

章节内容

上节我们完成了如下的内容：

Spark Streaming DStream 转换函数

DStream 无状态转换

DStream 无状态转换案例

c455671bf4f32c2e1d5d83aeca056f4d_6448f21c80244b6cbe97681f675fe93a.png 转换方式

有两个类型：

无状态转换（已经完成）

有状态转换

接下来开始有状态转换。

有状态转换

有状态转换主要有两种：

窗口操作

状态跟踪操作

窗口操作

Window Operations 可以设置窗口大小和滑动窗口间隔来动态获取当前Streaming的状态

基于窗口的操作会在一个比 StreamingContext 的 batchDuration（批次间隔）更长的时间范围内，通过整合多个批次的结果，计算出整个窗口的结果。

563e7dde3d00065e456ba29dfcb0dcbc_36b4631a4bb742259fab4b45bea3cbaa.png 基于窗口的操作需要两个参数：

窗口长度（Window Duration）：控制每次计算最近的多少个批次的数据

滑动间隔（Slide Duration）：用来控制对新的 DStream 进行计算的间隔

两者都必须是StreamingContext中批次间隔（batchDuration）的整数倍

准备编码

我们先编写一个每秒发送一个数字：

package icu.wzk

import java.io.PrintWriter
import java.net.{ServerSocket, Socket}

object SocketWithWindow {

  def main(args: Array[String]): Unit = {
    val port = 9999
    val ss = new ServerSocket(port)
    val socket: Socket = ss.accept()
    var i = 0
    while (true) {
      i += 1
      val out = new PrintWriter(socket.getOutputStream)
      out.println(i)
      out.flush()
      Thread.sleep(1000)
    }
  }
}

[窗口操作] 案例2观察窗口数据

观察窗口的数据
观察 batchDuration、windowDuration、slideDuration 三者之间的关系
使用窗口相关的操作

编写代码

package icu.wzk

import org.apache.spark.SparkConf
import org.apache.spark.streaming.dstream.{DStream, ReceiverInputDStream}
import org.apache.spark.streaming.{Seconds, StreamingContext}

object WindowDemo {

  def main(args: Array[String]): Unit = {
    val conf = new SparkConf()
      .setAppName("WindowDemo")
      .setMaster("local[*]")

    val ssc = new StreamingContext(conf, Seconds(5))
    ssc.sparkContext.setLogLevel("WARN")

    val lines: ReceiverInputDStream[String] = ssc.socketTextStream("localhost", 9999)
    lines.foreachRDD {
      (rdd, time) => {
        println(s"rdd = ${rdd.id}; time = $time")
      }
        rdd.foreach(value => println(value))
    }

    // 20秒窗口长度（DS包含窗口长度范围内的数据）
    // 10秒滑动间隔（多次时间处理一次数据）
    val res1: DStream[String] = lines
      .reduceByWindow(_ + " " + _, Seconds(20), Seconds(10))
    res1.print()

    val res2: DStream[String] = lines
      .reduceByWindow(_ + _, Seconds(20), Seconds(10))
    res2.print()

    // 求窗口元素的和
    val res3: DStream[Int] = lines
      .map(_.toInt)
      .reduceByWindow(_ + _, Seconds(20), Seconds(10))
    res3.print()

    // 请窗口元素和
    val res4 = res2.map(_.toInt).reduce(_ + _)
    res4.print()

    // 程序启动
    ssc.start()
    ssc.awaitTermination()

  }
}

运行结果

-------------------------------------------
Time: 1721628860000 ms
-------------------------------------------

rdd = 39; time = 1721628865000 ms
rdd = 40; time = 1721628870000 ms
-------------------------------------------
Time: 1721628870000 ms
-------------------------------------------

-------------------------------------------
Time: 1721628870000 ms
-------------------------------------------

-------------------------------------------
Time: 1721628870000 ms
-------------------------------------------

运行之后控制截图如下：

大数据-101 Spark Streaming DStream转换窗口操作状态跟踪操作附带多个案例（一）

[窗口操作] 案例2观察窗口数据

编写代码

运行结果

接下篇：https://developer.aliyun.com/article/1622640

热门文章

最新文章

相关课程

相关电子书

探索云世界

热门

云计算

大数据

云原生

人工智能

数据库

开发与运维

活动广场

任务中心

训练营

直播

乘风者计划

下载

镜像站

技术资料

大数据-101 Spark Streaming DStream转换 窗口操作状态 跟踪操作 附带多个案例（一）

[窗口操作] 案例2观察窗口数据

编写代码

运行结果

接下篇：https://developer.aliyun.com/article/1622640

热门文章

最新文章

相关课程

相关电子书

大数据-101 Spark Streaming DStream转换窗口操作状态跟踪操作附带多个案例（一）