2023_Spark_实验二十:SparkStreaming累加计算单词频率

一、需求分析

在服务器端不断产生数据的时候,sparkstreaming客户端需要不断统计服务器端产生的相同数据出现的总数,即累计服务器端产生的相同数据的出现的次数。

二、实验环境

centos7 + nc + spark2.1.1 + windows + idea

三、思路分析

流程分析

思路分析

每次客户端程序处理服务器端数据后,将其结果缓存在检查点中,下一次客户端读入数据并处理数据时会去检查点根据key查询和进行更新,并重新将结果更新到检查点中。

检查点:本质上就是对应于HDFS上的一个目录,将数据写入到该目录下以文件的形式将结果保存下来。故,需要先在hdfs上创建检查点对应的目录。

四、编程实现

实验步骤:

  • 编写客户端处理程序,程序如下
Scala 复制代码
import org.apache.spark.SparkConf

import org.apache.spark.storage.StorageLevel

import org.apache.spark.streaming.{Seconds, StreamingContext}



object MyTotalNetworkWordCount {

def main(args: Array[String]): Unit = {

//创建一个Context对象: StreamingContext (SparkContext, SQLContext)

//指定批处理的时间间隔

val conf = newSparkConf().setAppName("MyNetworkWordCount").setMaster("local[2]")

val ssc = new StreamingContext(conf,Seconds(5))

//设置检查点

ssc.checkpoint("file:///d:/temp/checkpoint")



//创建一个DStream,处理数据,hadoop001为虚拟机的主机名,端口号为netcat服务的端口号

val lines = ssc.socketTextStream("192.168.245.110",1234,StorageLevel.MEMORY_AND_DISK_SER)



//执行wordcount

val words = lines.flatMap(_.split(" "))



//定义函数用于累计每个单词的总频率

val addFunc = (currValues: Seq[Int], prevValueState: Option[Int]) => {

//通过Spark内部的reduceByKey按key规约,然后这里传入某key当前批次的Seq/List,再计算当前批次的总和

val currentCount = currValues.sum

// 已累加的值

val previousCount = prevValueState.getOrElse(0)

// 返回累加后的结果,是一个Option[Int]类型

Some(currentCount + previousCount)

}



val pairs = words.map(word => (word, 1))



val totalWordCounts = pairs.updateStateByKey[Int](addFunc)

totalWordCounts.print()



ssc.start()

ssc.awaitTermination()

}

}
  • 运行程序

  • 在Linux中启动nc: nc -l 1234

  • 输入测试数据,每输入一次数据执行一次回车:

查看下检查点是否有数据:

相关推荐
爱睡觉的圈圈17 小时前
分布式IP代理集群架构与智能调度系统
分布式·tcp/ip·架构
fanstuck18 小时前
基于大模型的个性化推荐系统实现探索与应用
大数据·人工智能·语言模型·数据挖掘
APItesterCris19 小时前
构建分布式京东商品数据采集系统:基于 API 的微服务实现方案
分布式·微服务·架构
IT学长编程20 小时前
计算机毕业设计 基于大数据技术的医疗数据分析与研究 Python 大数据毕业设计 Hadoop毕业设计选题【附源码+文档报告+安装调试】
大数据·hadoop·机器学习·数据分析·毕业设计·毕业论文·医疗数据分析
不吃饭的猪20 小时前
kafka启动小脚本
分布式·kafka
lwprain20 小时前
龙蜥8.10中spark各种集群及单机模式的搭建spark3.5.6(基于hadoop3.3.6集群)
大数据·ajax·spark
休息一下接着来21 小时前
MinIO 分布式模式与纠删码
分布式·minio
胆怯的ai萌新21 小时前
论文阅读/博弈论/拍卖:《Truthful Auction for Cooperative Communications》
分布式·信息与通信
电商软件开发 小银21 小时前
本地生活服务平台创新模式观察:积分体系如何重塑消费生态?
大数据·人工智能·数字化转型·私域运营·消费者心理学
chenglin01621 小时前
TOGAF——ArchiMate
大数据