利用scala书写spark程序实现wordCount

实验环境:虚拟机(centos)上创建了三台集群,部署了Hadoop,words文档放在HDFS上的目录下

所用版本如下:

<hadoop.version>2.7.7</hadoop.version>

<spark.version>2.4.5</spark.version>

<scala.version>2.12.10</scala.version>

步骤

代码详解

方法一:

scala 复制代码
object readData {
  def main(args: Array[String]): Unit = {
  	// 创建一个本地运行的 Spark 应用程序,并且设置了应用程序的名称为 "readData"
    val spark=SparkSession.builder().appName("readData").master("local[*]").getOrCreate();
    // HDFS目录路径
    val hdfsPath = "hdfs://你的节点ip:9000/路径/文件名";
    // 读取文本文件
    val lines = spark.read.textFile(hdfsPath).rdd
    // 单词计数
    val wordCounts = lines
      .flatMap(line => line.split(" ")) // 根据空格切分单词
      .map(word => (word, 1))
      .reduceByKey(_ + _)
    // 输出结果
    wordCounts.collect().foreach(println)
    // 停止 SparkSession
    spark.stop();
  }
}

方法二:

scala 复制代码
object readData {
  def main(args: Array[String]): Unit = {
    // HDFS目录路径
    val hdfsPath = "hdfs://你的节点ip:9000/路径/文件名";
	//1. 创建 conf 对象
    val conf = new SparkConf().setAppName("WordCount").setMaster("local[*]")
    //2. 创建 SparkContext 对象:提交应用的入口
    val sc = new SparkContext(conf)
    //3. 执行单词统计
    val res = sc.textFile(hdfsPath).flatMap(_.split(" ")).map((_,1)).reduceByKey(_+_).collect;
    //4. 遍历输出结果
    res.foreach(println);
    // 停止 SparkSession
    sc.stop()
  }
}

说明:

  • 使用 SparkContext 和 SparkConf 是传统的方式,适用于 Spark 1.x 版本。它们提供了基本的 Spark 功能,但使用起来可能相对复杂,需要更多的配置和管理。
  • 使用 SparkSession 是 Spark 2.x 版本中推荐的方式。它集成了 Spark SQL,使得你可以更方便地使用 DataFrame 和 Dataset API 来处理结构化数据,而不需要额外导入其他的 API。此外,SparkSession 也可以自动管理 SparkContext,使得整个应用程序的管理更加简单。
  • flatMap 是一个转换操作,主要用于将结果扁平化(这里是将切分后的文本转换为多个单词作为输出)
  • map 是一个转换操作,它将输入RDD中的每个元素映射为一个新的元素(这里是映射为(key,1)键值对的形式)
  • reduceByKey 是一个转换操作,它将具有相同键的元素聚合在一起,并对它们的值进行合并
相关推荐
计算机毕业编程指导师1 天前
【Python毕设选题推荐】基于Spark的国内主要农作物产量趋势分析与可视化系统源码 毕业设计 选题推荐 毕设选题 数据分析 机器学习
大数据·python·数据分析·spark·毕业设计·课程设计·农作物产量
计算机毕业编程指导师1 天前
【Python毕设选题推荐】基于Spark的宫颈癌变光谱特征数据分析可视化系统源码 毕业设计 选题推荐 毕设选题 数据分析 机器学习
大数据·hadoop·python·计算机·spark·毕业设计·宫颈癌变
计算机毕业编程指导师1 天前
计算机毕设选题推荐:基于Hadoop与Spark的Steam游戏数据分析系统源码 毕业设计 选题推荐 毕设选题 数据分析 机器学习 深度学习
大数据·hadoop·python·计算机·spark·毕业设计·steam游戏
计算机毕业编程指导师1 天前
【计算机毕设选题推荐】基于Hadoop+Spark的白鹿抖音评论大数据分析与可视化系统源码 毕业设计 选题推荐 毕设选题 数据分析 机器学习 深度学习
大数据·hadoop·python·计算机·spark·毕业设计·抖音评论
计算机毕业编程指导师2 天前
【大数据毕设选题推荐】基于Spark的WTA职业网球赛事演变与竞技格局分析系统源码 毕业设计 选题推荐 毕设选题 数据分析 机器学习 深度学习
大数据·python·计算机·spark·毕业设计·课程设计·wta网球
计算机毕业编程指导师2 天前
【计算机毕设选题推荐】基于Spark与Hadoop的AI就业收入区域差异分析系统 源码 毕业设计 选题推荐 毕设选题 数据分析 机器学习 深度学习
大数据·python·数据分析·spark·毕业设计·课程设计·ai就业收入
计算机毕业编程指导师2 天前
【大数据毕设选题】基于Spark的电信网络诈骗话术语义特征挖掘分析系统源码 毕业设计 选题推荐 数据分析 机器学习 深度学习
大数据·hadoop·python·spark·毕业设计·课程设计·网络诈骗
计算机毕业编程指导师2 天前
计算机大数据毕设怎么选?基于Spark的个体肥胖健康风险评估的数据分析与可视化系统带你通关 源码 毕业设计 选题推荐 毕设选题 数据分析 机器学习
大数据·hadoop·python·计算机·spark·毕业设计·肥胖风险
IT研究室2 天前
最新大数据毕业设计选题推荐-基于大数据的单位招聘岗位信息分析与可视化-大数据-Spark-Hadoop-Bigdata
大数据·spark·课程设计
计算机毕业编程指导师2 天前
计算机毕设答辩技巧:基于Hadoop+Django的公共交通运营数据分析与可视化系统怎么做 源码 毕业设计 选题推荐 毕设选题 数据分析 机器学习
大数据·hadoop·python·spark·毕业设计·课程设计·交通运行