2023_Spark_实验九:编写WordCount程序(Scala版)

需求:

1、做某个文件的词频统计//某个单词在这个文件出现次数

步骤:

  1. 文件单词规律(空格分开)
  2. 单词切分
  3. 单词的统计(k,v)->(k:单词,V:数量)
  4. 打印

框架:

  1. 单例对象,main()
  2. 创建CONF
  3. 创建SC-->读取文件的方式--》RDD
  4. RDD进行处理
  5. 闭资源关

一、新建object类取名为WordCount

2、编写如下代码

Scala 复制代码
import org.apache.spark.{SparkConf, SparkContext}

object WordCount {
    def main(args: Array[String]): Unit = {
        System.setProperty("hadoop.home.dir","D:\\hadoop\\hadoop-2.8.0")
        val sparkConf= new SparkConf().setAppName("WordCount").setMaster("local") //设置为本地模式

        val sc = new SparkContext(sparkConf)
        sc.setLogLevel("WARN")
        val resultArray = sc.textFile(path = "file:///d:/temp/a.txt")
            .flatMap(_.split(" "))
            .map((_,1))
            .reduceByKey(_+_)
            .collect()
        resultArray.foreach(println )
        sc.stop()
    }

}

3、本地运行,查看运行结果如下:

解决无法下载spark与打包插件的办法

maven打包插件与spark所需依赖下载地址:

链接:百度网盘 请输入提取码

提取码:jnta

解决步骤:

到网盘下载maven打包插件与spark依赖,网盘吗中的内容如下:

  1. 将下载的插件plugins.rar解压,并复制插件文件夹到你本地maven仓库下
  2. 将下载的spark依赖spark.rar解压,并复制spark文件夹到你本地maven仓库下
  3. 重启idea,重新build下工程

将下载的插件plugins.rar解压,并复制插件文件夹到你本地maven仓库下

将下载的spark依赖spark.rar解压,并复制spark文件夹到你本地maven仓库下

重启idea,重新build下工程

相关推荐
Irene199111 分钟前
剑指大数据:企业级数据仓库项目实战(金融租赁版)读书笔记__大数据测试集群的服务器节点服务分配规划表__解读(附:技术选型清单)
大数据·数据仓库·金融
小五传输11 分钟前
Serv-U替代方案怎么选?政务机关文件安全传输对比与迁移指南
大数据·运维·安全
吉甫作诵21 分钟前
阿里云 ECS 安装 ClickHouse:密码配置、目录迁移与基础调优
大数据·clickhouse
真上帝的左手38 分钟前
19. 大数据- 湖仓一体&BI - 阿里云实践
大数据·阿里云·云计算
ACP广源盛139246256731 小时前
Qwen3.8‑2.4T 开源落地@ACP#国产 MoE 大模型私有化部署中 MST 多屏转换芯片 GSV2231 硬件价值与应用场景
大数据·数据库·人工智能·嵌入式硬件
万岳科技系统开发1 小时前
外卖跑腿小程序如何提升本地生活服务平台运营效率?
大数据·小程序·生活
cc复CC1 小时前
从零开始手写 Spark 02|数据流与延迟迭代
大数据·分布式
数据智研2 小时前
【数据分享】全国农产品成本收益资料汇编(1953-2025)
大数据·人工智能·信息可视化·数据分析
yinshuzhineng2 小时前
问题:如何实现数字化转型,增强竞争优势?
大数据·人工智能·制造
Zaimmm3 小时前
临床文献智能检索哪家强?2026年主流AI循证平台深度测评与推荐
大数据·人工智能·microsoft