经典hadoop案例应用(命令实现版)

1.wordcount 词频

hadoop jar ./share/hadoop-example.jar wordcount /input /output

root@node01 \~# hadoop jar /opt/bigdata/hadoop/share/hadoop/mapreduce/hadoop-mapreduce-examples-2.7.1.jar wordcount /input /output2

2.pi

hadoop jar ./share/hadoop-examples.jar pi 100 100000000

第1个100指的是要运行100次map任务

第2个数字指的是每个map任务,要投掷多少次

3.sudoku 九宫图

hadoop jar ./hadoop-mapreduce-examples-2.7.1.jar sudoku /home/bigdata/data/

puzzle(源数据)

8 5 ? 3 9 ? ? ? ?

? ? 2 ? ? ? ? ? ?

? ? 6 ? 1 ? ? ? 2

? ? 4 ? ? 3 ? 5 9

? ? 8 9 ? 1 4 ? ?

3 2 ? 4 ? ? 8 ? ?

9 ? ? ? 8 ? 5 ? ?

? ? ? ? ? ? 2 ? ?

? ? ? ? 4 5 ? 7 8

  1. teragen 按照kv自动的生成数据用的。

描述一下:每一行,是一条数据。每一条,由2部分组成,前面是一个由10个随即字符组成的key,后面是一个80个字符组成的value。

排序的任务:按照key的顺序排。

1TB排序通常用于衡量分布式数据处理框架的数据处理能力。Terasort是Hadoop中的的一个排序作业,在2008年,Hadoop在1TB排序基准评估中赢得第一名,耗时209秒。

hadoop jar hadoop-0.20.1-examples.jar teragen 1000000 /output

  1. grep 查找文本中出现的自定关键字的 数量

hadoop jar hadoop-mapreduce-examples-2.7.1.jar grep /bigdata/input/file /bigdata/output/out5 'd'

  1. SecondarySort 二次排序

hadoop jar hadoop-mapreduce-examples-2.7.1.jar secondarysort /bigdata/input/file2 /bigdata/output/out13

源数据:

20 21

50 51

50 52

50 53

50 54

60 51

60 53

60 52

60 56

60 57

70 58

60 61

70 54

70 55

70 56

70 57

70 58

1 2

3 4

5 6

7 82

203 21

50 512

50 522

50 53

530 54

40 511

20 53

20 522

60 56

60 57

740 58

63 61

730 54

71 55

71 56

73 57

74 58

12 211

31 42

50 62

7 8

相关推荐
2601_962074584 分钟前
大数据-260 实时数仓 - 项目背景与需求 实时数仓架构 需求分析 技术选型 逻辑架构
大数据·架构
LPCK_2026062215 分钟前
从自动化到自主化:生物制药智能体的人机边界怎么设计
大数据·人工智能·自动化
cuijiecheng201839 分钟前
从 GinormoTime 到 Rocky Linux:25fps LTC 完整搭建与验证实战
linux·运维·服务器
衡石科技1 小时前
HENGSHI BOX|全域智控,私域安全的ChatBI一体机
大数据·人工智能·安全
张工在路上1 小时前
WPF 布局基础概述
大数据·hadoop·wpf
链上日记1 小时前
从公开信息看WEEX的运营轨迹
大数据·区块链
江畔柳前堤2 小时前
具身智能全景深度指南(2026年9月版):从“会聊天的AI“到“能干活的机器“
大数据·javascript·图像处理·人工智能·分布式·智慧城市·原型模式
凤舞飘伶2 小时前
服务器内存满日常运维命令
linux·运维·服务器
GlobalInfo2 小时前
创新不是追逐热点,是在变化中建立长期竞争力
大数据·算法
IPdodo_2 小时前
静态 IP 访问异常排查:403/429 归因与迁移验收
服务器·网络·数据库·python·网络协议·php·性能测试