hadoop入门【5】测试hadoop自带词频统计demo_hadoop测试词频统计example-CSDN博客

本文链接：https://blog.csdn.net/qq_41717874/article/details/90783460

本文介绍了如何在CentOS7上安装Hadoop并使用自带的MapReduce demo进行词频统计。通过登录CentOS，执行特定命令，可以体验Hadoop在大数据计算中的能力。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

在了解了Hadoop中的存储组件HDFS之后，我们再来看一下Hadoop中另一个重要组件的计算MapReduce。HDFS搞定海量的存储，MapReduce搞定海量的计算。hadoop如其他优秀的开源组件一样，也提供了丰富的demo，下面我们就来看一下如何使用mapreduce自带demo进行词频统计。

1 系统、环境和约束条件

在CentOS7中安装hadoop并启动，作者的hadoop安装目录在/root/hadoop-2.5.2
https://www.jianshu.com/p/b7ae3b51e559

2 操作

1 使用putty登录centos
2 执行以下命令：

# 切换到家目录
cd 
# 进入hadoop的bin目录
cd hadoop-2.5.2/bin
#  vim word，在其中加入以下内容并保存退出，读者可以随意加入别的内容，这是我们待会要统计词频的文件
hello i am zhangli
hello i am xiaoli
hi i am ali
who are you
i am xiaoli
# 上传word文件
./hdfs dfs -put word /word
# 查看上传结果
./hdfs dfs -cat /word
# 开始统计，其中
# ./yarn是执行命令
# jar是表示执行的是jar包
# /root/hadoop-2.5.2/share/hadoop/mapreduce/hadoop-mapreduce-examples-2.5.2.jar 表示要执行的jar包
# wordcount  是要执行过程的名字
# /word 是我们上传的待分析的文件在HDFS中的路径
# /output 是我们分析之后结果的输出路径
./yarn jar /root/hadoop-2.5.2/share/hadoop/mapreduce/