在了解了Hadoop中的存储组件HDFS之后,我们再来看一下Hadoop中另一个重要组件的计算MapReduce。HDFS搞定海量的存储,MapReduce搞定海量的计算。hadoop如其他优秀的开源组件一样,也提供了丰富的demo,下面我们就来看一下如何使用mapreduce自带demo进行词频统计。
1 系统、环境和约束条件
- 在CentOS7中安装hadoop并启动,作者的hadoop安装目录在/root/hadoop-2.5.2
https://www.jianshu.com/p/b7ae3b51e559
2 操作
- 1 使用putty登录centos
- 2 执行以下命令:
# 切换到家目录
cd
# 进入hadoop的bin目录
cd hadoop-2.5.2/bin
# vim word,在其中加入以下内容并保存退出,读者可以随意加入别的内容,这是我们待会要统计词频的文件
hello i am zhangli
hello i am xiaoli
hi i am ali
who are you
i am xiaoli
# 上传word文件
./hdfs dfs -put word /word
# 查看上传结果
./hdfs dfs -cat /word
# 开始统计,其中
# ./yarn是执行命令
# jar是表示执行的是jar包
# /root/hadoop-2.5.2/share/hadoop/mapreduce/hadoop-mapreduce-examples-2.5.2.jar 表示要执行的jar包
# wordcount 是要执行过程的名字
# /word 是我们上传的待分析的文件在HDFS中的路径
# /output 是我们分析之后结果的输出路径
./yarn jar /root/hadoop-2.5.2/share/hadoop/mapreduce/