在阿里云和腾讯云的轻量应用服务器上搭建Hadoop集群

这篇具有很好参考价值的文章主要介绍了在阿里云和腾讯云的轻量应用服务器上搭建Hadoop集群。希望对大家有所帮助。如果存在错误或未考虑完全的地方,请大家不吝赐教,您也可以点击"举报违法"按钮提交疑问。

引入

本文在两台2核2g的云服务器上搭建了Hadoop集群,两台云服务器分别是阿里云(hjm)和腾讯云(gyt),集群部署规划如下:

hjm gyt
HDFS NameNode\SecondaryNameNode\DataNode DataNode
YARN ResourceManager\NodeManager NodeManager

经实验,目前可以正常实现文件上传下载,但跑mapreduce程序还出现服务器资源不够的情况

搭建过程

新增用户

useradd hujinming
passwd hujinming

配置用户sudo权限

vim /etc/sudoers

## Allow root to run any commands anywhere
root ALL=(ALL) ALL
## Allows people in group wheel to run all commands
%wheel ALL=(ALL) ALL

下面新增一行

hujinming ALL=(ALL) NOPASSWD:ALL

创建目录并更改权限

在/opt 目录下创建 module、software 文件夹

mkdir /opt/module
mkdir /opt/software

切换到root用户下,修改 module、software 文件夹的所有者和所属组均为hujinming用户

chown hujinming:hujinming /opt/module
chown hujinming:hujinming /opt/software

查看 module、software 文件夹的所有者和所属组

ll

安装JDK

  • 用xftp工具将jdk导入到opt目录下面的software文件夹下面
  • 解压jdk到opt/module目录下
tar -zxvf jdk-8u212-linux.x64.tar.gz -C /opt/module/
  • 配置jdk环境变量

    • 新建/etc/profile.d/my_env.sh 文件
    sudo vim /etc/profile.d/my_env.sh
    
    • 添加如下内容
    #JAVA_HOME
    export JAVA_HOME=/opt/module/jdk1.8.0_212
    export PATH=$PATH:$JAVA_HOME/bin
    
    • 保存后退出,source 一下/etc/profile 文件,让新的环境变量 PATH 生效
    source /etc/profile
    
    • 测试jdk是否安装成功
    java -version
    

安装hadoop

  • xftp传输

  • 解压安装到/opt/module下面

  • 将hadoop添加到环境变量

    • 获取hadoop安装路径

      pwd
      
    • 打开/etc/profile.d/my_env.sh 文件

      sudo vim /etc/profile.d/my_env.sh
      
    • 在 my_env.sh 文件末尾添加如下内容:

      #HADOOP_HOME
      export HADOOP_HOME=/opt/module/hadoop-3.1.3
      export PATH=$PATH:$HADOOP_HOME/bin
      export PATH=$PATH:$HADOOP_HOME/sbin
      
    • 保存退出,让修改后的文件生效

    • 测试是否安装成功

服务器IP映射

  • 修改主机名
vim /etc/hostname

分别把两台服务器的名字改成hjm和gyt,这里以gyt举例,直接在hostname文件上输入

gyt
  • 改映射文件
vim /etc/hosts

在linux中键入ifconfig命令可以查看内网ip。在两台服务器中,填写自己的私网,访问别人的填写公网,这里以gyt为例,gyt的公网IP是175.178.236.48,内网IP是10.0.12.1。这里要注意一点,阿里云在hosts文件中已经将本地IP映射成了一串英文,把这行信息删掉再进行上面的操作

47.115.207.108 hjm
10.0.12.1 gyt
  • 在客户端电脑(默认windows)配置映射

    因为在客户端电脑进行hadoop的操作时,两台机子会产生通信,他们通信时发送的网络请求url是gyt或者hjm,这在客户端电脑是无法识别的,所以要将gyt和hjm都映射为他们的公网IP

    • windows + R

    • 输入drivers,回车

    • 进入etc文件

    • 编辑hosts文件(都是公网IP)

      175.178.236.48 gyt
      47.115.207.108 hjm
      

ssh免密登录

分别要配置4种免密登录:

  • hjm -> gyt
  • gyt -> hjm
  • hjm -> hjm
  • gyt -> gyt

注意切换对应用户操作。先cd到~/.ssh,生成公钥和私钥

ssh-keygen -t rsa

这里以gyt -> hjm或hjm -> hjm为例:

ssh-copy-id hjm

修改配置文件

cd到$HADOOP_HOME/etc/hadoop目录

core-site.xml

<configuration>
 <!-- 指定 NameNode 的地址 -->
 <property>
 <name>fs.defaultFS</name>
 <value>hdfs://hjm:8020</value>
 </property>
 <!-- 指定 hadoop 数据的存储目录 -->
 <property>
 <name>hadoop.tmp.dir</name>
 <value>/opt/module/hadoop-3.1.3/data</value>
 </property>
 <!-- 配置 HDFS 网页登录使用的静态用户为 root -->
 <property>
 <name>hadoop.http.staticuser.user</name>
 <value>hujinming</value>
 </property>
</configuration>

hdfs-site.xml

<configuration>
<!-- nn web 端访问地址-->
<property>
 <name>dfs.namenode.http-address</name>
 <value>hjm:9870</value>
 </property>
<!-- 2nn web 端访问地址-->
 <property>
 <name>dfs.namenode.secondary.http-address</name>
 <value>hjm:9868</value>
 </property>
</configuration>

yarn-site.xml

<configuration>
 <!-- 指定 MR 走 shuffle -->
 <property>
 <name>yarn.nodemanager.aux-services</name>
 <value>mapreduce_shuffle</value>
 </property>
 <!-- 指定 ResourceManager 的地址-->
 <property>
 <name>yarn.resourcemanager.hostname</name>
 <value>hjm</value>
 </property>
 <!-- 环境变量的继承 -->
 <property>
 <name>yarn.nodemanager.env-whitelist</name>
 
<value>JAVA_HOME,HADOOP_COMMON_HOME,HADOOP_HDFS_HOME,HADOOP_CO
NF_DIR,CLASSPATH_PREPEND_DISTCACHE,HADOOP_YARN_HOME,HADOOP_MAP
RED_HOME</value>
 </property>
</configuration>

mapred-site.xml

<configuration>
<!-- 指定 MapReduce 程序运行在 Yarn 上 -->
 <property>
 <name>mapreduce.framework.name</name>
 <value>yarn</value>
 </property>
</configuration>

workers

hjm
gyt

去服务器上启动对应端口

  • 用各自的服务器对双方暴露所有的端口
  • 同时,对公网暴露9864、9866、9870、9868端口

问题与解决

  1. ./sbin/start-dfs.sh 开启NameNode 和 DataNode 守护进程报错:

    Starting namenodes on [hjm]
    ERROR: Attempting to operate on hdfs namenode as root
    ERROR: but there is no HDFS_NAMENODE_USER defined. Aborting operation.
    Starting datanodes
    ERROR: Attempting to operate on hdfs datanode as root
    ERROR: but there is no HDFS_DATANODE_USER defined. Aborting operation.
    Starting secondary namenodes [hjm]
    ERROR: Attempting to operate on hdfs secondarynamenode as root
    ERROR: but there is no HDFS_SECONDARYNAMENODE_USER defined. Aborting operation.
    

    解决方法:

    在hjm上的start-dfs.sh和stop-dfs.sh上增加如下几行:

    HDFS_DATANODE_USER=hujinming
    HADOOP_SECURE_SECURE_USER=hdfs
    HDFS_NAMENODE_USER=hujinming
    HDFS_SECONDARYNAMENODE_USER=hujinming
    

    在hjm上的start-yarn.sh和stop-yarn.sh上增加如下几行:

    YARN_RESOURCEMANAGER_USER=hujinming
    HADOOP_SECURE_DN_USER=yarn
    YARN_NODEMANAGER_USER=hujinming
    
  2. 报错hjm: ERROR: Cannot set priority of namenode process 23214,没有启动NameNode和SecondaryNameNode

​ 解决方法:

​ 在两台服务器的/etc/hosts中,填写自己的私网,访问别人的填写公网

  1. 找不到NameNode和SecondaryNameNode

​ 解决方法:

​ 把所有节点logs和data删掉,重新格式化namenode,在hjm机子上,执行下面命令:

hdfs namenode -format
  1. 客户端(windows)识别不了hjm和gyt

​ 解决方法:改windows下面的主机名映射

  1. 配置WebUI可跨域?

​ 解决方法:在两台服务器的core-site.xml加入下面代码

        <!--web console cors settings-->
        <property>
            <name>hadoop.http.filter.initializers</name>
            <value>org.apache.hadoop.security.HttpCrossOriginFilterInitializer</value>
        </property>
        <property>
            <name>hadoop.http.cross-origin.enabled</name>
            <value>true</value>
        </property>
        <property>
            <name>hadoop.http.cross-origin.allowed-origins</name>
            <value>*</value>
        </property>
        <property>
            <name>hadoop.http.cross-origin.allowed-methods</name>
            <value>*</value>
        </property>
        <property>
            <name>hadoop.http.cross-origin.allowed-headers</name>
            <value>X-Requested-With,Content-Type,Accept,Origin</value>
        </property>
        <property>
            <name>hadoop.http.cross-origin.max-age</name>
            <value>1800</value>
        </property>
  1. 没有足够的副本数量?

​ 解决方法:还得看DataNode的数量。因为目前只有2台设备,最多也就2个副本,HDFS默认是3个副本,只有节点数的增加到10台时,副本数才能达到10。详细请看https://www.yii666.com/article/664023.html

  1. hadoop脚本启动时,错误: ERROR org.apache.hadoop.hdfs.server.datanode.DataNode: Exception in secureMain?

​ 解决方法:在master主机的slaves文件中删除localhost即可。详细请看https://blog.csdn.net/Mr_ZNC/article/details/80700652

  1. HDFS的webui界面上传下载文件,出现卡死情况?

​ 解决方法:暴露服务器所有端口给对方文章来源地址https://www.toymoban.com/news/detail-709931.html

到了这里,关于在阿里云和腾讯云的轻量应用服务器上搭建Hadoop集群的文章就介绍完了。如果您还想了解更多内容,请在右上角搜索TOY模板网以前的文章或继续浏览下面的相关文章,希望大家以后多多支持TOY模板网!

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处: 如若内容造成侵权/违法违规/事实不符,请点击违法举报进行投诉反馈,一经查实,立即删除!

领支付宝红包 赞助服务器费用

相关文章

  • 腾讯云国际轻量应用服务器怎么使用呢?

    腾讯云国际轻量应用服务器怎么使用呢?下面一起来了解一下: 1. 熟悉轻量应用服务器基础知识 ①什么是轻量应用服务器 TencentCloud Lighthouse? ②轻量应用服务器与云服务器 CVM 的区别是什么? ③为什么选择轻量应用服务器? ④轻量应用服务器应用场景介绍 ⑤使用轻量应用

    2024年02月14日
    浏览(55)
  • 腾讯云轻量应用服务器连接Xftp 7

    附(初始化root密码):sudo passwd root 1.在腾讯云中对服务器重置密码,并在里面设置用户名为root  2. 下载xftp(Xshell)  Xftp用来和腾讯云服务器进行文件传输。(Xshell是一个可以在腾讯云服务器终端和本地电脑建立命令连接的软件) 3.打开Xftp,名称自己想个(不影响),输入

    2024年02月16日
    浏览(75)
  • 使用腾讯云轻量应用服务器搭建网站教程

    腾讯云轻量应用服务器怎么搭建网站?太简单了,轻量服务器选择宝塔Linux镜像,然后在宝塔面板上添加站点,以WordPress建站为例,腾讯云服务器网来详细说下腾讯云轻量应用服务器搭建网站全流程,包括轻量服务器配置选择、镜像系统、防火墙开端口及网站上线超详细教程

    2024年02月15日
    浏览(49)
  • 腾讯云轻量应用服务器“镜像”怎么选择合适?

    腾讯云轻量应用服务器镜像怎么选择?如果是用来搭建网站可以选择宝塔Linux面板腾讯云专享版,镜像系统根据实际使用来选择,腾讯云百科txybk.com来详细说下腾讯云轻量应用服务器镜像的选择方法: 轻量应用服务器的镜像可以选择纯净版操作系统,Linux如CentOS、Ubuntu、Cent

    2024年02月08日
    浏览(47)
  • 腾讯云轻量应用服务器价格表(2023版)

    2023腾讯云轻量应用服务器2核2G4M带宽88元一年、2核4G6M带宽159元/年、4核8G10M优惠价425元、8核16G14M价格1249、16核32G20M服务器2499元一年,今天分享2023腾讯云服务器配置及精准报价。 腾讯云服务器分为轻量应用服务器和云服务器CVM,轻量应用服务器和标准型云服务器CVM实例CPU性能

    2023年04月08日
    浏览(65)
  • 腾讯云轻量应用服务器性能如何?测评来了

    腾讯云轻量应用服务器性能如何?CPU型号主频、内存、公网带宽和系统盘存储多维对比,轻量应用服务器会不会比云服务器CVM性能差?相对于CVM云服务器轻量服务器更适合轻量级的应用,轻量服务适合中小企或个人开发者用于搭建We网站b应用、小程序、APP以及开发测试环境等

    2024年02月11日
    浏览(55)
  • 腾讯云轻量应用服务器使用限制说明(十大限制)

    腾讯云轻量应用服务器和云服务器CVM相比具有一些限制,比如轻量服务器不支持更换内网IP地址,轻量服务器只能套餐整体升级且不支持降配,轻量不支持用户自定义配置私有网络VPC,还有如实例配额、云硬盘配额、备案限制和内网连通性等限制,腾讯云百度来详细说下轻量

    2024年02月06日
    浏览(66)
  • 腾讯云轻量应用服务器开启root远程登录

    在腾讯云中创建轻量级应用服务器默认没有root登录,官方给了lighthouse账号进行webshell登录;但对于日常使用中偏向于root链接,本文记录了全新服务器配置root账号,且使其可远程链接使用。 服务器环境及工具: CentOS 7.6 64bit MobaXterm 1. 免密登录lighthouse账号  2. 使用普通账号登

    2024年02月11日
    浏览(42)
  • 腾讯云轻量应用服务器使用限制(买前必看)

    腾讯云轻量应用服务器和云服务器CVM相比具有一些限制,比如轻量服务器不支持更换内网IP地址,轻量服务器只能套餐整体升级且不支持降配,轻量不支持用户自定义配置私有网络VPC,还有如实例配额、云硬盘配额、备案限制和内网连通性等限制,腾讯云百度来详细说下轻量

    2024年02月09日
    浏览(48)
  • 腾讯云轻量应用服务器搭建WordPress网站教程

    腾讯云百科分享使用腾讯云轻量应用服务器搭建WordPress网站教程流程,WordPress 是全球最流行的开源的博客和内容管理网站的建站平台,具备使用简单、功能强大、灵活可扩展的特点,提供丰富的主题插件。腾讯云轻量应用服务器提供 WordPress 应用镜像,您可以使用它快速搭建

    2024年02月13日
    浏览(48)

觉得文章有用就打赏一下文章作者

支付宝扫一扫打赏

博客赞助

微信扫一扫打赏

请作者喝杯咖啡吧~博客赞助

支付宝扫一扫领取红包,优惠每天领

二维码1

领取红包

二维码2

领红包