Hadoop之僞分佈式配置

原創

只爱大锅饭

2020-06-27 19:30

僞分佈式的配置

Hadoop的運行模式有3種：

1.單機（本地）運行模式
無需運行任何守護進程，所有程序都在單個JVM上執行，測試用
2.僞分佈式
將所有的守護進程運行在一個節點
3.集羣模式
1）完全分佈式
不同的守護進程運行在不同的節點
2)HA
Namenode HA

3)聯盟

本章介紹如何搭建hadoop第二種運行模式

1.系統環境

本章使用的centOS 6.4 64位作爲系統環境，不太清楚的朋友請看Linux部分
Linux環境
1.修改主機名【不能數字開頭，不能特殊字符】
# vi /etc/sysconfig/network

$ cat /etc/sysconfig/network
2.主機映射
# vi /etc/hosts

ip地址主機名
3.windows下主機映射
C:/windows/system32/driver/hosts$ cat /etc/sysconfig/network-scripts/ifcfg-eth0
ONBOOT=yes
BOOTPROTO=static

2.jdk的配置

# mkdir /opt/software /opt/modules

/opt/software 存放*.tag.gz
/opt/modules 放置安裝文件
# chown -Rwangjing:wangjing /opt/modules/ /opt/software/
安裝jdk
$ tar -zxf jdk-7u67-linux-x64.tar.gz -C ../modules/
配置環境變量
# vim /etc/profile
#JAVA_HOME
export JAVA_HOME=/opt/modules/jdk1.7.0_67
export PATH=$PATH:$JAVA_HOME/bin
使配置生效
# source /etc/profile
卸載openJDK
# rpm -qa | grep jdk
# rpm -e --nodeps XXX.rpm //不驗證依賴進行卸載
Linux 防火牆
# service iptables status ##查看防火牆狀態
iptables: Firewall is not running.
# service iptables stop ##關閉防火牆
關閉開機啓動防火牆
# chkconfig iptables off ##不隨機啓動

關閉安全子系統
# vi /etc/sysconfig/selinux
SELINUX=disabled

2.hadoop配置

1.安裝hadoop(2.5版本，http://hadoop.apache.org/下載)

tar -zxf hadoop-2.5.0.tar.gz -C /opt/modules/

2.配置hadoop的java環境支持（修改w文件）

hadoop-env.sh
mapred-env.sh
yarn-env.sh

在這3個文件中都配置

export JAVA_HOME=/opt/modules/jdk1.7.0_67

3.配置hdfs（修改文件）

core.site.xml

hdfs-site.xml

4.格式化namenode，不要重複格式

sbin/hdfs namenode -format 確認這條命令後，hadoop-2.5.0目錄下會多出data目錄和logs目錄

5.啓動、查看hdfs守護進程

啓動：

sbin/hadoop-daemon.sh start namenode

sbin/hadoop-daemon.sh start datanode

查看：

6.在瀏覽器上訪問（主機名：50070），進行驗證，能看到這個頁面說明前面的配置是正常的（打開不了這個頁面，可以去虛擬機自帶火狐瀏覽器驗證）

7.配置yarn、mapreduce

yarn.site.xml

mapreduce.site.xml

slaves(只需要配置主機名即可)

8.重新啓動、查看hdfs、yarn守護進程

sbin/hadoop.daemon.sh start namenode

sbin/hadoop.daemon.sh start datanode

sbin/yarn.daemon.sh start resourcemanager

sbin/yarn.daemon.sh start nodemanager

圖中所示爲正常啓動

9.測試

上傳文件到input

首先創建input目錄 bin/hadoop dfs -mkdir /input

把文件上傳input bin/hadoop dfs -put /home/wangjing/word.txt /input

上傳成功

執行word.txt文件，並計算出文件中相同的字符串多少個

bin/hadoop jar share/hadoop/mapreduce/hadoop-mapreduce-examples-2.5.0.jar wordcount /input/word.txt /output

輸入主機名：8088，打開

執行成功

測試完成

發表評論

所有評論

還沒有人評論，想成為第一個評論的人麼? 請在上方評論欄輸入並且點擊發布.

相關文章

CDH配置Kerberos和Sentry詳解

1.安全之Kerberos安全認證 1 Kerberos概述 1.1 什麼是Kerberos Kerberos是一種計算機網絡授權協議，用來在非安全網絡中，對個人通信以安全的手段進行身份認證。這個詞又指麻省理工學院爲這個協議開發的一套計算

2024-05-20 21:36:31

高效調度新篇章：詳解DolphinScheduler 3.2.0生產級集羣搭建

轉載自tuoluzhe8521 導讀：通過簡化複雜的任務依賴關係， DolphinScheduler爲數據工程師提供了強大的工作流程管理和調度能力。在3.2.0版本中，DolphinScheduler帶來了一系列新功能和改進，使其在生產環

2024-05-15 21:22:54

14 hive安裝

1.hive 1.1 解壓 tar -zxf apache-hive-1.2.2-bin.tar.gz -C .. mv apache-hive-1.2.2-bin/ hive-1.2.2 1.2 修改配置

2024-05-14 00:41:14

Impala數據文件的碎碎念

Impala目前支持Hadoop中幾種常見的文件格式 Parquet 、 ORC 、 Text 、 Avro 、 RCFile 和 SequenceFile 。下面簡要說明各種格式的使用、限制和一些注意事項。不同的文件格式有着不同的適用場

2024-05-12 21:38:18

O2OA(翱途)開發平臺爲待辦創建配置郵件通知

O2OA(翱途)開發平臺[下稱O2OA開發平臺或者O2OA]的消息機制允許開發者通過配置實現郵件通知。本篇主要闡述如何實現待辦消息的郵件通知。一、先決條件： 1、O2Server服務器正常運行，系統安裝部署請參考

2024-05-09 23:10:17

從零開始學架構V2-初識架構設計-1

一、架構設計的主要目的爲了解決軟件系統複雜度帶來的問題二、複雜性來源軟件的架構設計是一個非常複雜的過程；基於業務&技術現狀、公司成本、團隊規模、團隊技術能力、近三年業務發展規模預測、技術發展趨勢等條件篩選出合適的技術、編寫多種架構設計

2024-04-25 23:56:25

利用 Amazon EMR Serverless、Amazon Athena、Apache Dolphinscheduler 以及本地 TiDB 和 HDFS 在混合部署環境中構建無服務器數據倉庫

引言在數據驅動的世界中，企業正在尋求可靠且高性能的解決方案來管理其不斷增長的數據需求。本系列博客從一個重視數據安全和合規性的 B2C 金融科技客戶的角度來討論雲上雲下混合部署的情況下如何利用亞馬遜雲科技雲原生服務、開源社區產品以及第三方

2024-04-25 21:18:23

2024 開源數據工程生態系統全景圖

點擊藍字關注我們作者 | ALIREZA SADEGHI翻譯 | Debra Chen 01 簡介

2024-04-23 21:30:36

告別手動調度，海豚調度器 3.1.x 集羣部署讓你輕鬆管理多機！

轉載自第一片心意 1 前言由於海豚調度器官網的集羣部署文檔寫的較亂，安裝過程中需要跳轉到很多地方進行操作，所以自己總結了一篇可以直接跟着從頭到尾進行操作的文檔，以方便後續的部署、升級、新增節點、減少節點的相關操作。 2. 提前準備 2.

2024-04-23 21:18:20

入職3年-我如何做一名AI產品經理

引言從2021年校招加入京東開始，我一直從事AI產品經理的工作，有幸見證了AI行業的熱情從一臺臺服務器燒到了全世界各個角落，也見證了京東AI中臺團隊的影響力如何一步步的擴大。從21年的迷茫到24年的堅定，很慶幸我正走在適合自己的道路上，

2024-04-22 11:16:31

Hive引擎底層初探

1、什麼是Hive Hive是一個基於Hadoop的數據倉庫工具,用於處理和分析大規模結構化數據。Hive提供了類似SQL的查詢語言(HiveQL)，使得熟悉SQL的用戶能夠查詢數據。Hive將SQL查詢轉換爲MapReduce任務，以在

2024-04-17 11:18:21

用海豚調度器定時調度從Kafka到HDFS的kettle任務腳本

在實際項目中，從Kafka到HDFS的數據是每天自動生成一個文件，按日期區分。而且Kafka在不斷生產數據，因此看看kettle是不是需要時刻運行？能不能按照每日自動生成數據文件？爲了測試實際項目中的海豚定時調度從Kafka到HDFS的K

2024-04-15 21:18:44

解密數倉的SQL ON ANYWHERE技術

本文分享自華爲雲社區《GaussDB DWS的SQL ON ANYWHERE技術解密》，作者：tooooooooooomy。 1. 前言適用版本：【8.1.1（及以上）】查詢分析是大數據要解決的核心問題之一，雖然大數據相關的處理引

2024-04-03 10:32:41

Apache DolphinScheduler-3.2.0集羣部署教程

集羣部署方案(2 Master + 3 Worker) Apache DolphinScheduler官網：https://dolphinscheduler.apache.org/zh-cn Apache DolphinScheduler

2024-03-11 21:25:56

Apache Linkis 1.3.0 適配華爲MRS+Scriptis 實戰分享

一、概述團隊有需求要在頁面上同時使用sql和python語法對數據進行分析，在調研過程中發現linkis可以滿足需要，遂將其引入內網，由於使用的是華爲MRS，與開源的軟件有所不同，又進行了二次開發適配，本文將分享使用經驗，希望對有需

2024-02-23 21:45:28

24小時熱門文章

最新文章

最新評論文章