HDFS架構_ZenDei技術網路在線

HDFS架構

-Advertisement-

HDFS架構（Master Slave）幾個進程的角色 1. nameNode（master）：用於保存、管理、持久化文件的元數據（文件名、文件副本數、文件塊大小、文件塊列表），同時還要接收客戶端的文件讀寫請求。 2. secondaryNameNode：用於實時同步文件元數據，給nameNode ...

HDFS架構（Master-Slave）

幾個進程的角色
1. nameNode（master）：用於保存、管理、持久化文件的元數據（文件名、文件副本數、文件塊大小、文件塊列表），同時還要接收客戶端的文件讀寫請求。
2. secondaryNameNode：用於實時同步文件元數據，給nameNode服務做副本，擔當高可用備份，nameNode處於正常狀態時secondaryNameNode只sandBy。
3. dataNode（slave）：真正存儲文件塊，分佈在每個節點上。
4. dfsClient：向hdfs發請求，當用戶發起一個hdfs文件讀、寫、查詢等請求時，集群都會啟動一個dfsClient進程，dfsClient先訪問nameNode獲取文件元數據，然後根據元數據解析出文件分片的分佈情況，最後去各dataNode完成真正的讀寫。它扮演著用戶與hdfs交互中間人的角色，同時文件的拆分和拼裝也是在dfsClient進程完成的。
HDFS文件讀寫流程
- 讀取：系統接收到用戶讀請求後，首先啟動一個dfsClient進程，這個進程拿著用戶傳遞的文件路徑等信息，傳遞給nameNode，nameNode返迴文件分片的分佈節點列表，dfsClient就近讀取文件分片，並將各分片拼裝為完整文件返回給用戶。
- 寫入：系統接收到用戶寫請求後，首先啟動一個dfsClient進程，這個進程將寫入文件的信息提交給nameNode，nameNode根據集群情況將文件進行分片和位置規劃，再將規劃信息返回給dfsClient，dfsClient根據規劃信息將文件切分成特定的塊，然後根據位置規劃分別與對應的dataNode建立管道，將分片傳輸到對應的dataNode上。

您的分享是我們最大的動力!

-Advertisement-

更多相關文章

Flink中邏輯計劃和物理計劃的概念劃分和對應關係

邏輯計劃 1. logicGraph或者jobGraph，其端點為operator，edge為數據流向。 2. operator往往代表一個函數。 3. 同一個分區內的具有連續上下游關係的函數組成operator chain，一個operator chain內的數據來流動過程中不會出現序列化和分區間 ...
SparkShuffle機制

在早期版本的Spark中，shuffle過程沒有磁碟讀寫操作，是純記憶體操作，後來發現效率較低，且極易引發OOME，較新版本的Shuffle操作都加入了磁碟讀寫進行了改進。 1、未經優化的HashShuffleManager：上一個stage中每一個task會對下一個stage的每一個task寫一份數 ...
Spark組件間通信

1、Spark組件之間使用RPC機制進行通信。RPC的客戶端在本地編寫並調用業務介面，介面在本地通過RPC框架的動態代理機制生成一個對應的實現類，在這個實現類中完成soket通信、遠程調用等功能的邏輯包裝，而在RPC的服務端既編寫業務介面也編寫了具體的業務實現類，通過RPC框架以介面的方式暴露出來， ...
Spark記憶體管理

1、spark的一大特性就是基於記憶體計算，Driver只保存任務的巨集觀性的元數據，數據量較小，且在執行過程中基本不變，不做重點分析，而真正的計算任務Task分佈在各個Executor中，其中的記憶體數據量大，且會隨著計算的進行會發生實時變化，所以Executor的記憶體管理才分析的重點。 2、在執行Sp ...
Redis持久化機制

1、Redis數據持久化的必要性由於redis是基於記憶體的資料庫，面臨數據掉電易失的風險，要避免數據丟失，最好將記憶體數據持久化到磁碟等永久存儲介質上。服務重啟時，會先載入磁碟文件內的數據到記憶體，完成數據恢復。 2、RDB（RedisDB）對記憶體中的redis全量數據進行時點快照並序列化，以文 ...
Redis集群模式

1、常見的三種數據的集群存儲模式 1. full mirror：全量鏡像模式，單純備份模式，各個節點數據相同，都包含了全量數據，僅主節點可寫，保證了數據冗餘和讀的負載均衡。數據安全性高，橫向擴展能力差，資源利用率不高。 2. pure sharding：數據分片，每個節點的數據不相同，所有節點中數據 ...
Ambari HDP 下 SPARK2 與 Phoenix 整合

1、環境說明 | 操作系統 | CentOS Linux release 7.4.1708 (Core) | | | : : | | Ambari | 2.6.x | | HDP | 2.6.3.0 | | Spark | 2.x | | Phoenix | 4.10.0 HBase 1.2 | 2 ...
關於索引我能說的那些事兒

本文是自己對MySQL的索引的理解，如有錯誤，還望不吝指出。 1 索引索引這兩個字著實有些太泛，而在我的理解中，其就是一個查字典的過程，比方說現在我們要從一本字典中查一個字，那麼我們可以從目錄中的字母找到這個字，發現在頁，然後翻到就可以看到關於這個的解釋、用法等。可以看到我們不是從 ...