iT邦幫忙

2026 iThome 鐵人賽

DAY 3
0

Data Center 網路專有名詞

英文術語 繁體中文譯名 定義與說明
Clos Clos 架構 一種多級網路架構,旨在優化頻寬資源分配。名稱源自其發明者 Charles Clos。
ToR (Top of Rack) 機櫃頂端交換器 位於機櫃頂部的交換器,伺服器在此處接入網路。
Leaf 枝葉交換器 通常也稱為 ToR 或 存取交換器 (Access Switch)。在 Spine-Leaf 或 Clos 拓撲中常用的稱呼。
Exit-Leaf 出口枝葉交換器 連接資料中心外部服務的 Leaf 交換器,包含防火牆、負載平衡器和網際網路路由器。
Spine 骨幹交換器 也稱為 匯聚交換器 (Aggregation)列末交換器 (EoR)分發交換器 (Distribution)。在 Spine-Leaf/Clos 拓撲中通稱為 Spine。
Super-Spine 超級骨幹交換器 有時稱為骨幹匯聚交換器或 資料中心核心交換器 (Core Switch)。通常用於三層式 Clos 架構中。
MLAG 跨機框鏈路聚合 (Multi-Chassis Link Aggregation) 允許一對交換器以「雙活」(Active-Active) 模式達成備援,並在邏輯上呈現為單一台交換器。
Peerlink 對等鏈路 用於連接 MLAG 配對中兩台交換器的實體鏈路或聚合鏈路。
ECMP 等價多路徑路由 (Equal-Cost Multi-Path) 允許在多條路由路徑之間進行流量負載分擔。
Layer 3 Fabric 三層網路架構 有時稱為「路由架構」(Routed Fabric)。Leaf 與 Spine 層之間採用 Layer 3 路由協議,並利用 ECMP 來提升整體頻寬。
OOB 帶外管理 (Out of Band Management) 獨立於高速業務網路之外的低速管理網路(通常為 1Gbps 或更低),專用於基礎設施管理;亦指交換器上的 1G 管理介面。
POD 網路單元 / POD 由網路、儲存與運算資源組成的模組化單元。POD 是一種可重複的設計模式,使資料中心更易於擴展與管理。

AI 數據中心的四大核心模組

AI 數據中心的核心在於支撐大規模的並行運算與數據吞吐,主要由以下四個區塊組成:

模組名稱 功能描述 關鍵角色
運算節點 (Compute) 負責處理輸入請求、模型訓練與深度學習。 需要多個節點(伺服器)協同工作。
網路架構 (Network) 連結不同運算節點,確保低延遲的溝通。 支援並行運算 (Parallel Processing)。
儲存系統 (Storage) 存放原始數據、訓練完成的模型以及生成的新數據。 必須具備高讀寫效能。
基礎支撐 (Infrastructure) 提供營運所需的物理環境與安全防護。 包含電力、冷卻、安全性等。

Network Fabric

四大網路綜合對比表

網路織網 (Fabric) 核心目的 (Purpose) 實作技術 (Implementation) 關鍵設計特點與考量 (Design Features)
運算網路 (Compute) GPU 節點內與節點間通訊;AI 訓練與推論任務的骨幹 InfiniBand;RoCE (RDMA over Converged Ethernet);NVLink Fabric 極致超低延遲與超高吞吐量;具備高可靠的線性擴充性(增加伺服器時效能不遞減)
儲存網路(Storage) 連接運算節點與儲存設備;處理檔案系統 Checkpoints 與 I/O 流量 InfiniBand;Ethernet RoCE(依設計可單獨或混合建置) 每節點需達到 Multi-GB 的高吞吐量;必須與運算流量絕對隔離,避免搶佔頻寬
帶內管理(In-Band Mgmt) 叢集管理、SSH、DNS、作業排程;存取外部代碼庫以安裝套件與修補程式 乙太網路 (Ethernet);物理拓撲:Leaf-Spine (葉脊網路);邏輯隔離:VLAN, VXLAN, EVPN 中高頻寬需求(因應大型套件下載;強調通訊可靠性與邏輯上的流量隔離
帶外管理(Out-of-Band) 遠端硬體控制(電源開關、虛擬主控台);當 OS 崩潰或帶內網路斷線時的終極救援 伺服器專用硬體(內建 BMC 或專用子卡);獨立的物理網口與低速交換器 必須保證 100% 隨時可用(Last Resort);頻寬要求低,但存取權限控管與安全性要求極高

Ethernet vs InfiniBand

比較特性 乙太網路 (Ethernet) InfiniBand
核心比喻 公用高速公路系統: 汽車、卡車、巴士都能上,但有紅綠燈與車流回堵問題。 新幹線/專用彈丸列車: 專屬軌道、極少停靠站、超高速,但只能走特定路線。
誕生背景 1970 年代(為了辦公室區域網路 LAN 而生,後成為全球網際網路標準)。 2000 年(專為超級電腦與高效能運算 HPC/AI 打造的利基技術)。
主要應用 通用網路、LAN、WAN、雲端計算、大眾網際網路。 高效能運算 (HPC)、AI 訓練叢集、高速儲存互聯(如 NVMe-oF)、資料中心。
傳輸速率 1 Gbps 至 400 Gbps+(兩者在頻寬上限上是不相上下的)。 10 Gbps 至 400 Gbps+(最新標準甚至邁向 800 Gbps)。
延遲表現 較高: 約 10 至 100 微秒 (Microseconds)。 極低: 僅 1 至 2 微秒,具備高度確定性 (Deterministic)。
協議棧與架構 傳統 TCP/IP 協議棧,資料傳輸需要驚動 CPU 進行多次封包拆解。 RDMA (遠端直接記憶體存取),直接繞過作業系統與 CPU。
建置成本 低廉: 可使用商用現貨 (Commodity Hardware),維護生態系龐大。 高昂: 需要專用的晶片、交換器與硬體線材(如 QSFPs、光纖)。
軟硬體相容 宇宙級通用: 所有作業系統、驅動程式與網卡 (NIC) 原生支援。 專用生態: 需要專門的驅動程式與軟體堆疊(如 OFED 驅動)。
可靠性機制 可能丟包 (Lossy): 網路擁塞時靠 TCP 重新傳送,會造成 AI 訓練延遲。 硬體級無損 (Lossless): 透過基於信用的流控機制,確保封包絕不遺失。

NVLink、RDMA 與 NCCL

比較維度 NVLink / NVSwitch RDMA (InfiniBand / RoCE) NCCL (NVIDIA Collective Comm Library)
本質屬性 硬體(實體線路與晶片) 硬體技術與網路傳輸協議 軟體(核心通訊函式庫)
通訊邊界 主機之內 (Within a Host);負責單台伺服器內多 GPU 的極速互聯。 跨主機之間 (Across Hosts);負責不同伺服器、機櫃節點間的互聯。 無界限 (全域掌控);同時負責主機內與跨主機的所有 GPU 通訊調度。
它扮演的角色 它是單機內部 GPU 之間的專屬高空超高速公路 它是跨伺服器之間繞過 CPU 的跨海大橋快車道 它是總指揮官。負責下令:「這批貨走內部的 NVLink,那批貨走外部的 RDMA 橋樑」。
開發者接觸度 開發者無法直接寫程式控制它,它是硬體層。 開發者無法直接寫程式控制它,它是網路層。 與高階框架整合(如 PyTorch/TensorFlow)。 開發者只要在軟體中呼叫高階分散式訓練指令,NCCL 就會自動啟動。

上一篇
Cumulus OS - NVUE
下一篇
IP Address
系列文
ToR 的復仇-頂架也能跑馬拉松6
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言