| 英文術語 | 繁體中文譯名 | 定義與說明 |
|---|---|---|
| Clos | Clos 架構 | 一種多級網路架構,旨在優化頻寬資源分配。名稱源自其發明者 Charles Clos。 |
| ToR (Top of Rack) | 機櫃頂端交換器 | 位於機櫃頂部的交換器,伺服器在此處接入網路。 |
| Leaf | 枝葉交換器 | 通常也稱為 ToR 或 存取交換器 (Access Switch)。在 Spine-Leaf 或 Clos 拓撲中常用的稱呼。 |
| Exit-Leaf | 出口枝葉交換器 | 連接資料中心外部服務的 Leaf 交換器,包含防火牆、負載平衡器和網際網路路由器。 |
| Spine | 骨幹交換器 | 也稱為 匯聚交換器 (Aggregation)、列末交換器 (EoR) 或 分發交換器 (Distribution)。在 Spine-Leaf/Clos 拓撲中通稱為 Spine。 |
| Super-Spine | 超級骨幹交換器 | 有時稱為骨幹匯聚交換器或 資料中心核心交換器 (Core Switch)。通常用於三層式 Clos 架構中。 |
| MLAG | 跨機框鏈路聚合 | (Multi-Chassis Link Aggregation) 允許一對交換器以「雙活」(Active-Active) 模式達成備援,並在邏輯上呈現為單一台交換器。 |
| Peerlink | 對等鏈路 | 用於連接 MLAG 配對中兩台交換器的實體鏈路或聚合鏈路。 |
| ECMP | 等價多路徑路由 | (Equal-Cost Multi-Path) 允許在多條路由路徑之間進行流量負載分擔。 |
| Layer 3 Fabric | 三層網路架構 | 有時稱為「路由架構」(Routed Fabric)。Leaf 與 Spine 層之間採用 Layer 3 路由協議,並利用 ECMP 來提升整體頻寬。 |
| OOB | 帶外管理 | (Out of Band Management) 獨立於高速業務網路之外的低速管理網路(通常為 1Gbps 或更低),專用於基礎設施管理;亦指交換器上的 1G 管理介面。 |
| POD | 網路單元 / POD | 由網路、儲存與運算資源組成的模組化單元。POD 是一種可重複的設計模式,使資料中心更易於擴展與管理。 |
AI 數據中心的核心在於支撐大規模的並行運算與數據吞吐,主要由以下四個區塊組成:
| 模組名稱 | 功能描述 | 關鍵角色 |
|---|---|---|
| 運算節點 (Compute) | 負責處理輸入請求、模型訓練與深度學習。 | 需要多個節點(伺服器)協同工作。 |
| 網路架構 (Network) | 連結不同運算節點,確保低延遲的溝通。 | 支援並行運算 (Parallel Processing)。 |
| 儲存系統 (Storage) | 存放原始數據、訓練完成的模型以及生成的新數據。 | 必須具備高讀寫效能。 |
| 基礎支撐 (Infrastructure) | 提供營運所需的物理環境與安全防護。 | 包含電力、冷卻、安全性等。 |
四大網路綜合對比表
| 網路織網 (Fabric) | 核心目的 (Purpose) | 實作技術 (Implementation) | 關鍵設計特點與考量 (Design Features) |
|---|---|---|---|
| 運算網路 (Compute) | GPU 節點內與節點間通訊;AI 訓練與推論任務的骨幹 | InfiniBand;RoCE (RDMA over Converged Ethernet);NVLink Fabric | 極致超低延遲與超高吞吐量;具備高可靠的線性擴充性(增加伺服器時效能不遞減) |
| 儲存網路(Storage) | 連接運算節點與儲存設備;處理檔案系統 Checkpoints 與 I/O 流量 | InfiniBand;Ethernet RoCE(依設計可單獨或混合建置) | 每節點需達到 Multi-GB 的高吞吐量;必須與運算流量絕對隔離,避免搶佔頻寬 |
| 帶內管理(In-Band Mgmt) | 叢集管理、SSH、DNS、作業排程;存取外部代碼庫以安裝套件與修補程式 | 乙太網路 (Ethernet);物理拓撲:Leaf-Spine (葉脊網路);邏輯隔離:VLAN, VXLAN, EVPN | 中高頻寬需求(因應大型套件下載;強調通訊可靠性與邏輯上的流量隔離 |
| 帶外管理(Out-of-Band) | 遠端硬體控制(電源開關、虛擬主控台);當 OS 崩潰或帶內網路斷線時的終極救援 | 伺服器專用硬體(內建 BMC 或專用子卡);獨立的物理網口與低速交換器 | 必須保證 100% 隨時可用(Last Resort);頻寬要求低,但存取權限控管與安全性要求極高 |
| 比較特性 | 乙太網路 (Ethernet) | InfiniBand |
|---|---|---|
| 核心比喻 | 公用高速公路系統: 汽車、卡車、巴士都能上,但有紅綠燈與車流回堵問題。 | 新幹線/專用彈丸列車: 專屬軌道、極少停靠站、超高速,但只能走特定路線。 |
| 誕生背景 | 1970 年代(為了辦公室區域網路 LAN 而生,後成為全球網際網路標準)。 | 2000 年(專為超級電腦與高效能運算 HPC/AI 打造的利基技術)。 |
| 主要應用 | 通用網路、LAN、WAN、雲端計算、大眾網際網路。 | 高效能運算 (HPC)、AI 訓練叢集、高速儲存互聯(如 NVMe-oF)、資料中心。 |
| 傳輸速率 | 1 Gbps 至 400 Gbps+(兩者在頻寬上限上是不相上下的)。 | 10 Gbps 至 400 Gbps+(最新標準甚至邁向 800 Gbps)。 |
| 延遲表現 | 較高: 約 10 至 100 微秒 (Microseconds)。 | 極低: 僅 1 至 2 微秒,具備高度確定性 (Deterministic)。 |
| 協議棧與架構 | 傳統 TCP/IP 協議棧,資料傳輸需要驚動 CPU 進行多次封包拆解。 | RDMA (遠端直接記憶體存取),直接繞過作業系統與 CPU。 |
| 建置成本 | 低廉: 可使用商用現貨 (Commodity Hardware),維護生態系龐大。 | 高昂: 需要專用的晶片、交換器與硬體線材(如 QSFPs、光纖)。 |
| 軟硬體相容 | 宇宙級通用: 所有作業系統、驅動程式與網卡 (NIC) 原生支援。 | 專用生態: 需要專門的驅動程式與軟體堆疊(如 OFED 驅動)。 |
| 可靠性機制 | 可能丟包 (Lossy): 網路擁塞時靠 TCP 重新傳送,會造成 AI 訓練延遲。 | 硬體級無損 (Lossless): 透過基於信用的流控機制,確保封包絕不遺失。 |
| 比較維度 | NVLink / NVSwitch | RDMA (InfiniBand / RoCE) | NCCL (NVIDIA Collective Comm Library) |
|---|---|---|---|
| 本質屬性 | 硬體(實體線路與晶片) | 硬體技術與網路傳輸協議 | 軟體(核心通訊函式庫) |
| 通訊邊界 | 主機之內 (Within a Host);負責單台伺服器內多 GPU 的極速互聯。 | 跨主機之間 (Across Hosts);負責不同伺服器、機櫃節點間的互聯。 | 無界限 (全域掌控);同時負責主機內與跨主機的所有 GPU 通訊調度。 |
| 它扮演的角色 | 它是單機內部 GPU 之間的專屬高空超高速公路。 | 它是跨伺服器之間繞過 CPU 的跨海大橋快車道。 | 它是總指揮官。負責下令:「這批貨走內部的 NVLink,那批貨走外部的 RDMA 橋樑」。 |
| 開發者接觸度 | 開發者無法直接寫程式控制它,它是硬體層。 | 開發者無法直接寫程式控制它,它是網路層。 | 與高階框架整合(如 PyTorch/TensorFlow)。 開發者只要在軟體中呼叫高階分散式訓練指令,NCCL 就會自動啟動。 |