Scale-out-Fabric

Die Scale-out-Fabric verbindet Server und Pods eines KI-Clusters über RDMA. Genutzte Transporte sind InfiniBand, RoCEv2 und Ultra Ethernet.

Einordnung

KI-Cluster trennen zwei Netze: Die Scale-out-Fabric verbindet Server und Pods untereinander für verteiltes Training. Die Scale-up-Fabric koppelt darunter die GPUs innerhalb eines Pods mit Speichersemantik. Daneben existiert das Frontend-Netz für Storage, Orchestrierung und Management, das keine besonderen Anforderungen stellt.

Die Scale-out-Fabric wird auch Backend-, Compute- oder East-West-Netz genannt. Sie ist vom Frontend-Netz physisch getrennt und nutzt eigene Netzwerkkarten – typischerweise eine pro GPU mit 400 oder 800 Gb/s.

Verkehrsmuster

Zwischen Pods kommen Datenparallelismus und Pipeline-Parallelismus zum Einsatz. Ihre Kollektivoperationen (All-Reduce, All-Gather, Reduce-Scatter) tauschen große Nachrichten in festen Mustern aus, meist zwischen GPUs mit gleicher Position in verschiedenen Servern. Der Verkehr ist synchron: Alle Teilnehmer warten auf den langsamsten, sodass die Tail-Latenz einzelner Verbindungen den gesamten Trainingsschritt bestimmt. Daraus folgen die Anforderungen: verlustfreie oder verlustverträgliche Übertragung, gleichmäßige Auslastung aller Pfade, Vermeidung von Incast an den Empfängern.

Transport

Die Wahl des RDMA-Transports ist die zentrale Architekturentscheidung der Scale-out-Fabric:

  • InfiniBand: eigener Stack mit eingebauter Verlustfreiheit und zentralem Subnet Manager; ein Hersteller.
  • RoCEv2: RDMA über UDP/IP auf Ethernet; verlangt PFC, ECN und DCQCN; mehrere Hersteller.
  • Ultra Ethernet: neuer Transport über UDP/IP mit Packet Spraying und selektiver Neuübertragung; seit 2025 spezifiziert.

Alle drei nutzen dieselbe Fat-Tree-Topologie, für GPU-Cluster meist in Rail-optimized-Ausprägung. Die Topologie ist vom Transport unabhängig.

Abgrenzung

Scale-upScale-out
ReichweiteServer, Rack, PodCluster, Rechenzentrum
Endpunktebis ~1.000bis >100.000
SemantikLoad/Store, AtomicsRDMA-Nachrichten
Bandbreite pro GPU7–15 Tb/s (NVLink 4: 900 GB/s, NVLink 5: 1,8 TB/s, jeweils bidirektional)400–800 Gb/s pro NIC
Latenz< 1 µswenige µs
TechnikNVLink, Infinity Fabric, UALinkInfiniBand, RoCEv2, Ultra Ethernet
StandardisierungUALink Consortium, OCP ESUNIBTA, UEC

Die Werte sind Größenordnungen aus aktuellen Systemen, keine Spezifikationsgrenzen. NVLink-Angaben sind Herstellerwerte in Byte; zur Vergleichbarkeit in Bit umgerechnet.

Normen und Quellen

  • IBTA: InfiniBand Architecture Specification Vol. 1, Release 1.8 (2024)
  • Ultra Ethernet Consortium: Ultra Ethernet Specification 1.0.2 (2026)
  • Gangidi et al.: RDMA over Ethernet for Distributed AI Training at Meta Scale, SIGCOMM 2024 (Backend/Frontend-Trennung in der Praxis)
  • NVIDIA: DGX SuperPOD Reference Architecture, docs.nvidia.com

Erstellt: