Scale-out-Fabric
Die Scale-out-Fabric verbindet Server und Pods eines KI-Clusters über RDMA. Genutzte Transporte sind InfiniBand, RoCEv2 und Ultra Ethernet.
Einordnung
KI-Cluster trennen zwei Netze: Die Scale-out-Fabric verbindet Server und Pods untereinander für verteiltes Training. Die Scale-up-Fabric koppelt darunter die GPUs innerhalb eines Pods mit Speichersemantik. Daneben existiert das Frontend-Netz für Storage, Orchestrierung und Management, das keine besonderen Anforderungen stellt.
Die Scale-out-Fabric wird auch Backend-, Compute- oder East-West-Netz genannt. Sie ist vom Frontend-Netz physisch getrennt und nutzt eigene Netzwerkkarten – typischerweise eine pro GPU mit 400 oder 800 Gb/s.
Verkehrsmuster
Zwischen Pods kommen Datenparallelismus und Pipeline-Parallelismus zum Einsatz. Ihre Kollektivoperationen (All-Reduce, All-Gather, Reduce-Scatter) tauschen große Nachrichten in festen Mustern aus, meist zwischen GPUs mit gleicher Position in verschiedenen Servern. Der Verkehr ist synchron: Alle Teilnehmer warten auf den langsamsten, sodass die Tail-Latenz einzelner Verbindungen den gesamten Trainingsschritt bestimmt. Daraus folgen die Anforderungen: verlustfreie oder verlustverträgliche Übertragung, gleichmäßige Auslastung aller Pfade, Vermeidung von Incast an den Empfängern.
Transport
Die Wahl des RDMA-Transports ist die zentrale Architekturentscheidung der Scale-out-Fabric:
- InfiniBand: eigener Stack mit eingebauter Verlustfreiheit und zentralem Subnet Manager; ein Hersteller.
- RoCEv2: RDMA über UDP/IP auf Ethernet; verlangt PFC, ECN und DCQCN; mehrere Hersteller.
- Ultra Ethernet: neuer Transport über UDP/IP mit Packet Spraying und selektiver Neuübertragung; seit 2025 spezifiziert.
Alle drei nutzen dieselbe Fat-Tree-Topologie, für GPU-Cluster meist in Rail-optimized-Ausprägung. Die Topologie ist vom Transport unabhängig.
Abgrenzung
| Scale-up | Scale-out | |||
|---|---|---|---|---|
| Reichweite | Server, Rack, Pod | Cluster, Rechenzentrum | ||
| Endpunkte | bis ~1.000 | bis >100.000 | ||
| Semantik | Load/Store, Atomics | RDMA-Nachrichten | ||
| Bandbreite pro GPU | 7–15 Tb/s (NVLink 4: 900 GB/s, NVLink 5: 1,8 TB/s, jeweils bidirektional) | 400–800 Gb/s pro NIC | ||
| Latenz | < 1 µs | wenige µs | ||
| Technik | NVLink, Infinity Fabric, UALink | InfiniBand, RoCEv2, Ultra Ethernet | ||
| Standardisierung | UALink Consortium, OCP ESUN | IBTA, UEC |
Die Werte sind Größenordnungen aus aktuellen Systemen, keine Spezifikationsgrenzen. NVLink-Angaben sind Herstellerwerte in Byte; zur Vergleichbarkeit in Bit umgerechnet.
Normen und Quellen
- IBTA: InfiniBand Architecture Specification Vol. 1, Release 1.8 (2024)
- Ultra Ethernet Consortium: Ultra Ethernet Specification 1.0.2 (2026)
- Gangidi et al.: RDMA over Ethernet for Distributed AI Training at Meta Scale, SIGCOMM 2024 (Backend/Frontend-Trennung in der Praxis)
- NVIDIA: DGX SuperPOD Reference Architecture, docs.nvidia.com