KI

Diese Kategorie behandelt die Netzwerkinfrastruktur von KI-Trainings- und Inferenz-Clustern – nicht KI-Modelle oder Anwendungen.

Ein GPU-Cluster nutzt drei Netze: die Scale-up-Fabric zwischen den Beschleunigern eines Pods (NVLink, UALink), die Scale-out-Fabric zwischen Servern und Pods (InfiniBand, RoCEv2, Ultra Ethernet) und ein Frontend-Netz für Storage und Management.

Die Artikel erklären die RDMA-Transporte, die Verfahren für verlustfreies Ethernet (PFC, ECN, DCQCN), die Topologien und die Standards der beteiligten Gremien IBTA, UEC und UALink-Konsortium.

Erstellt: · Überarbeitet: