Przełom w sieciach AI: OpenAI i giganci sprzętowi prezentują protokół MRC
Multipath Reliable Connection: Koniec zatorów w sercu infrastruktury
Współczesne szkolenie modeli generatywnych to nie tylko kwestia surowej mocy obliczeniowej procesorów graficznych, ale przede wszystkim sprawności ich komunikacji. OpenAI, we współpracy z konsorcjum obejmującym AMD, Broadcom, Intel, Microsoft oraz NVIDIĘ, ogłosiło powstanie protokołu Multipath Reliable Connection (MRC), który ma szansę zrewolucjonizować architekturę sieciową w centrach danych. Rozwiązanie to uderza bezpośrednio w największą bolączkę klastrów obliczeniowych: nieprzewidywalność transferów danych i wysoką podatność na awarie pojedynczych komponentów.
Tradycyjne sieci Ethernet, na których opiera się dzisiejsza chmura, często zawodzą w obliczu synchronicznych zadań AI, gdzie opóźnienie jednego pakietu potrafi wstrzymać pracę tysięcy jednostek. Protokół MRC zmienia paradygmat przesyłu – zamiast polegać na jednej ścieżce, rozprasza pakiety danych jednocześnie na setki tras. Dzięki temu zjawisko kongestii w rdzeniu sieci zostaje drastycznie ograniczone, a przepustowość staje się bardziej przewidywalna.
Odporność mierzona w mikrosekundach
Największą przewagą MRC nad dotychczasowymi standardami jest czas reakcji na błędy infrastruktury. O ile konwencjonalne tkaniny sieciowe potrzebują sekund, a czasem nawet dziesiątek sekund na stabilizację po awarii przełącznika, o tyle MRC potrafi wykryć problem i przekierować ruch w skali mikrosekund. W praktyce oznacza to, że proces szkolenia modelu nie zostaje przerwany nawet podczas krytycznych awarii sprzętowych czy planowanych prac konserwacyjnych.
Skuteczność tej technologii została już przetestowana w warunkach bojowych. OpenAI wdrożyło MRC w swoich najbardziej zaawansowanych klastrach opartych na systemach NVIDIA GB200, w tym w ośrodkach Microsoft Fairwater oraz Oracle Cloud Infrastructure w Teksasie. Podczas prac nad nowymi modelami dla ChatGPT inżynierowie byli w stanie zrestartować cztery kluczowe przełączniki pierwszego poziomu bez konieczności przerywania procesów obliczeniowych, co wcześniej byłoby niemożliwe bez ryzyka utraty postępów.
Mniej sprzętu, większa wydajność
Zastosowanie MRC niesie ze sobą również wymierne korzyści ekonomiczne i energetyczne. Nowa architektura „multi-plane” pozwala na połączenie ponad 100 000 procesorów GPU przy użyciu zaledwie dwóch warstw przełączników Ethernet. Standardowe rozwiązania przy prędkościach 800 Gb/s wymagają zazwyczaj trzech lub czterech poziomów hierarchii sieciowej. Redukcja liczby aktywnych komponentów przekłada się bezpośrednio na niższe zużycie energii oraz mniejszą liczbę punktów potencjalnej awarii.
Specyfikacja protokołu została oficjalnie przekazana do Open Compute Project (OCP), co sugeruje, że ma on stać się otwartym standardem dla całej branży. Współpraca tradycyjnych rywali, jak Intel, AMD i NVIDIA, nad jednym projektem infrastrukturalnym pokazuje, jak krytycznym wyzwaniem był dotychczas networking w skali eksaskalowej.
