OpenAI uderza w wąskie gardła: Protokół MRC ma uratować superkomputery przed przestojami
Trenowanie modeli frontierowych przestało być wyłącznie problemem czystej mocy obliczeniowej – stało się koszmarem inżynierii sieciowej. Jeden spóźniony pakiet danych w klastrze wartym miliardy dolarów potrafi zamrozić tysiące procesorów GPU, generując gigantyczne straty finansowe i czasowe.
OpenAI, we współpracy z gigantami takimi jak AMD, Broadcom, Intel, Microsoft i NVIDIA, zaprezentowało MRC (Multipath Reliable Connection). To otwarty protokół, który ma zakończyć erę dominacji pojedynczych ścieżek przesyłu i uczynić superkomputery AI odpornymi na awarie, dotychczas paraliżujące całe procesy treningowe.
Koniec z czekaniem na pakiety
W tradycyjnej architekturze sieciowej awaria jednego przełącznika mogła oznaczać śmierć całego zadania treningowego (job), wymuszając restart z ostatniego punktu kontrolnego. MRC zmienia tę dynamikę, wprowadzając Intelligent Packet-Spray Load Balancing. Zamiast wysyłać dane jedną trasą, protokół „rozpyla” pakiety po setkach ścieżek jednocześnie.
Jeśli jedna z dróg zostanie zablokowana lub ulegnie awarii, sieć nie panikuje. MRC wykrywa problem w skali mikrosekund. To kluczowe, bo standardowe systemy potrzebowały na to sekund, a w świecie AI każda sekunda to tysiące dolarów wyrzuconych w błoto.
SRv6, czyli inteligencja na krawędzi
Najbardziej radykalną decyzją inżynierów OpenAI było przeniesienie inteligencji routingu z centrum sieci na jej obrzeża – bezpośrednio do kart sieciowych (NIC). Dzięki zastosowaniu SRv6 (Segment Routing over IPv6), przełączniki stają się „nieme” – jedynie ślepo wykonują instrukcje zakodowane w nagłówku pakietu.
To celowe uproszczenie eliminuje konflikty między dynamicznymi algorytmami routingu, zmniejszając opóźnienia i zużycie energii w centrach danych.
Architektura, która tnie koszty o miliony
MRC to nie tylko teoria – to brutalna matematyka oszczędności w skali makro. Dzieląc interfejsy 800Gb/s na mniejsze jednostki, OpenAI stworzyło sieć multi-plane, która pozwala połączyć 131 000 układów GPU przy użyciu zaledwie dwóch warstw przełączników.
- Dwie trzecie mniej optyki w porównaniu do tradycyjnych sieci trójwarstwowych.
- Trzy piąte mniejsza liczba przełączników potrzebnych do obsługi tej samej mocy.
- Znacznie mniejszy blast radius, czyli zasięg rażenia w przypadku awarii pojedynczego komponentu.
Mniej warstw oznacza krótszą drogę dla danych – w MRC najdłuższa trasa pokonuje tylko trzy przełączniki zamiast siedmiu. To redukuje tzw. opóźnienia ogonowe (tail latency), które są cichym zabójcą wydajności w wielkich klastrach.
Sprzęt gotowy na nową erę
Protokół nie jest melodią przyszłości – on już pracuje. MRC napędza superkomputery NVIDIA GB200 wykorzystywane przez OpenAI do trenowania modeli z rodziny ChatGPT. Rozwiązanie jest wspierane przez topowy sprzęt:
- Karty sieciowe: NVIDIA ConnectX-8, AMD Pollara oraz Broadcom Thor Ultra.
- Przełączniki: NVIDIA Spectrum-4/5 oraz Broadcom Tomahawk 5.
OpenAI udowadnia, że kluczem do AGI nie jest tylko krzem, ale przede wszystkim spoiwo, które go łączy. Udostępnienie specyfikacji przez Open Compute Project (OCP) to jasny sygnał: OpenAI chce, by ich standard stał się nowym Ethernetem ery sztucznej inteligencji, cementując ich dominację nad infrastrukturą, na której buduje się cały świat.
