Hardware

Cerebras CS-4: Walka o dominację w centrach danych poprzez surową moc i efektywne chłodzenie

Cerebras Systems nie zwalnia tempa w wyścigu o miano dostawcy najszybszej infrastruktury do obliczeń AI. Nowo zaprezentowany model CS-4 to rozwiązanie typu rack-scale, które integruje jednostki obliczeniowe, systemy zasilania oraz chłodzenia w ramach jednej, gotowej do pracy szafy serwerowej. Choć sercem urządzenia pozostaje znany z poprzedniej generacji 5-nanometrowy układ WSE-3, inżynierom udało się wycisnąć z niego znacznie więcej, koncentrując się na aspektach fizycznej infrastruktury, a nie na samej litografii.

Dlaczego to ważne teraz?

Premiera CS-4 przypada na moment, w którym giganci technologiczni szukają alternatyw dla zdominowanego przez Nvidię rynku GPU. Nowy system Cerebras CS-4 stawia na drastyczne zwiększenie mocy obliczeniowej bez czekania na nową generację chipów. Zamiast tego firma upchnęła trzy układy WSE-3 Turbo w jednej szafie serwerowej, co pozwala na osiągnięcie zawrotnej mocy 750 PFLOPs mocy obliczeniowej AI oraz przepustowości I/O na poziomie 7,2 Tb/s.

Architektura oparta na skali

Kluczem do dwukrotnego wzrostu wydajności względem modelu CS-3 jest zwiększenie zagęszczenia komponentów oraz podniesienie taktowania zegarów. W pojedynczej szafie CS-4 mieszczą się teraz trzy wafle krzemowe zamiast dwóch, co bezpośrednio przekłada się na moc obliczeniową. CEO firmy, Andrew Feldman, deklaruje, że „system ma generować do 4 400 tokenów na sekundę na użytkownika” w przypadku modelu GPT-OSS-120B. Według zapewnień producenta, stawia to CS-4 w pozycji rozwiązania nawet 30-krotnie szybszego od klastrów bazujących na procesorach graficznych Nvidii, przy jednoczesnym skróceniu opóźnienia między waferami do zaledwie 2 mikrosekund.

Modułowość i krytyczne spojrzenie

Nowa konstrukcja wprowadza system „Backpack” – modułową architekturę ułatwiającą montaż i serwisowanie. Cerebras stawia również na współpracę z partnerami takimi jak AMD czy AWS (w ramach jednostek Trainium), co ma wspomóc proces rozproszonej inferencji. Mimo imponujących liczb, analitycy z SemiAnalysis zachowują powściągliwość, wskazując, że zysk w obszarze przepustowości sieciowej jest relatywnie niewielki. Pokazuje to, że walka o wydajność w świecie AI coraz częściej sprowadza się do walki z temperaturą i ograniczeniami w dostawie energii, a nie tylko do projektowania coraz gęstszych tranzystorów.

Sprzęt od Cerebras cieszy się już uznaniem liderów branży, znajdując zastosowanie m.in. w projektach OpenAI, takich jak Codex Spark. Więcej szczegółów technicznych dotyczących nowej jednostki ma zostać ujawnionych podczas nadchodzącej konferencji Hot Chips, gdzie branża będzie mogła zweryfikować realny wpływ nowej architektury na rynek wielkich modeli językowych.