Mit ośmiu miesięcy: amerykański rząd twierdzi, że chińskie AI zostaje w tyle, ale dane mówią co innego
Statystyka kontra rzeczywistość
Amerykański Center for AI Standards and Innovation (CAISI) wydał wyrok: chińskie AI jest spóźnione o osiem miesięcy, a dystans do liderów z Doliny Krzemowej rzekomo rośnie. Brzmi to jak uspokajający komunikat dla Pentagonu, ale rzut oka na metodologię raportu zamienia ten pewnik w serię niewygodnych pytań.
CAISI, jednostka podległa NIST, oparła swoją ocenę modelu DeepSeek V4 Pro na autorskim systemie punktacji Item Response Theory (IRT). Zamiast wyciągać prostą średnią, algorytm waży trudność zadań. Wynik? GPT-5.5 dominuje z 1260 punktami, podczas gdy chiński flagowiec utknął na poziomie 800 punktów. To umieszcza go bliżej okrojonych wersji „mini” niż potężnych modeli Claude czy topowych edycji OpenAI.
Gdzie zniknęły dowody?
Problem polega na tym, że wyników CAISI nie da się zweryfikować.
Kluczowe różnice w wydajności objawiły się w dwóch niepublicznych benchmarkach, do których dostęp ma wyłącznie Instytut. Podczas gdy na ogólnodostępnym teście GPQA-Diamond DeepSeek dzieli zaledwie jeden punkt procentowy od lidera rynku (90% kontra 91%), w tajnych testach cyberbezpieczeństwa model z Chin miał zdobyć zaledwie 32% punktów przy 71% uzyskanych przez GPT-5.5.
Filtracja dla wygody
Przy porównaniu kosztów CAISI zastosowało agresywną filtrację: odrzucono wszystkie amerykańskie modele, które były droższe lub słabsze od DeepSeek. Na placu boju pozostał jedynie GPT-5.4 mini. Nawet w tak ustawionym pojedynku chiński model okazał się tańszy w 5 z 7 kategorii testowych.
To asymetria, która budzi sceptycyzm ekspertów.
Niezależni analitycy, w tym anonimowy badacz Ex0bit, wskazują na prosty fakt: branża jest „trollowana” przy każdej zamkniętej premierze z USA, podczas gdy chińskie modele typu open-weights oferują realną moc obliczeniową dostępną dla każdego. Mit ogromnej luki technologicznej pęka w zderzeniu z danymi Stanford AI Index 2026.
Krok w stronę paraliżu
- Różnica wydajności na liście LMSYS Arena spadła do rekordowych 2,7%.
- DeepSeek V4 Pro osiąga 97% w olimpijskich testach matematycznych.
- W rozwiązywaniu realnych błędów z GitHub (SWE-bench) różnica wynosi zaledwie 7 punktów procentowych.
Dystans się kurczy, nie rośnie.
Choć amerykańscy urzędnicy upierają się przy narracji o „bezpiecznej przewadze”, dane z rynku kryptowalut i nastroje w hubach technologicznych sugerują coś odwrotnego. W świecie AI osiem miesięcy to wieczność, ale przy obecnym tempie kopiowania architektur, te osiem miesięcy może wkrótce stać się błędem statystycznym w oficjalnych raportach.
