Medyczny test prawdy: GPT-5.5 Instant wygrywa z lekarzami w precyzji diagnoz
Lekarze rzadziej mylą się w diagnozach niż sztuczna inteligencja? Ta teza właśnie upadła. Najnowszy model OpenAI, GPT-5.5 Instant, w testach celności odpowiedzi zostawił doświadczonych medyków w tyle, drastycznie ograniczając liczbę błędnych informacji przekazywanych pacjentom. Technologia trafiła już do darmowej wersji ChatGPT, co otwiera nowy rozdział w cyfrowym samoleczeniu milionów ludzi.
Dlaczego to ważne właśnie teraz? OpenAI twierdzi, że model wyraźnie ogranicza halucynacje w obszarach wysokiego ryzyka, takich jak medycyna, prawo i finanse. Wzmacnia to debatę o tym, czy chatboty stają się realnym narzędziem do wstępnej selekcji pacjentów i przygotowania do wizyt, czy nadal wymagają ścisłej kontroli specjalistów. Jak podaje OpenAI: „Instant jest teraz bardziej godny zaufania, z istotną poprawą rzeczowości i największymi zyskami w dziedzinach, gdzie dokładność ma największe znaczenie”.
Sztuczna inteligencja skuteczniejsza od specjalistów?
Dane porównawcze są bezlitosne. W wewnętrznych testach GPT-5.5 Instant uzyskał wyższe noty od lekarzy pod kątem trafności, klarowności wypowiedzi oraz kompletności informacji. Skala postępu jest mierzalna – w zadaniach wysokiego ryzyka model generuje o 52,5% mniej zmyślonych twierdzeń niż jego poprzednik, wersja 5.3. W teście AIME 2026 algorytm osiągnął wynik 81,2%, co potwierdza jego zdolność do radzenia sobie z najbardziej złożonymi problemami logicznymi.
Liczba błędnych stwierdzeń dotyczących zdrowia spadła o 71% w ciągu zaledwie dwóch miesięcy. Model osiąga obecnie blisko 90-procentową skuteczność w precyzyjnym podążaniu za instrukcjami, wyprzedzając w rankingach nie tylko GPT-4o, ale i odpowiedzi redagowane ręcznie przez ekspertów medycznych. W trudnych rozmowach, które wcześniej użytkownicy zgłaszali jako błędne, nowy silnik redukuje nieprawidłowości o ponad 37%.
Globalna sieć weryfikacji
Za wynikami stoi tytaniczna praca ludzi. OpenAI zaangażowało sieć ponad 260 lekarzy z 60 krajów, którzy sprawdzili ponad 700 tysięcy odpowiedzi wygenerowanych przez model. Ta rygorystyczna weryfikacja pozwoliła na eliminację halucynacji i dostosowanie tonu wypowiedzi do potrzeb pacjentów.
Skala zjawiska jest ogromna – co tydzień około 230 milionów ludzi analizuje w ChatGPT wyniki badań laboratoryjnych czy zawiłości ubezpieczeniowe. Choć firma promuje narzędzia takie jak ChatGPT for Clinicians, nowa aktualizacja pokazuje, że granica między profesjonalnym wsparciem a darmowym asystentem AI staje się coraz cieńsza. Model zdobył 85,6% w benchmarku GPQA, co udowadnia, że radzi sobie z wiedzą na poziomie eksperckim lepiej niż większość dostępnych na rynku rozwiązań.
