Najlepszy model AI wybrał właściwe działanie dla drona w 52 proc. przypadków. Każdy z 29 traci jednak na świeżych pytaniach
W 52 procentach przypadków najlepszy z 29 przetestowanych modeli wybrał właściwe działanie dla drona. Taki wynik uzyskał GPT-5.3 Chat na 500 pytaniach, których wcześniej nie widział. Pozostałe modele wypadły gorzej, a żaden nie osiągnął poziomu, który pozwalałby powierzyć mu decyzje w trakcie misji. Benchmark PhysAI-Bench opublikował zespół z UAE University, Khalifa University i Technology Innovation Institute.
Podstawą testu jest 10 178 punktów decyzyjnych wyciągniętych z rzeczywistych tras lotów bezzałogowców. Każdy przypadek obejmował cele misji, ograniczenia fizyczne, dane z czujników, wywołania narzędzi oraz symulowane warunki sieci 6G: opóźnienia i utratę pakietów. Chodziło o to, żeby model widział dokładnie to, co widziałby pokładowy system drona. W testach sprawdzono modele z 14 organizacji, w tym OpenAI, Anthropic, Google, Meta i xAI.
Za GPT-5.3 Chat uplasowały się GPT-5.2 Chat (49,40 proc.) i xAI Grok 4.5 (49,07 proc.). Same wyniki nie oddają jednak najważniejszego wniosku z badania.
Gorzej tam, gdzie najbardziej potrzeba pewności
Każdy z 29 modeli wypadł słabiej na zbiorze testowym niż na mniejszym zbiorze deweloperskim, na którym strojono jego parametry. Spadki wynosiły od około 2 do 26 punktów procentowych. Modele radzą sobie zatem dobrze z pytaniami z rozkładu, który znają, ale tracą skuteczność w sytuacjach spoza niego, czyli dokładnie tam, gdzie autonomiczny dron najbardziej potrzebuje przewidywalności.
52 procent na pytaniach widzianych pierwszy raz autorzy uznają za wynik niewystarczający do podejmowania autonomicznych decyzji w trakcie misji. To nie znaczy, że modele nie nadają się do pracy z dronami. Znaczy, że nie są gotowe przejmować decyzje bez nadzoru.
Rozmiar nie przesądza o jakości decyzji
Liczba parametrów nie przekładała się wprost na skuteczność. Mniejsze modele o otwartych wagach, jak Mistral Small 2603 czy modele z rodziny Nous Hermes, dorównywały większym modelom frontier lub je wyprzedzały, działając przy tym szybciej. Autorzy nie traktują tego jako dowodu gotowości tych modeli do pracy w dronach, a jedynie jako sygnał, że rozmiar modelu nie jest dobrym predyktorem jakości decyzji w tym zadaniu.
Osobny problem to format odpowiedzi. Modele z rodziny NVIDIA Nemotron wypadły słabo głównie dlatego, że nie potrafiły zwrócić decyzji w wymaganym formacie; skuteczność parsowania spadała w niektórych testach do 14 procent. To kłopot nie z samym rozumowaniem, lecz z elementarną współpracą z systemem, który ma tę odpowiedź odebrać.
Wyniki badania opublikowano na arXiv, a schemat benchmarku udostępniono na GitHubie.
