R & D

Nowy paradygmat w działaniu AI: wyjście poza język i obraz

Współczesna sztuczna inteligencja, choć imponująca w swoich osiągnięciach, jest wciąż w dużej mierze ograniczona przez sposób, w jaki przetwarza dane. Zazwyczaj skupia się na jednym typie informacji, najczęściej obrazach lub tekście. Jednak prawdziwy świat jest znacznie bardziej złożony i wymaga integracji różnorodnych źródeł danych. W odpowiedzi na to wyzwanie, badacze z Uniwersytetu w Sheffield oraz The Alan Turing Institute przedstawili nowy „plan działania” dla rozwoju multimodalnej AI, który ma zrewolucjonizować jej zastosowania.

Opublikowane w prestiżowym czasopiśmie Nature Machine Intelligence, ramy te stanowią kompleksowy przewodnik po tworzeniu i wdrażaniu systemów AI, które uczą się z wielu rodzajów danych jednocześnie – od tekstu i obrazu, przez dźwięk, aż po odczyty z sensorów. Celem jest nie tylko zwiększenie praktyczności i efektywności AI, ale także zapewnienie jej etycznego i odpowiedzialnego wykorzystania w rozwiązywaniu realnych problemów.

Wyjście poza wizję i język

Mimo postępów w dziedzinie multimodalnej AI, analizy pokazują, że większość istniejących systemów i badań nadal koncentruje się głównie na danych wizualnych i językowych. To ograniczenie, jak podkreślają badacze, znacząco hamuje potencjał AI w radzeniu sobie z bardziej skomplikowanymi wyzwaniami wymagającymi szerszego spektrum informacji. Na przykład, autonomiczne samochody mogłyby działać bezpieczniej w złożonych warunkach drogowych, gdyby integrowały dane wizualne z odczytami z czujników i informacjami o środowisku. Podobnie, diagnozowanie chorób i odkrywanie leków stałoby się precyzyjniejsze dzięki łączeniu danych medycznych, klinicznych i genomicznych.

Ta dominacja wizji i języka jest ewidentna w statystykach: badacze odkryli, że w 2024 roku, aż 88,9% prac opublikowanych na arXiv, które dotyczyły AI opierającej się na dokładnie dwóch typach danych, wykorzystywało dane wizualne lub językowe. Skłania to do refleksji nad potrzebą szerszej perspektywy w rozwoju AI.

Praktyczne zastosowania i przyszłe wyzwania

Profesor Haiping Lu z Uniwersytetu w Sheffield, lider badania, zaznacza: „AI poczyniła ogromne postępy w dziedzinie widzenia i języka, ale prawdziwy świat jest znacznie bogatszy i bardziej złożony. Aby sprostać globalnym wyzwaniom, takim jak pandemie, zrównoważona energia czy zmiany klimatyczne, potrzebujemy multimodalnej AI, która integruje szersze typy danych i ekspertyzy”.

Nowe ramy, opracowane przy udziale 48 ekspertów z 22 instytucji na całym świecie, ilustrują swoje podejście poprzez trzy kluczowe przypadki użycia: reagowanie na pandemie, projektowanie autonomicznych samochodów i adaptację do zmian klimatycznych. Pokazuje to, jak wszechstronne zastosowanie może mieć AI, gdy wyjdzie poza tradycyjne schematy.

Dr Louisa van Zeeland z The Alan Turing Institute podkreśla, że integracja i modelowanie dużych, różnorodnych zbiorów danych poprzez multimodalną AI ustanawia nowy standard dla prognoz środowiskowych. „To wyrafinowane podejście umożliwia nam generowanie prognoz na różnych skalach przestrzennych i czasowych, co przynosi realne rezultaty w obszarach od ochrony Arktyki po odporność rolnictwa” – dodaje.

Inicjatywa z Sheffield i The Alan Turing Institute stanowi kluczowy krok w kierunku stworzenia sztucznej inteligencji, która jest nie tylko zaawansowana technologicznie, ale także faktycznie użyteczna i godna zaufania w obliczu najbardziej palących problemów współczesnego świata.

Dodaj komentarz

Twój adres email nie zostanie opublikowany. Wymagane pola są oznaczone *