Obraz

ObrazR & DRozumowanie

GPT-4o widzi, ale czy rozumie? Analiza wizualnych kompetencji modeli multimodalnych

Najnowsze modele multimodalne, takie jak GPT-4o, Gemini i Claude, zrewolucjonizowały interakcję z AI, łącząc umiejętności językowe z przetwarzaniem obrazu. Jednak ich rzeczywiste zdolności do rozumienia wizualnego pozostają przedmiotem intensywnych badań. Analizy EPFL rzucają nowe światło na to, jak te modele radzą sobie z zadaniami typowo wizualnymi, wskazując ich mocne strony, ale i wyraźne ograniczenia w porównaniu ze specjalistycznymi systemami.

Read More
ObrazRozumowanie

PyVision: Sztuczna inteligencja, która dynamicznie tworzy własne narzędzia do analizy obrazu

Nowy framework PyVision, opracowany przez międzynarodowy zespół naukowców, umożliwia dużym multimodalnym modelom językowym tworzenie i dostosowywanie narzędzi do rozwiązywania złożonych zadań związanych z rozumowaniem wizualnym. Zamiast polegać na stałych zestawach funkcji, AI dynamicznie generuje kod Pythona, otwierając nowe perspektywy w adaptacyjnym przetwarzaniu obrazu.

Read More
Gen AILLMObrazR & D

Mirage: Myślenie wizualne w modelach wielomodalnych bez generowania obrazów

Naukowcy z University of Massachusetts Amherst i MIT przedstawili Mirage, innowacyjne podejście, które umożliwia wielomodalnym modelom językowym (VLM) wizualne rozumowanie bez konieczności generowania pełnych obrazów. Inspirując się ludzką zdolnością do mentalnej wizualizacji, Mirage integruje kompaktowe wskazówki wizualne bezpośrednio w proces myślowy, otwierając nowe możliwości w rozwiązywaniu złożonych zadań przestrzennych.

Read More