GPT-4o widzi, ale czy rozumie? Analiza wizualnych kompetencji modeli multimodalnych
Najnowsze modele multimodalne, takie jak GPT-4o, Gemini i Claude, zrewolucjonizowały interakcję z AI, łącząc umiejętności językowe z przetwarzaniem obrazu. Jednak ich rzeczywiste zdolności do rozumienia wizualnego pozostają przedmiotem intensywnych badań. Analizy EPFL rzucają nowe światło na to, jak te modele radzą sobie z zadaniami typowo wizualnymi, wskazując ich mocne strony, ale i wyraźne ograniczenia w porównaniu ze specjalistycznymi systemami.
Read More