Gen AI

ObrazR & DRozumowanie

GPT-4o widzi, ale czy rozumie? Analiza wizualnych kompetencji modeli multimodalnych

Najnowsze modele multimodalne, takie jak GPT-4o, Gemini i Claude, zrewolucjonizowały interakcję z AI, łącząc umiejętności językowe z przetwarzaniem obrazu. Jednak ich rzeczywiste zdolności do rozumienia wizualnego pozostają przedmiotem intensywnych badań. Analizy EPFL rzucają nowe światło na to, jak te modele radzą sobie z zadaniami typowo wizualnymi, wskazując ich mocne strony, ale i wyraźne ograniczenia w porównaniu ze specjalistycznymi systemami.

Read More
Gen AIR & D

VLM2Vec-V2: Nowe podejście do unifikacji wiedzy w modelach wizyjnych

Modele osadzania danych (embedding models) stanowią pomost między różnymi modalnościami, przekształcając zróżnicowane informacje multimodalne w ujednoliconą, gęstą przestrzeń reprezentacji. W ostatnich latach, głównie dzięki rozwojowi dużych modeli fundamentalnych, nastąpił znaczący postęp w tej dziedzinie. Istniejące modele multimodalne, choć zaawansowane, często opierają się na zbiorach danych, które nie odzwierciedlają pełnego spektrum wyzwań w świecie rzeczywistym. Badacze z Salesforce Research, UC Santa Barbara, University of Waterloo i Tsinghua University przedstawili VLM2Vec-V2, innowacyjne rozwiązanie dążące do unifikacji przetwarzania obrazów, wideo i dokumentów wizualnych w jednym, spójnym frameworku.

Read More