Technologia

Gen AIR & D

VLM2Vec-V2: Nowe podejście do unifikacji wiedzy w modelach wizyjnych

Modele osadzania danych (embedding models) stanowią pomost między różnymi modalnościami, przekształcając zróżnicowane informacje multimodalne w ujednoliconą, gęstą przestrzeń reprezentacji. W ostatnich latach, głównie dzięki rozwojowi dużych modeli fundamentalnych, nastąpił znaczący postęp w tej dziedzinie. Istniejące modele multimodalne, choć zaawansowane, często opierają się na zbiorach danych, które nie odzwierciedlają pełnego spektrum wyzwań w świecie rzeczywistym. Badacze z Salesforce Research, UC Santa Barbara, University of Waterloo i Tsinghua University przedstawili VLM2Vec-V2, innowacyjne rozwiązanie dążące do unifikacji przetwarzania obrazów, wideo i dokumentów wizualnych w jednym, spójnym frameworku.

Read More