Data ScienceLLMR & D

Meta CLIP 2: Przełom w rozumieniu wielojęzycznych danych przez AI

Współczesne modele wizyjne i multimodalne w znacznym stopniu opierają się na technologii Contrastive Language-Image Pre-training (CLIP), co umożliwia im wykonywanie zadań takich jak klasyfikacja obrazów bez wcześniejszego uczenia (zero-shot classification) czy funkcjonowanie jako encodery wizyjne w dużych multimodalnych modelach językowych (MLLM). Dotychczasowe warianty CLIP, w tym również pierwotny Meta CLIP, skupiały się głównie na danych angielskojęzycznych. Ignorowanie treści nieanglojęzycznych z sieci globalnej stanowiło jednak poważne ograniczenie, utrudniające rozwój ujednoliconych modeli, zoptymalizowanych zarówno dla języka angielskiego, jak i innych języków.

Skalowanie systemów CLIP w taki sposób, by uwzględniały dane wielojęzyczne, wiązało się z dwoma kluczowymi wyzwaniami. Po pierwsze, brakowało efektywnej metody kuracji danych nieanglojęzycznych na dużą skalę. Po drugie, występował problem „klątwy wielojęzyczności” – dodanie danych w innych językach często prowadziło do spadku wydajności modelu w języku angielskim. Rozwiązania takie jak OpenAI CLIP czy Meta CLIP opierały się na kuracji danych z dominacją angielszczyzny, a techniki oparte na destylacji wprowadzały niepożądane błędy z zewnętrznych modeli wzorcowych. Nawet próby SigLIP i SigLIP 2, wykorzystujące dane z Google Image Search, napotykały ograniczenia skalowalności ze względu na zależności od zastrzeżonych źródeł.

Badania prowadzone przez Meta, MIT, Princeton University i New York University zaowocowały opracowaniem Meta CLIP 2 – metody, która trenuje modele CLIP od podstaw, korzystając z rodzimych, globalnych par obraz-tekst. Kluczowe jest to, że twórcy uniknęli zależności od źródeł zewnętrznych, takich jak prywatne dane, tłumaczenia maszynowe czy techniki destylacji. Dzięki temu możliwe jest wyeliminowanie kompromisów wydajnościowych między danymi anglojęzycznymi a nieanglojęzycznymi, poprzez jednoczesne skalowanie metadanych, kuracji danych, pojemności modelu i procesu trenowania.

Architektura Meta CLIP 2 została zaprojektowana z myślą o maksymalnej kompatybilności z architekturą OpenAI CLIP, co zapewnia jej szerokie zastosowanie. Autorzy wprowadzili trzy innowacje umożliwiające skalowanie na skalę globalną: obsługę metadanych dla ponad 300 języków, algorytm kuracji danych dla każdego języka zapewniający zrównoważoną dystrybucję pojęć oraz zaawansowany framework treningowy. Aby sprostać wyzwaniu związanemu z pozyskiwaniem danych, wykorzystano globalnie zbierane zbiory. W celu rozwiązania problemu „klątwy wielojęzyczności” opracowano globalną strukturę treningową, która pomimo zgodności z ustawieniami OpenAI i Meta CLIP, wprowadza dodatkowo wielojęzyczny tokenizator tekstu, skalowanie widzialnych par treningowych oraz analizę minimalnej opłacalnej pojemności modelu.

Badania wykazały, że nawet ViT-L/14 z OpenAI, mimo że jest modelem o dużej pojemności, nadal boryka się z klątwą wielojęzyczności z powodu ograniczonych zasobów. Z kolei model ViT-H/14, używany w Meta CLIP 2, okazał się punktem zwrotnym, osiągając znaczące korzyści zarówno w zadaniach anglojęzycznych, jak i nieanglojęzycznych. Meta CLIP 2, trenowany na danych globalnych z ViT-H/14 i skalowanymi parami, przewyższa swoje anglojęzyczne odpowiedniki (1.0x) oraz modele nieanglojęzyczne (1.3x) zarówno w zadaniach angielskich, jak i wielojęzycznych. Warto jednak zaznaczyć, że klątwa wielojęzyczności wciąż występuje w przypadku braku skalowania danych lub użycia mniejszych modeli, takich jak ViT-L/14.

Przejście z metadanych zdominowanych przez język angielski na globalne odpowiedniki jest kluczowe. Na przykład, usunięcie filtra angielskiego z tekstów alternatywnych (alt-texts) prowadzi do spadku dokładności ImageNet o 0.6%, co podkreśla rolę izolacji językowej. Zastąpienie angielskich metadanych połączonymi danymi globalnymi początkowo obniża wydajność angielską, ale znacząco zwiększa możliwości wielojęzyczne. Ewaluacje na zbiorach danych do klasyfikacji zero-shot i geolokalizacji few-shot pokazują, że skalowanie z 13 mld par angielskich do 29 mld par globalnych poprawia wyniki, z wyjątkiem nasyconej wydajności w GeoDE.

Meta CLIP 2 jest pierwszym modelem CLIP trenowanym od podstaw na globalnych parach obraz-tekst. Dowodzi on, że skalowanie metadanych, procesów kuracji danych i pojemności treningowej może przełamać „klątwę wielojęzyczności”, przynosząc wzajemne korzyści zarówno dla wydajności anglojęzycznej, jak i nieanglojęzycznej. Meta CLIP 2 (ViT-H/14) przewyższa swój anglojęzyczny odpowiednik na zbiorze danych zero-shot ImageNet (80.5% → 81.3%) i wyróżnia się na wielojęzycznych benchmarkach, takich jak XM3600, Babel-IN i CVQA, operując jako pojedynczy, zunifikowany model. Udostępniając publicznie swoje metadane, metody kuracji i kod treningowy, twórcy Meta CLIP 2 umożliwiają społeczności badawczej odejście od podejść skoncentrowanych na języku angielskim i pełne wykorzystanie potencjału globalnej, multimodalnej sieci.

Dodaj komentarz

Twój adres email nie zostanie opublikowany. Wymagane pola są oznaczone *