LLM

Meta Sapiens2: Gigantyczna skala wizji komputerowej, która rzuca wyzwanie ludzkiej anatomii

Zrozumienie ludzkiego ciała przez sztuczną inteligencję to ogromne wyzwanie inżynierii danych. Od tysięcy lat artyści zmagali się z anatomią dłoni, a współczesne systemy wizyjne często powielały te błędy, gubiąc się w labiryncie ubrań, oświetlenia i perspektyw.

Meta AI właśnie podniosła poprzeczkę, publikując Sapiens2 – drugą generację modeli fundamentowych dedykowanych wyłącznie percepcji człowieka. To nie jest kolejny drobny upgrade; to brutalna demonstracja siły obliczeniowej i precyzji, operująca w natywnej rozdzielczości 1K oraz 4K.

Miliard obrazów i koniec kompromisów

Kluczem do dominacji Sapiens2 jest zestaw danych Humans-1B. Meta przefiltrowała 4 miliardy surowych obrazów z sieci, izolując miliard klatek, na których człowiek jest głównym aktorem. Co istotne, proces ten nie polegał na prostym scrapowaniu – algorytmy oceniały estetykę, pozycję głowy i stopień przesłonięcia obiektów, aby stworzyć najbardziej zróżnicowany korpus treningowy w historii branży.

Sapiens2 rozwiązuje fundamentalny problem tak zwanego „representation drift”.

Wcześniejsze modele musiały wybierać: albo uczyć się tekstur i detali powierzchni (MAE), albo rozumieć semantykę i kontekst anatomiczny (Contrastive Learning). Meta połączyła oba podejścia w ramach joint objective L = LMAE + λLCL. Efekt? Model wie, że ząb to nie dziąsło, a jednocześnie potrafi odróżnić naturalny odcień skóry od cienia rzucanego przez ubranie.

Architektura skrojona pod 5 miliardów parametrów

Największy z wariantów Sapiens2 posiada 5 miliardów parametrów i generuje moc obliczeniową na poziomie 15,7 TFLOPs. To najpotężniejszy Vision Transformer (ViT) w tej kategorii. Aby utrzymać stabilność przy tak wysokiej rozdzielczości, inżynierowie zastosowali szereg optymalizacji:

  • GQA (Grouped-Query Attention) dla przyspieszenia przepływu danych.
  • RMSNorm zamiast standardowego LayerNorm, co stabilizuje proces uczenia.
  • Hierarchical Windowed Attention, pozwalające modelowi analizować detale w 4K bez wykładniczego wzrostu zapotrzebowania na pamięć.

Pięć wymiarów cyfrowego człowieka

Sapiens2 nie jest zabawką do generowania obrazków – to precyzyjne narzędzie analityczne. Po fazie pretreningu model został przeszkolony w pięciu kluczowych zadaniach, wykorzystując dziesięciokrotnie większą liczbę etykiet niż jego poprzednik.

W estymacji pozycji system śledzi teraz aż 308 punktów kluczowych, obejmując gęstą siatkę twarzy i dłoni. W zadaniu segmentacji model operuje na 29 klasach semantycznych, osiągając wynik 82.5 mIoU – to przepaść względem starszych rozwiązań. Największe wrażenie robi jednak Albedo Estimation, czyli zdolność do odzyskania prawdziwego koloru powierzchni niezależnie od oświetlenia.

Meta nie stworzyła ogólnego modelu do wszystkiego. Sapiens2 to specjalista, który w testach wydajnościowych bije na głowę nawet giganty pokroju DINOv3-7B, mimo mniejszej liczby parametrów.

Sceptycyzm w cieniu optymalizacji

Choć wyniki budzą podziw, Sapiens2 to wciąż „czarna skrzynka” wymagająca gigantycznych zasobów. Skalowanie do 4K i 5B parametrów sprawia, że modele te – mimo udostępnienia wag na Hugging Face – pozostają poza zasięgiem przeciętnego dewelopera bez dostępu do klastrów H100. Pytanie brzmi, jak Meta zamierza skompresować tę wiedzę do urządzeń mobilnych lub okularów AR, gdzie analiza pozycji w czasie rzeczywistym jest świętym Graalem technologii.

Jedno jest pewne: granica między obrazem a jego pełnym zrozumieniem geometrycznym właśnie uległa zatarciu.