Gen AILLMObraz

PaddleOCR‑VL 0.9B: Baidu łączy natywną rozdzielczość NaViT z ERNIE‑4.5 do parsowania dokumentów

Baidu publikuje PaddleOCR‑VL, model wizja‑język o wielkości 0,9 mld parametrów zaprojektowany do end‑to‑endowego parsowania dokumentów zawierających złożone układy, małe skrypty, wzory matematyczne, wykresy i pismo odręczne. Autorzy łączą natywną, dynamiczną enkodację obrazu w stylu NaViT z lekkim dekoderem ERNIE‑4.5‑0.3B, a całość ma wspierać 109 języków przy zachowaniu praktycznej latencji inferencyjnej.

Architektura i podejście systemowe

Projekt zakłada dwustopniowy przepływ: pierwszy etap — PP‑DocLayoutV2 — wykonuje analizę strony na poziomie układu za pomocą detektora RT‑DETR, który lokalizuje i klasyfikuje regiony, a następnie sieć wskaźnikowa (pointer network) ustala kolejność czytania. Dopiero drugi etap — sam PaddleOCR‑VL‑0.9B — rozpoznaje zawartość poszczególnych elementów, warunkując dekodowanie na uprzednio wykrytych regionach. Takie rozdzielenie ma zmniejszać problemy ze stabilnością i opóźnieniami, które pojawiają się przy bezpośrednim dekodowaniu długich sekwencji w gęstych, wielokolumnowych układach.

Na czym polega „NaViT‑style” i dlaczego to ważne

Kluczowym komponentem jest natywna, dynamiczna enkodacja obrazu w stylu NaViT — czyli pakowanie sekwencji z zachowaniem oryginalnej rozdzielczości zamiast destrukcyjnego skalowania czy klasycznego tilingu. PaddleOCR‑VL stosuje to rozwiązanie wraz z dwuwarstwowym projektorem MLP i 3D‑RoPE jako reprezentacją pozycyjną. Według autorów przetwarzanie w natywnej rozdzielczości obniża liczbę halucynacji i poprawia rozpoznawanie w tekstowo gęstych fragmentach w porównaniu do podejść opartych na stałym przeskalowaniu.

Wydajność i benchmarki

PaddleOCR‑VL osiąga rzekome wyniki na poziomie SOTA na OmniDocBench v1.5 oraz konkurencyjne wyniki na v1.0. System wypada też dobrze w zadaniach składowych: od edycji tekstu i metryk dla wzorów (Formula‑CDM), przez oceny tabel (Table‑TEDS/TEDS‑S), po metryki kolejności czytania. Zespół raportuje dodatkowe wzmocnienie na zestawach olmOCR‑Bench oraz wewnętrznych testach dedykowanych pismu ręcznemu, tabelom, wzorom i wykresom.

Praktyczne implikacje

Model został zaprojektowany z myślą o użyciu produkcyjnym: rozdzielenie detekcji układu i elementowego rozpoznawania redukuje koszty dekodowania długich sekwencji, a 0,9 mld parametrów daje kompromis między precyzją a wymaganiami sprzętowymi. Wyniki są eksportowane do ustrukturyzowanego Markdown/JSON, co upraszcza integrację z pipeline’ami ekstrakcji danych. Zespół udostępnia model na Hugging Face oraz materiały i przykłady na GitHubie; przewidziano też akceleracje przy użyciu vLLM/SGLang.

Co warto mieć na uwadze — krytyczne zastrzeżenia

Chociaż połączenie NaViT‑style z ERNIE‑4.5‑0.3B jest technicznie interesujące, warto zachować ostrożność przy interpretacji wyników. Benchmarki publiczne nie zawsze odzwierciedlają pełną paletę realnych dokumentów — zwłaszcza tych z rzadkimi skryptami, ekstremalnie zniszczonymi skanami czy niestandardowymi wykresami. Dwustopniowy pipeline poprawia stabilność, ale także wprowadza punkt awarii: błędy detekcji lub błędnie wyznaczona kolejność czytania będą propagować się do etapu rozpoznawania. Ponadto deklaracja obsługi 109 języków wymaga doprecyzowania pod kątem jakości na językach rzadkich i ręcznie pisanych wariantach.

Podsumowanie

PaddleOCR‑VL to praktyczne podejście do trudnego problemu ekstrakcji informacji ze złożonych dokumentów: łączy zalety przetwarzania natywnej rozdzielczości z lekkim, ale zdolnym dekoderem językowym i dwustopniową architekturą, która zmniejsza koszty inferencji. To krok w stronę systemów, które mogą trafiać do produkcji w przedsiębiorstwach potrzebujących wydajnej, wielojęzycznej ekstrakcji danych. Jednocześnie ostateczna ocena użyteczności wymaga niezależnej weryfikacji na szerokim spektrum rzeczywistych dokumentów oraz transparentności co do jakości obsługi języków o niskich zasobach.

Materiały techniczne i kod źródłowy wraz z modelami są dostępne od Baidu — zainteresowani mogą sięgnąć po dokumentację i przykłady na platformie GitHub oraz po model na Hugging Face.

Dodaj komentarz

Twój adres email nie zostanie opublikowany. Wymagane pola są oznaczone *