Baidu rzuca wyzwanie gigantom OCR. Qianfan-OCR redefiniuje cyfrową analizę dokumentów
Koniec z szumem informacyjnym: Unified Document Intelligence
Przez lata cyfryzacja dokumentów opierała się na tak zwanych potokach (pipelines) – skomplikowanych łańcuchach, w których jeden algorytm wykrywał układ strony, drugi rozpoznawał tekst (OCR), a trzeci próbował nadać całości sens. Chiński gigant technologiczny Baidu postanowił przełamać ten paradygmat, wprowadzając Qianfan-OCR. To model typu end-to-end, który cały proces zamyka w jednej architekturze wizyjno-językowej. Zamiast przesyłać dane między niepowiązanymi modułami, model bezpośrednio przekłada obraz na uporządkowany kod Markdown, co drastycznie redukuje ryzyko błędów interpretacyjnych.
Sercem systemu jest Qwen3-4B, model językowy o 4 miliardach parametrów z oknem kontekstowym rzędu 32 tysięcy tokenów. Wspiera go koder wizyjny Qianfan-ViT, korzystający z mechanizmu Any Resolution. Rozwiązanie to pozwala na dzielenie obrazów o wysokiej rozdzielczości (nawet do 4K) na mniejsze fragmenty, co umożliwia odczytanie najdrobniejszych czcionek i gęstych tabel bez utraty ostrości. Wykorzystanie technologii Grouped-Query Attention (GQA) pozwoliło czterokrotnie zredukować zużycie pamięci operacyjnej, co czyni model wyjątkowo efektywnym kosztowo.
Mechanizm Layout-as-Thought: Kiedy sztuczna inteligencja musi się zastanowić
Najbardziej intrygującym elementem Qianfan-OCR jest funkcja „Layout-as-Thought”. To opcjonalna faza, w której model generuje wewnętrzną reprezentację struktury dokumentu przed podaniem ostatecznej odpowiedzi. System tworzy wirtualne obramowania (bounding boxes) i klasyfikuje elementy, takie jak wzory matematyczne czy diagramy, używając specjalnych tokenów współrzędnych.
Zastosowanie tego mechanizmu pozwala na zachowanie precyzji w dokumentach o wysokiej „entropii etykiet” – tam, gdzie tekst miesza się z grafikami i nieliniowym układem. Co ważne, dzięki dedykowanym tokenom, proces ten jest o połowę szybszy niż w przypadku generowania współrzędnych w formacie czystego tekstu. To swoista „chwila refleksji” algorytmu, która gwarantuje, że hierarchia czytania zostanie zachowana, a tabela nie zmieni się w bezkształtny blok znaków.
Dominacja w benchmarkach i efektywność wdrożeniowa
Wyniki testów empirycznych stawiają Qianfan-OCR w rzędzie liderów branży. W teście OmniDocBench v1.5 model uzyskał wynik 93,12 pkt, wyprzedzając takie jednostki jak DeepSeek-OCR-v2 czy Gemini-3 Pro. Szczególną przewagę widać w zadaniach typu CharXiv, wymagających rozumowania przestrzennego. Tradycyjne modele dwuetapowe często zawodzą przy analizie wykresów, ponieważ oddzielenie tekstu od kontekstu wizualnego niszczy relacje między danymi a ich położeniem na osiach. Qianfan-OCR, widząc obraz jako całość, radzi sobie z tym bezbłędnie.
Pod względem operacyjnym propozycja Baidu optymalizuje wykorzystanie procesorów graficznych. Podczas gdy starsze systemy często były blokowane przez analizę układu na procesorach CPU, Qianfan-OCR jest w pełni zorientowany na GPU. Dzięki kwantyzacji W8A8 model osiąga wydajność na poziomie ponad jednej strony na sekundę na karcie NVIDIA A100, co przy tak dużej precyzji stanowi solidny fundament dla masowej cyfryzacji archiwów i automatyzacji procesów biznesowych.
