LLMR & D

Meta prezentuje REFRAG: przełom w skalowaniu RAG z 16-krotnie dłuższym kontekstem i 31-krotnie szybszym dekodowaniem

Naukowcy z Meta Superintelligence Labs, wspólnie z National University of Singapore i Rice University, opracowali REFRAG (REpresentation For RAG), innowacyjną architekturę dekodowania, która na nowo definiuje efektywność Retrieval-Augmented Generation (RAG). REFRAG pozwala na 16-krotne zwiększenie okna kontekstowego modeli LLM i aż 31-krotne przyspieszenie czasu do pierwszego tokenu (TTFT), bez negatywnego wpływu na dokładność.

Wyzwania związane z długim kontekstem w LLM

Mechanizm uwagi w dużych modelach językowych charakteryzuje się kwadratową zależnością od długości danych wejściowych. Oznacza to, że dwukrotne wydłużenie dokumentu może skutkować czterokrotnym wzrostem kosztów obliczeniowych i pamięciowych. To spowalnia proces wnioskowania i zwiększa rozmiar pamięci podręcznej klucz-wartość (KV), co utrudnia wdrażanie aplikacji wykorzystujących długi kontekst w systemach produkcyjnych. W systemach RAG większość pobranych fragmentów ma niewielki wpływ na ostateczną odpowiedź, ale model wciąż musi przetwarzać je wszystkie, generując znaczne koszty obliczeniowe.

Jak REFRAG kompresuje i skraca kontekst?

REFRAG wprowadza lekki enkoder, który dzieli pobrane fragmenty na bloki o stałej długości (np. 16 tokenów) i kompresuje każdy blok do postaci gęstego osadzenia. Zamiast przetwarzać tysiące surowych tokenów, dekoder analizuje krótszą sekwencję osadzeń. To pozwala na 16-krotne skrócenie długości sekwencji, bez modyfikacji architektury LLM.

Przyspieszenie działania

Skrócenie sekwencji wejściowej dekodera pozwala REFRAG zredukować kwadratową złożoność obliczeń uwagi i zmniejszyć pamięć podręczną KV. Wyniki empiryczne wskazują na 16,53-krotne przyspieszenie TTFT przy k=16 i 30,85-krotne przyspieszenie przy k=32, co znacząco przewyższa dotychczasowe rozwiązania CEPE (które oferowały przyspieszenie rzędu 2–8x). Przepustowość również wzrasta – nawet 6,78-krotnie w porównaniu z modelami bazowymi LLaMA.

Zachowanie dokładności

Polityka uczenia ze wzmocnieniem (RL) nadzoruje proces kompresji. Identyfikuje ona fragmenty o największej gęstości informacyjnej i pozwala im ominąć kompresję, przekazując surowe tokeny bezpośrednio do dekodera. Ta selektywna strategia zapewnia, że krytyczne szczegóły – takie jak dokładne liczby lub rzadkie encje – nie zostaną utracone. W różnych testach porównawczych REFRAG utrzymuje lub poprawia zagmatwanie w porównaniu z CEPE, działając przy znacznie niższych opóźnieniach.

Wyniki Eksperymentów

REFRAG został wstępnie wytrenowany na 20 miliardach tokenów z korpusu SlimPajama (Books + arXiv) i przetestowany na zbiorach danych z długim kontekstem, takich jak Book, Arxiv, PG19 i ProofPile. W testach RAG, zadaniach konwersacji wieloetapowych i streszczeniach długich dokumentów, REFRAG konsekwentnie przewyższał silne modele bazowe. Najważniejsze wyniki to:

  • 16-krotne rozszerzenie kontekstu poza standardowy LLaMA-2 (4k tokenów).
  • ~9,3% poprawa zagmatwania w porównaniu z CEPE w czterech zbiorach danych.
  • Wyższa dokładność w warunkach słabego pobierania, gdzie dominują nieistotne fragmenty – dzięki możliwości przetwarzania większej liczby fragmentów przy tym samym budżecie opóźnień.

Podsumowanie

REFRAG udowadnia, że LLM z długim kontekstem nie muszą być powolne ani zasobożerne. Dzięki kompresji pobranych fragmentów do postaci zwartych osadzeń, selektywnemu rozszerzaniu tylko istotnych elementów i przemyśleniu sposobu działania dekodowania RAG, Meta Superintelligence Labs umożliwiło przetwarzanie znacznie większych danych wejściowych przy jednoczesnym znacznym przyspieszeniu działania. To sprawia, że aplikacje wykorzystujące długi kontekst – takie jak analiza całych raportów, obsługa konwersacji wieloetapowych lub skalowanie systemów RAG dla przedsiębiorstw – stają się nie tylko wykonalne, ale i wydajne, bez utraty dokładności.

Dostępność

Meta Superintelligence Labs udostępni REFRAG na GitHubie.

Dodaj komentarz

Twój adres email nie zostanie opublikowany. Wymagane pola są oznaczone *