Meta prezentuje REFRAG: przełom w skalowaniu RAG z 16-krotnie dłuższym kontekstem i 31-krotnie szybszym dekodowaniem
Naukowcy z Meta Superintelligence Labs, wspólnie z National University of Singapore i Rice University, opracowali REFRAG (REpresentation For RAG), innowacyjną architekturę dekodowania, która na nowo definiuje efektywność Retrieval-Augmented Generation (RAG). REFRAG pozwala na 16-krotne zwiększenie okna kontekstowego modeli LLM i aż 31-krotne przyspieszenie czasu do pierwszego tokenu (TTFT), bez negatywnego wpływu na dokładność.
Wyzwania związane z długim kontekstem w LLM
Mechanizm uwagi w dużych modelach językowych charakteryzuje się kwadratową zależnością od długości danych wejściowych. Oznacza to, że dwukrotne wydłużenie dokumentu może skutkować czterokrotnym wzrostem kosztów obliczeniowych i pamięciowych. To spowalnia proces wnioskowania i zwiększa rozmiar pamięci podręcznej klucz-wartość (KV), co utrudnia wdrażanie aplikacji wykorzystujących długi kontekst w systemach produkcyjnych. W systemach RAG większość pobranych fragmentów ma niewielki wpływ na ostateczną odpowiedź, ale model wciąż musi przetwarzać je wszystkie, generując znaczne koszty obliczeniowe.
Jak REFRAG kompresuje i skraca kontekst?
REFRAG wprowadza lekki enkoder, który dzieli pobrane fragmenty na bloki o stałej długości (np. 16 tokenów) i kompresuje każdy blok do postaci gęstego osadzenia. Zamiast przetwarzać tysiące surowych tokenów, dekoder analizuje krótszą sekwencję osadzeń. To pozwala na 16-krotne skrócenie długości sekwencji, bez modyfikacji architektury LLM.
Przyspieszenie działania
Skrócenie sekwencji wejściowej dekodera pozwala REFRAG zredukować kwadratową złożoność obliczeń uwagi i zmniejszyć pamięć podręczną KV. Wyniki empiryczne wskazują na 16,53-krotne przyspieszenie TTFT przy k=16 i 30,85-krotne przyspieszenie przy k=32, co znacząco przewyższa dotychczasowe rozwiązania CEPE (które oferowały przyspieszenie rzędu 2–8x). Przepustowość również wzrasta – nawet 6,78-krotnie w porównaniu z modelami bazowymi LLaMA.
Zachowanie dokładności
Polityka uczenia ze wzmocnieniem (RL) nadzoruje proces kompresji. Identyfikuje ona fragmenty o największej gęstości informacyjnej i pozwala im ominąć kompresję, przekazując surowe tokeny bezpośrednio do dekodera. Ta selektywna strategia zapewnia, że krytyczne szczegóły – takie jak dokładne liczby lub rzadkie encje – nie zostaną utracone. W różnych testach porównawczych REFRAG utrzymuje lub poprawia zagmatwanie w porównaniu z CEPE, działając przy znacznie niższych opóźnieniach.
Wyniki Eksperymentów
REFRAG został wstępnie wytrenowany na 20 miliardach tokenów z korpusu SlimPajama (Books + arXiv) i przetestowany na zbiorach danych z długim kontekstem, takich jak Book, Arxiv, PG19 i ProofPile. W testach RAG, zadaniach konwersacji wieloetapowych i streszczeniach długich dokumentów, REFRAG konsekwentnie przewyższał silne modele bazowe. Najważniejsze wyniki to:
- 16-krotne rozszerzenie kontekstu poza standardowy LLaMA-2 (4k tokenów).
- ~9,3% poprawa zagmatwania w porównaniu z CEPE w czterech zbiorach danych.
- Wyższa dokładność w warunkach słabego pobierania, gdzie dominują nieistotne fragmenty – dzięki możliwości przetwarzania większej liczby fragmentów przy tym samym budżecie opóźnień.
Podsumowanie
REFRAG udowadnia, że LLM z długim kontekstem nie muszą być powolne ani zasobożerne. Dzięki kompresji pobranych fragmentów do postaci zwartych osadzeń, selektywnemu rozszerzaniu tylko istotnych elementów i przemyśleniu sposobu działania dekodowania RAG, Meta Superintelligence Labs umożliwiło przetwarzanie znacznie większych danych wejściowych przy jednoczesnym znacznym przyspieszeniu działania. To sprawia, że aplikacje wykorzystujące długi kontekst – takie jak analiza całych raportów, obsługa konwersacji wieloetapowych lub skalowanie systemów RAG dla przedsiębiorstw – stają się nie tylko wykonalne, ale i wydajne, bez utraty dokładności.
Dostępność
Meta Superintelligence Labs udostępni REFRAG na GitHubie.
