Agenci AI

Krótka pamięć systemów AI. Kompresja kontekstu zabija instrukcje użytkownika

Każesz botowi nie używać swojego imienia, a pięć minut później on radośnie wita Cię po nazwisku. To nie złośliwość algorytmu, lecz efekt „cyfrowej demencji”, która dotyka współczesne modele językowe przy dłuższych rozmowach. Naukowcy z Penn State University odkryli, że mechanizmy oszczędzania pamięci w AI działają jak agresywna niszczarka dokumentów, w której najważniejsze dla nas zakazy lądują w koszu jako pierwsze.

Problem jest palący teraz, gdy agenci AI zyskują dostęp do naszych skrzynek pocztowych i kont bankowych. Zjawisko to fachowo nazywa się utratą ograniczeń sesyjnych (Session Constraints). Jak wskazują najnowsze analizy, standardowe metody zarządzania pamięcią sprawiają, że inteligentny asystent po pewnym czasie przestaje być posłuszny, co otwiera furtkę do niekontrolowanych działań i wycieków danych.

Mechanizm zapominania

Współczesne modele borykają się z fizycznym ograniczeniem, jakim jest okno kontekstowe. Gdy rozmowa puchnie, systemy stosują kompresję – proces streszczania historii czatu, aby zwolnić miejsce na nowe dane. Badacze z Penn State University sprawdzili ten proces przy użyciu zestawu ewaluacyjnego COMPINT. Wyniki są fatalne: priorytet otrzymuje ogólny cel zadania, natomiast reguły bezpieczeństwa narzucone przez użytkownika są niemal natychmiast usuwane z pamięci operacyjnej.

Badania wykazały, że średnio tylko 17 procent instrukcji sesyjnych przetrwa proces kompresji. Mowa o wytycznych typu – –zawsze proś o potwierdzenie przed wysłaniem maila– lub –nie używaj mojego imienia–. Dla algorytmu streszczającego te ograniczenia są traktowane jako zbędny szum. Badacze zidentyfikowali tę klasę instrukcji jako Session Constraints (SCs), które –mają ograniczać zachowanie modelu do końca sesji, ale są po cichu porzucane podczas zagęszczania treści–.

Luka w bezpieczeństwie i jakości

Kiedy AI zapomina o nałożonych blokadach, zaczyna działać samowolnie. Statystyki nie pozostawiają złudzeń: o ile w pełnym, nieściśniętym kontekście modele przestrzegają reguł w 59–71 procentach przypadków, o tyle po kompresji skuteczność ta drastycznie spada, zbliżając się do zera. Nawet próby dopracowania instrukcji dla algorytmów kompresujących niewiele dają, podnosząc utrzymanie zasad zaledwie do poziomu 40 procent.

Zewnętrzny strażnik pamięci

Rozwiązaniem może być nie poprawianie samych gigantów AI, lecz dołożenie im –zewnętrznego sumienia–. Naukowcy zaproponowali architekturę opartą na mniejszym modelu Qwen3.5-9B, który pełni rolę niezależnego wyodrębniacza. Mimo że sam model dysponuje oknem rzędu 262 144 tokenów, tutaj służy do konkretnego zadania: wyłapywania ograniczeń i zapisywania ich w oddzielnej, trwałej liście.

Podczas gdy główny system kompresuje historię czatu, lista ta jest automatycznie dołączana do każdego streszczenia. Efekt? Utrzymanie instrukcji wzrosło do ponad 90 procent w testowanych scenariuszach. Co najważniejsze, ta metoda nie wymaga kosztownego dostrajania modeli. To gotowa nakładka, która może sprawić, że agenci AI w końcu zaczną nas słuchać na dłuższą metę.