Agenci AI

Cloudflare udostępnia Clef: modele decyzyjne mają odpowiadać w kilkudziesięciu milisekundach

Cloudflare udostępnił dwa modele decyzyjne dla agentów AI: Clef oraz mniejszy Clef-flash. Zamiast generować swobodny tekst, narzędzia odpowiadają na zdefiniowane pytania dotyczące danych wejściowych i przypisują prawdopodobieństwa poszczególnym wariantom. Taki ustrukturyzowany wynik może zostać bezpośrednio przetworzony przez inny program, na przykład do przekierowania zgłoszenia lub podjęcia zautomatyzowanej akcji.

Firma przedstawia nowe modele jako bezpośrednią konkurencję dla Jev od TypeSafe AI, wskazując przede wszystkim na czas reakcji. Z testów przeprowadzonych przez Cloudflare wynika, że mediana opóźnienia wynosi około 39 milisekund dla Clef-flash oraz 209 milisekund dla Clef, podczas gdy dla Jev odnotowano ponad 524 milisekundy. Są to jednak deklaracje producenta oparte na jego własnych pomiarach, a nie niezależnie zweryfikowane benchmarki. Co istotne, Clef jest zgodny z API Jev, co może ułatwić integrację z istniejącymi systemami.

Modele decyzyjne sytuują się pomiędzy klasycznymi klasyfikatorami a dużymi modelami językowymi. LLM-y radzą sobie ze złożonym kontekstem, ale generują zmienne odpowiedzi i wymagają dłuższego czasu na przetworzenie. Z kolei tradycyjne klasyfikatory działają szybko, lecz dodanie nowej kategorii często wymaga ponownego trenowania. Clef ma łączyć elastyczność w analizie danych z przewidywalnym formatem wyjściowym.

Struktura decyzji zamiast generowania tekstu

Praktycznym zastosowaniem modelu może być wstępna selekcja wiadomości w dziale obsługi klienta. Clef może ocenić pilność sprawy i wskazać odpowiedni zespół. To jednak system wdrażający model określa, czy na podstawie uzyskanych prawdopodobieństw wykonać akcję automatycznie, czy przekazać sprawę pracownikowi. Wysoka wartość prawdopodobieństwa nie stanowi gwarancji bezbłędności. Z tego samego powodu branżowe określenia takich architektur jako modeli „pozbawionych halucynacji” oznaczają jedynie, że wybierają one wyłącznie spośród dopuszczonych opcji, a nie że każda ich decyzja jest bezbłędna.

Jako przykład wewnętrznego użycia Cloudflare podaje pracę zespołu analizy zagrożeń. Clef analizował zawartość witryn internetowych, określając z wysokim prawdopodobieństwem ich profil handlowy i wykluczając ryzyko phishingu. Cały proces pobrania, wyrenderowania i klasyfikacji strony zajął 2,2 sekundy, podczas gdy standardowy model językowy potrzebował na to 4,7 sekundy i zwrócił mniej precyzyjne kategorie.

Architektura i dostrajanie

Według dokumentacji Cloudflare Clef bazuje na modelu Qwen3.8-27B, natomiast Clef-flash na Qwen3.5-9B. Modele bazowe pozostają niezmienione, a dodatkowe komponenty odpowiedzialne za wyliczanie prawdopodobieństw wytrenowano z użyciem danych syntetycznych oraz metody uczenia ze wzmocnieniem kalibrowanych decyzji (RLCD). Rozwiązanie obsługuje tekst oraz obrazy, a w wersji hostowanej na platformie Workers AI oferuje okno kontekstu rzędu 64 tysięcy tokenów i dostęp przez REST API /ai/run.

Cloudflare zapowiada, że możliwość dostrajania Clef do specyficznych zadań biznesowych będzie wdrażana etapami. Początkowo proces ten ma odbywać się przy bezpośrednim wsparciu inżynierów firmy, a docelowo za pośrednictwem samoobsługowej platformy. Same wagi modeli Clef i Clef-flash udostępniono w serwisie Hugging Face na licencji Apache-2.0.