Bezpieczeństwo

Anthropic stawia zaporę wokół Claude’a przed wyborami

Anthropic nie zamierza czekać, aż ich model padnie ofiarą politycznej wojny informacyjnej. Firma właśnie odsłoniła karty w kwestii integralności wyborczej, prezentując zestaw zabezpieczeń, które mają uczynić Claude’a bastionem neutralności przed wyborami śródokresowymi w USA w 2026 roku oraz kluczowymi głosowaniami na świecie.

To nie jest tylko zabieg PR-owy, ale manifest technologicznej kontroli nad chaosem.

Testy pod wysokim ciśnieniem

W świecie dużych modeli językowych (LLM-ów) puste obietnice są tanie. Anthropic postanowił więc udowodnić skuteczność swoich algorytmów za pomocą twardych danych. Poddano modele Claude 4.7 Opus i 4.6 Sonnet morderczej próbie: 600 zróżnicowanym zapytaniom, z czego połowa miała charakter otwarcie szkodliwy. Wynik? Skuteczność rzędu 99,8% do 100% w wykrywaniu i blokowaniu prób złamania polityki bezpieczeństwa.

Największym wyzwaniem nie są jednak proste pytania, a wieloetapowe operacje wpływu, gdzie AI jest powoli urabiane przez aktora o złych zamiarach. Nawet w takich „scenariuszach manipulacji” modele utrzymały poprawność na poziomie powyżej 90%. To sygnał dla rynku: my nie tylko filtrujemy słowa kluczowe, my rozumiemy kontekst operacji.

Fundamenty cyfrowej blokady

  • Zakaz generowania kłamliwych kampanii politycznych.
  • Blokada tworzenia zmanipulowanych treści (tzw. deepfake).
  • Uniemożliwienie planowania ataków na infrastrukturę wyborczą.
  • Odrzucanie procedur ułatwiających oszustwa przy urnach.

Anthropic twierdzi, że Claude potrafi dziś rozpoznać próbę autonomicznego planowania kampanii od A do Z i odmówić jej wykonania bez mrugnięcia okiem. To kluczowe, bo skala zagrożenia rośnie proporcjonalnie do możliwości modeli.

Koniec z politowaniem, czas na fakty

Zamiast wchodzić w polemikę z użytkownikiem na tematy polityczne, Claude będzie teraz pełnić rolę nawigatora. Każdy szukający informacji o terminach czy rejestracji wyborców zobaczy baner kierujący do TurboVote – bezstronnego źródła zarządzanego przez Democracy Works. Podobne rozwiązanie ma pojawić się w Brazylii jeszcze w tym roku.

Neutralność polityczna została wyceniona odpowiednio na 95% (Opus) i 96% (Sonnet). Oznacza to, że AI w niemal każdym przypadku zachowuje lodowaty dystans do obu stron politycznej barykady.

Sceptycznym okiem

Choć liczby robią wrażenie, pozostaje pytanie o elastyczność tych barier. Historia uczy, że tzw. jailbreaki i kreatywna inżynieria promptów zwykle wyprzedzają statyczne testy laboratoryjne o dwa kroki. Anthropic buduje mur, ale w internecie mur to tylko wyzwanie dla tych, którzy chcą go przeskoczyć. Prawdziwy test skuteczności nadejdzie nie w laboratorium, a w szczycie gorączki wyborczej, gdy systemy automatycznej detekcji zmierzą się z żywiołem ludzkiej pomysłowości.