Bez kategorii

Claude buduje Claude’a? Anthropic chwali się autonomią, ale metoda jej oceny budzi wątpliwości

Anthropic, firma stojąca za modelem Claude, opublikowała dane mające świadczyć o szybkim tempie automatyzacji badań nad sztuczną inteligencją. Z raportu opublikowanego we wrześniu 2026 roku, o którym szeroko informowały agencje Reuters oraz Bloomberg, wynika, że Claude „prowadzi” już 26% wewnętrznych prac badawczo-rozwojowych. Jest to pierwszy przypadek, gdy laboratorium tak otwarcie dzieli się wskaźnikami dotyczącymi udziału AI w budowie własnych następców. Publikacja ta zbiega się w czasie z apelami szefa firmy, Dario Amodei, o skoordynowane spowolnienie rozwoju AI, jednak bliższa analiza danych pokazuje, że deklarowana autonomia jest w dużej mierze kwestią płynnej interpretacji.

Sędzia we własnej sprawie

Kluczowym elementem raportu jest fakt, że to nie ludzie, a sam Claude oceniał stopień zaangażowania algorytmów w poszczególne zadania. Model przeanalizował historię komunikacji na Slacku oraz dokumentację techniczną, by przypisać pracom odpowiedni poziom na skali automatyzacji. Weryfikacja tej metody wzbudza jednak pytania o jej wiarygodność.

Badanie zgodności wykazało, że oceny Claude’a pokrywały się z ludzkimi tylko w 59% przypadków. Co więcej, sami pracownicy Anthropic mieli ogromny problem z jednolitą klasyfikacją zadań – zgadzali się między sobą jedynie w 33%. Mimo podania precyzyjnych procentów, firma nie ujawniła dokładnej liczebności próby pracowników biorących udział w tym badaniu, co utrudnia pełną statystyczną weryfikację wiarygodności tego wyniku. Niska spójność wynika z faktu, że granica między „współpracą” a „prowadzeniem” projektu jest często subiektywna i zależy od tego, jak interpretuje się samodzielne szukanie technicznych obejść problemów.

Prowadzenie to nie autonomia

Mimo chwytliwego hasła o „prowadzeniu” co czwartego zadania, Anthropic zaznacza, że nie mamy do czynienia z pełną autonomią (poziom AL5). Obecny status AL4 oznacza, że Claude potrafi samodzielnie analizować, poprawiać i testować kod, nie zadając inżynierowi pytań. Niemniej to wciąż człowiek podejmuje ostateczną decyzję o wdrożeniu jakichkolwiek zmian w systemach. Warto jednak podkreślić skalę zaangażowania algorytmów w codzienne operacje firmy – z danych za sierpień wynika, że sztuczna inteligencja współpracowała z ludźmi przy ponad 90% wszystkich prowadzonych prac badawczo-rozwojowych. Pokazuje to, że choć pełna autonomia jest rzadka, niemal każdy proces twórczy w Anthropic jest obecnie wspomagany przez Claude’a.

Wskaźnik 26% odnosi się do udziału czasu pracy ludzi, który został „przejęty” przez model, a nie do liczby kluczowych decyzji projektowych czy wyznaczania kierunków badań. W marcu tego samego roku wskaźnik ten wynosił zaledwie 1%, co Anthropic wykorzystuje jako argument w debacie o potrzebie większej przejrzystości i kontroli nad systemami, które coraz aktywniej budują swoich własnych następców.

  • Metodologia: Dane oparto na analizie logów i dokumentów przez AI, a nie na zewnętrznym audycie.
  • Zgodność: Pracownicy zgadzali się co do oceny poziomu automatyzacji tylko w co trzecim przypadku.
  • Brak autonomii: Każdy proces kończy się zatwierdzeniem przez człowieka przed wdrożeniem na produkcję.

Publikacja tych danych wydaje się elementem szerszej strategii Anthropic. Firma wskazuje, że ujawnienie tych wskaźników ma służyć zwiększeniu przejrzystości w kwestii rosnącej zależności laboratoriów od własnych modeli. W kontekście postulatów Dario Amodei o konieczności spowolnienia rozwoju AI, dane te są prezentowane jako argument w debacie o potrzebie ustanowienia lepszych systemów kontroli nad autonomicznym postępem technologii, która wymyka się precyzyjnym miarom nadzoru.