Claude naprawia Claude’a: Anthropic deleguje utrzymanie kodu sztucznej inteligencji
Boris Cherny z Anthropic postanowił sprawdzić, czy model językowy poradzi sobie z zadaniem, którego większość programistów szczerze nienawidzi: rutynowym utrzymaniem kodu. „Dziwny eksperyment, który prowadzę od kilku tygodni, polega na tym, że Claude przejął codzienną konserwację naszych aplikacji” – napisał Cherny w serwisie X. Wyniki pokazują, że era autonomicznych agentów wchodzących do produkcji właśnie się zaczyna.
To wdrożenie jest istotne, ponieważ przesuwa dyskusję z teoretycznych możliwości AI na grunt realnej efektywności w cyklu życia oprogramowania. Wykorzystanie Claude Code do serwisowania działających systemów pokazuje, że automatyzacja nie musi ograniczać się do prostych skryptów, ale może obejmować złożone środowiska, od aplikacji mobilnych po SDK dla agentów. Według danych opublikowanych przez The Decoder, to pierwszy tak wyraźny dowód na to, że sztuczna inteligencja potrafi skutecznie zarządzać własnym długiem technicznym.
Automatyzacja bez ozdobników
System nie działa w próżni. Został zintegrowany z firmowym Slackiem, gdzie poprzez narzędzie Tag uruchamia dwanaście wyspecjalizowanych procedur. Cherny nie bawi się w skomplikowany prompt engineering; wydaje polecenia naturalnym językiem. Claude dostaje zadanie: przeprowadź testy typu crash fuzzer na rzeczywistych aplikacjach bez użycia atrap (mocków), znajdź błędy i przygotuj gotowe poprawki. Eksperyment obejmuje całe spektrum platform Anthropic – od iOS i Androida po wersje desktopowe i webowe.
Skuteczność na poziomie 46 procent
Liczby są konkretne. W ciągu zaledwie kilku tygodni Claude wygenerował 388 propozycji zmian w kodzie (pull requests). Po weryfikacji przez ludzi i systemy automatyczne, 180 z nich zostało zaakceptowanych i scalonych z głównymi repozytoriami. Współczynnik akceptacji wynoszący 46% sugeruje, że AI, choć nie jest nieomylna, potrafi już realnie odciążyć deweloperów z prac mechanicznych.
Spektrum zadań realizowanych przez model robi wrażenie:
- Crash Fuzzer: samodzielnie analizuje przyczyny awarii w symulatorach.
- Dead-Code Remover: tropi i usuwa nieużywane fragmenty oprogramowania.
- Logowanie zamiast usuwania: w sytuacjach niepewnych model najpierw dodaje logi, by sprawdzić, czy funkcja jest wywoływana, zanim ją skasuje.
- Naprawa testów CI: stabilizacja procesów budowania aplikacji.
W stronę autonomicznego utrzymania
Mimo że ponad połowa propozycji Claude’a trafiła do kosza, Cherny widzi w tym – jak sam określił – „wczesne oznaki życia”, dowodzące, że pełna autonomia jest możliwa. Gdy model popełnia błąd, zespół koryguje procedurę, co zazwyczaj pozwala AI na poprawne wykonanie zadania przy kolejnej próbie. Anthropic dąży do momentu, w którym mechaniczna konserwacja kodu będzie odbywać się poza zasięgiem uwagi inżynierów. Rola programisty przesuwa się w stronę nadzoru, a nie ręcznego poprawiania przestarzałych flag funkcji.
