Bez kategorii

Szef alignmentu w Anthropic: naprawdę wierzymy, że AI może zabić wszystkich ludzi

Jacob Coxon zrezygnował z pracy w Anthropic. Powód, który podał, był nietypowy nawet jak na firmę zajmującą się bezpieczeństwem sztucznej inteligencji: jego zdaniem liderzy branży „hazardują naszym życiem”. Coxon nie krytykował konkurencji ani polityków — mówił o ludziach, z którymi pracował.

Na jego odejście odpowiedział Evan Hubinger, który w Anthropic odpowiada za alignment, czyli badania nad tym, by modele AI działały zgodnie z ludzkimi intencjami. Na platformie X napisał, że „naprawdę szczerze” wierzy, iż AI może zabić wszystkich ludzi, i oszacował prawdopodobieństwo takiego scenariusza na ponad 10 proc. w ciągu najbliższej dekady. Nie złagodził tego później — wypowiedź stoi w wątku, w którym odnosi się wprost do argumentów Coxona.

To nie są ostrzeżenia z zewnątrz. Coxon pracował w firmie, która reklamuje się jako ta bardziej ostrożna spośród laboratoriów frontierowych, a Hubinger nadal w niej pracuje i jest jedną z osób odpowiedzialnych za to, żeby kolejne modele nie robiły rzeczy, których nie powinny. Dokładnie ta sama firma przygotowuje się do wejścia na giełdę.

Prospekt emisyjny z ryzykiem egzystencjalnym

Anthropic złożyło w amerykańskiej komisji papierów wartościowych dokument rejestracyjny S-1, pierwszy krok do IPO. Standardowo w takim dokumencie sekcja „czynniki ryzyka” wymienia wszystko, co mogłoby zaszkodzić biznesowi: konkurencję, regulacje, zależność od dostawców, pozwy sądowe. Jeżeli kluczowy pracownik firmy publicznie twierdzi, że istnieje ponad dziesięcioprocentowa szansa na wyginięcie ludzkości w ciągu dekady, pojawia się pytanie, czy to też trzeba tam umieścić — i jak to sformułować, żeby nie brzmiało jak przyznanie się do winy.

Dyskusja, którą wywołały oba wpisy, toczyła się między innymi w podcaście Equity serwisu TechCrunch. Pojawił się w niej wątek, że tego rodzaju ostrzeżenia mogą w obecnym klimacie inwestycyjnym działać na korzyść firmy — bo sugerują, że jej technologia jest tak potężna, iż wymyka się pojęciu. To jednak interpretacja komentatorów, nie ustalenie. Żadne dane nie pokazują, jak na takie deklaracje reagują inwestorzy instytucjonalni, którzy będą wyceniać akcje Anthropic.

Warto odróżnić dwie rzeczy. Jedna to marketing: komunikat „nasza technologia jest tak silna, że może was zabić” faktycznie może brzmieć jak pokaz możliwości. Druga to wewnętrzna niespójność: szefowie firm mówią o ryzyku, a jednocześnie forsują coraz szybszy rozwój. Coxon nie odszedł z powodu złego PR-u — odszedł, bo uznał, że firma i branża robią coś, z czym nie chce mieć nic wspólnego.

Hubinger nie przedstawił żadnych podstaw swojego szacunku poza stwierdzeniem, że tak właśnie wierzy. Nie ma tu modelu ani danych, które można by sprawdzić — jest liczba rzucona publicznie przez osobę zajmującą się bezpieczeństwem modeli w firmie przygotowującej się do debiutu giełdowego. To zostawia inwestorów i regulatorów z pytaniem, które jest znacznie mniej wygodne niż samo ostrzeżenie: co dokładnie Anthropic wie o ryzyku własnej technologii i co z tym robi.