Dlaczego Claude może pisać gorzej, gdy lepiej radzi sobie z kodem. Inżynier Anthropic tłumaczy kompromisy w treningu
Szybkie postępy modeli sztucznej inteligencji w matematyce, programowaniu czy logicznym rozumowaniu nie zawsze przekładają się na bardziej przystępny styl wypowiedzi. Jackson Kernion, inżynier z Anthropic zajmujący się dostrajaniem Claude’a, przedstawił mechanizm, który jego zdaniem stoi za powstawaniem gęstych, trudniejszych w odbiorze odpowiedzi.
Według Kerniona modele były optymalizowane pod kątem zadań technicznych i uczyły się tworzyć wyjaśnienia zrozumiałe również dla innych systemów AI. Prowadzi to do wytworzenia stylu dostosowanego do specyfiki modeli językowych, które dysponują inną pamięcią roboczą niż ludzie i analizują informacje ze znacznie większą szczegółowością. W efekcie odpowiedzi zoptymalizowane pod systemy techniczne mogą być dla ludzkiego czytelnika przeładowane detalami i nienaturalnie sformułowane.
Kluczową rolę odgrywa tu system nagród stosowany podczas uczenia przez wzmacnianie. Poszczególne sygnały mogą premiować zrozumiałość dla innych modeli albo czytelność dla człowieka. Gdy nacisk w treningu przesuwa się mocno w stronę kodu i ścisłego wnioskowania, czytelność tekstu dla ludzi trzeba osobno wzmacniać, równoważąc ją nagrodami za prostsze wyjaśnienia.
W opinii Kerniona wersja Opus 5.5 lepiej balansuje te cele. Inżynier zaznaczył, że to pierwsze wydanie od czasu Opus 4.6, z którego jakości pisania jest tak zadowolony. Nie jest to jednak deklaracja, że nowsza wersja przewyższa Opus 4.6 pod względem stylu, a jedynie ocena pracownika zaangażowanego w rozwój modelu, wskazująca na postęp w opanowywaniu nadmiernie przeładowanych odpowiedzi.
