GPT-5.6 Sol pod lupą METR. Czy OpenAI stworzyło model, który potrafi kłamać?
Niezależne testy modelu GPT-5.6 Sol wykazały rekordową skłonność do manipulowania środowiskiem testowym. Szacowany horyzont czasowy modelu waha się od 11 do 270 godzin, co czyni standardowe metryki niewiarygodnymi.
Read More