Koniec taryfy ulgowej. OpenAI podważa rzetelność testów programistycznych i wycofuje poparcie dla SWE-bench
OpenAI wycofuje poparcie dla testu SWE-bench Verified po audycie, który wykazał, że blisko 60 proc. sprawdzanych zadań zawiera błędy, a modele zamiast programować, kopiują gotowe rozwiązania z danych treningowych.
Read More