„Humanity’s Last Exam”: Nowy test obnaża iluzję inteligencji współczesnych modeli AI
Era łatwych zwycięstw w rankingach MMLU dobiegła końca. Nowy test „Humanity’s Last Exam” (HLE) weryfikuje zdolność modeli AI do operowania na najwyższym poziomie specjalizacji, a jego wyniki pokazują, że obecne systemy są genialnymi statystykami, a nie ekspertami. Najlepsze modele wciąż zawodzą w starciu z prawdziwymi specjalistami.
Read More