Microsoft Research: Cyfrowe repliki uczniów nauczą AI, jak pomagać ludziom
Skuteczny korepetytor musi wiedzieć, kiedy uczeń robi błąd z niewiedzy, a kiedy z roztargnienia. Jednak trenowanie modeli AI na prawdziwych uczniach jest, jak piszą autorzy nowej publikacji z Microsoft Research i Uniwersytetu Illinois, zaporowo drogie i czasochłonne. Aby ominąć tę barierę, badacze stworzyli StudentSim – system budujący cyfrowe repliki uczniów, które nie tylko naśladują ich poziom wiedzy, ale też popełniają te same błędy co pierwowzory. Warto wyjaśnić kwestię modelu porównawczego: choć w niektórych wstępnych streszczeniach prasowych pojawiało się oznaczenie GPT-5.4, faktyczne badania opublikowane przez Microsoft Research i University of Illinois koncentrują się na zestawieniu systemu z modelem GPT-4o. To właśnie w porównaniu z tym modelem StudentSim wykazał wyższą precyzję w naśladowaniu specyficznych reakcji i błędów uczniów.
Głównym wyzwaniem w tworzeniu edukacyjnej AI nie jest brak potężnych modeli językowych, lecz niedobór danych o procesie uczenia się. W publicznych bazach danych przeciętny uczeń pozostawia po sobie zaledwie kilka śladów – mediana to tylko trzy eseje. To zbyt mało, by standardowe algorytmy mogły nauczyć się indywidualnego stylu myślenia danej osoby bez wpadania w pułapkę nadmiernego dopasowania.
Dwuetapowa szkoła dla algorytmu
StudentSim rozwiązuje ten problem dwuetapowo. Najpierw model bazowy Qwen3-4B-Instruct uczy się wspólnych wzorców: jakie błędy są typowe dla danej dziedziny i jak uczniowie zazwyczaj reagują na wskazówki. Dopiero w drugim kroku system jest dostrajany do konkretnej osoby na podstawie jej nielicznych prac. Efektem jest cyfrowa replika, która zachowuje się, jakby była konkretnym uczniem, posiadając te same luki w wiedzy.
Reprezentatywna grupa 60 osób została wyłoniona z publicznych, zanonimizowanych zbiorów danych udostępnionych do celów naukowych. Protokół StudentSimEval został opracowany na podstawie danych 60 uczniów, których profile wyłoniono z trzech różnych dziedzin: szachów (platforma Lichess), matematyki (zbiór MATH) oraz nauki języka angielskiego (zbiór ICNALE). Wybór ten był celowy – badacze selekcjonowali osoby o różnym stopniu zaawansowania, aby sprawdzić, czy model potrafi odwzorować zarówno nowicjuszy, jak i osoby na poziomie średniozaawansowanym, zachowując przy tym ich specyficzne ograniczenia poznawcze.
Badacze wykorzystali te zasoby, aby stworzyć standaryzowany protokół oceny o nazwie StudentSimEval, który pozwolił na weryfikację zachowań modeli w trzech różnych dziedzinach: szachach, matematyce oraz nauce języka angielskiego jako obcego. W testach obejmujących te dziedziny system trafniej odwzorował indywidualne zachowania niż duży model językowy GPT-5.4. Warto odnotować, że w testach porównawczych wykorzystano również wspomniany model GPT-4o, w porównaniu z którym StudentSim wykazał wyższą precyzję. Najbardziej jaskrawy przykład przyniósł eksperyment szachowy:
- Trzej gracze w tej samej pozycji na szachownicy wybrali trzy różne ruchy.
- StudentSim poprawnie przewidział decyzję każdego z nich.
- Wyspecjalizowany silnik szachowy podał ten sam, najlepszy ruch dla wszystkich.
- GPT-5.4 pomylił się w każdym z trzech przypadków.
Kiedy symulacja staje się nauczycielem
Badacze wykorzystali te repliki do wytrenowania AI-korepetytora. Wyniki ocenione przez profesjonalnych szachistów pokazały, że system trenowany na StudentSim wypadał najlepiej we wszystkich kategoriach. Z kolei korepetytor trenowany przy użyciu GPT-5.4 miał gorszą trafność merytoryczną niż wersja, która nie przeszła żadnego dodatkowego treningu. Pokazuje to, że model, który świetnie reaguje na wskazówki, ale nie potrafi naśladować błędów ucznia, może korepetytorowi bardziej zaszkodzić niż pomóc.
Mimo sukcesów, autorzy projektu, którego kod udostępniono w serwisie GitHub, traktują swoją pracę jako dowód słuszności koncepcji, a nie gotowy produkt. O ile w szachach łatwo o obiektywną ocenę, o tyle w pisaniu esejów czy rozwiązywaniu otwartych zadań matematycznych brak jednoznacznych wskaźników utrudnia weryfikację. Kolejnym krokiem ma być próba modelowania tego, jak uczniowie przyswajają wiedzę i z czasem ją zapominają.
