Nowe możliwości w skalowaniu Reinforced Learning dla modeli Llama: Projekt OctoThinker
Naukowcy z Uniwersytetu Jiao Tong w Szanghaju zaprezentowali OctoThinker, dwuetapową strategię mid-treningu, która radykalnie poprawia kompatybilność modeli Llama z uczeniem wzmacniającym. To rozwiązanie może otworzyć drogę do nowych zastosowań AI, gdzie efektywne skalowanie CoT jest kluczowe.
Read More