R & D

Agenci AIR & D

ServiceNow Research udostępnia DRBench — benchmark dla „głębokich badań” w środowisku korporacyjnym

DRBench to konteneryzowane środowisko testowe i zestaw zadań zaprojektowany do oceny agentów potrafiących łączyć informacje z publicznego internetu i prywatnych zasobów firmy oraz przygotowywać cytowane, rzeczowe raporty. Narzędzie stawia na realizm: rozproszone pliki, e‑maile, czaty i systemy plików zamiast jedynie przeglądania sieci.

Read More
Agenci AILLMR & D

W4S: meta-agent uczący się pisać workflowy, które wykorzystują silniejsze LLM — bez ich strojenia

Zespół ze Stanford, EPFL i UNC proponuje Weak-for-Strong (W4S) — ramę RL, w której niewielki, 7-miliardowy „słaby” meta-agent uczy się projektować i iteracyjnie poprawiać wykonywalne workflowy w Pythonie, które delegują zadania do silniejszego modelu wykonawczego. Kluczowy pomysł: optymalizować orkiestrację, nie wagi potężnego modelu. Autorzy raportują znaczące poprawy wydajności przy niskim koszcie i krótkim czasie trenowania meta-agenta.

Read More