R & D

LLMR & DRozumowanie

Tencent udostępnia Hunyuan-A13B: nowy model MoE z „myśleniem” dwumodowym i kontekstem 256K

Zespół Hunyuan firmy Tencent zaprezentował otwarty model językowy Hunyuan-A13B, oparty na architekturze rzadkiej mieszaniny ekspertów (MoE). Model, choć zbudowany na 80 miliardach parametrów, aktywuje ich zaledwie 13 miliardów podczas wnioskowania, co zapewnia efektywną równowagę między wydajnością a kosztami obliczeniowymi. Model wyróżnia się obsługą uwagi grupowej (GQA), długim oknem kontekstowym 256 tys. tokenów oraz innowacyjnym systemem rozumowania dwumodowego, łączącym „myślenie” szybkie i powolne.

Read More
Gen AIR & D

Przełom w rozumieniu generalizacji modeli Flow Matching: klucz tkwi w zawodności przybliżeń

Nowe badania rzucają światło na mechanizmy generalizacji w modelach generatywnych Flow Matching, odchodząc od dotychczasowych założeń o roli stochastyczności. Wyniki wskazują, że za zdolność do tworzenia nowych danych odpowiada niedoskonałość sieci neuronowych w dokładnym odwzorowaniu pola prędkości, zwłaszcza na wczesnych etapach trajektorii.

Read More
LLMR & D

Przełom w modelowaniu języka: Meta wprowadza AU-Net, model omijający ograniczenia tokenizacji

Badacze z Meta AI, we współpracy z europejskimi instytutami, zaprezentowali Autoregresyjny U-Net (AU-Net) – innowacyjny model przetwarzający język bezpośrednio na poziomie bajtów. Rozwiązanie to stanowi potencjalną alternatywę dla kosztownych i skomplikowanych modeli transformerowych, oferując liniową złożoność i lepszą skalowalność, szczególnie w kontekście zadań wielojęzycznych.

Read More
Data ScienceLLMR & D

HtFLlib: Nowe narzędzie do oceny rozproszonego uczenia heterogenicznego

Instytucje zajmujące się sztuczną inteligencją często rozwijają wyspecjalizowane, heterogeniczne modele AI, by sprostać konkretnym zadaniom. Niestety, proces ten nierzadko napotyka na problem niedoboru danych treningowych. Tradycyjne podejścia do uczenia rozproszonego (Federated Learning – FL) pozwalają wyłącznie na współpracę modeli o identycznych architekturach, co w praktyce ogranicza ich zastosowanie. Problem ten częściowo rozwiązuje heterogeniczne uczenie rozproszone (Heterogeneous Federated Learning – HtFL), jednak dotychczas brakowało ujednoliconych narzędzi do jego kompleksowej oceny w różnorodnych zastosowaniach. Nowa biblioteka HtFLlib ma ambicję to zmienić.

Read More
Agenci AIR & D

Przełom w szkoleniu agentów webowych: Go-Browse z Carnegie Mellon otwiera nowe perspektywy

Agenci webowi, mimo rosnącej złożoności, wciąż borykają się z dynamicznym środowiskiem internetu. Nowe badania z Carnegie Mellon University prezentują Go-Browse – system, który radykalnie zmienia podejście do zbierania danych treningowych, otwierając drogę do inteligentniejszych i bardziej adaptacyjnych autonomicznych narzędzi do nawigacji w sieci.

Read More