Tencent

LLMR & DRozumowanie

Tencent udostępnia Hunyuan-A13B: nowy model MoE z „myśleniem” dwumodowym i kontekstem 256K

Zespół Hunyuan firmy Tencent zaprezentował otwarty model językowy Hunyuan-A13B, oparty na architekturze rzadkiej mieszaniny ekspertów (MoE). Model, choć zbudowany na 80 miliardach parametrów, aktywuje ich zaledwie 13 miliardów podczas wnioskowania, co zapewnia efektywną równowagę między wydajnością a kosztami obliczeniowymi. Model wyróżnia się obsługą uwagi grupowej (GQA), długim oknem kontekstowym 256 tys. tokenów oraz innowacyjnym systemem rozumowania dwumodowego, łączącym „myślenie” szybkie i powolne.

Read More