TildeOpen LLM: Nowy, otwarty model językowy wspiera różnorodność językową Europy
W świecie zdominowanym przez modele językowe faworyzujące angielski, TildeOpen LLM stanowi powiew świeżości, oferując realną alternatywę dla użytkowników posługujących się mniej popularnymi językami europejskimi. Model, udostępniony 3 września 2025 roku na platformie Hugging Face, bazuje na architekturze transformera z 30 miliardami parametrów i jest dostępny na licencji CC-BY-4.0, co umożliwia jego szerokie wykorzystanie i modyfikacje.
Architektura i trening
TildeOpen LLM to wynik wytężonej pracy i wykorzystania mocy obliczeniowej europejskich superkomputerów LUMI (Finlandia) i JUPITER. Trening modelu pochłonął 2 miliony godzin GPU, które firma Tilde pozyskała dzięki grantowi Komisji Europejskiej. Model trenowano w oparciu o skrypty GPT-NeoX inspirowane EleutherAI, przetwarzając około 2 bilionów tokenów w 450 tysiącach iteracji. Zastosowano trójstopniowe próbkowanie danych: równomierne dla wszystkich języków, naturalne, aby wzmocnić języki z dużą ilością danych, i końcowe równomierne, aby zachować równowagę.
Hiperparametry modelu to 60 warstw, rozmiar osadzenia 6144, 48 głowic uwagi, okno kontekstowe o długości 8192 tokenów, aktywacje SwiGLU oraz kodowanie pozycyjne RoPE i normalizacja warstw RMSNorm.
Równość językowa i suwerenność danych
Dominacja języka angielskiego w popularnych modelach językowych prowadzi do słabszej wydajności w przypadku języków bałtyckich, słowiańskich i innych mniej rozpowszechnionych języków europejskich. TildeOpen LLM ma na celu rozwiązanie tego problemu poprzez zastosowanie „sprawiedliwego tokenizera”, który reprezentuje tekst w sposób zbliżony niezależnie od języka. To zmniejsza liczbę tokenów i zwiększa efektywność wnioskowania dla języków o mniejszej reprezentacji. Ponadto, organizacje mogą hostować model na własnych serwerach, w lokalnych centrach danych lub w chmurach zgodnych z wymogami UE, co zapewnia zgodność z GDPR i innymi regulacjami dotyczącymi ochrony danych, odpowiadając na obawy związane z suwerennością danych.
Strategiczna wizja
TildeOpen LLM to model bazowy, na którym będą budowane kolejne, wyspecjalizowane wersje, na przykład modele do tłumaczeń. Projekt ten jest również ważnym krokiem dla Łotwy i firmy Tilde, która pozycjonuje się jako eksporter technologii, aspirując do rozwoju europejskiej infrastruktury AI z uwzględnieniem różnorodności językowej.
Dostępność modelu ma także znaczenie badawcze. Badania nad modelami wielojęzykowymi wciąż wskazują na luki i niedoskonałości, szczególnie w przypadku języków bałtyckich, gdzie nawet zaawansowane modele open source mogą generować halucynacje lub wykazywać niedokładności leksykalne. To podkreśla potrzebę lokalnego rozwoju i dostosowywania modeli do specyfiki poszczególnych języków.
Podsumowanie
TildeOpen LLM to konkretny krok w kierunku uczynienia europejskiej sztucznej inteligencji nie tylko zgodną z regulacjami, ale także technicznym liderem w dziedzinie wspierania różnorodności językowej. Model ten oferuje transparentną architekturę, skalowalność i realne wsparcie dla mniej popularnych języków Europy.

Mega fajny projekt, w koncu cos dla mniej popularnych jezykow chyba sie przyda bo angielski zdominowal wszystko