Gen AI

Arabic AI Atlas porządkuje rozproszone zasoby sztucznej inteligencji dla języka arabskiego

W sieci pojawił się bezpłatny, otwarty katalog Arabic AI Atlas, stworzony przez Heshama Haroona z Rijadu. Projekt gromadzi w jednym repozytorium zasoby rozproszone dotąd w wielu różnych miejscach — na platformach takich jak Hugging Face i GitHub, w mediach społecznościowych oraz w publikacjach naukowych.

Katalog zawiera obecnie ponad 1000 modeli i narzędzi oraz ponad 1000 zbiorów danych. Obejmuje między innymi duże modele językowe, systemy rozpoznawania i syntezy mowy, narzędzia optycznego rozpoznawania znaków (OCR) oraz modele do tworzenia osadzeń (embeddings). Każdy wpis zawiera podstawowe metadane: organizację tworzącą, rozmiar, licencję oraz datę ostatniej aktualizacji.

Filtrowanie i integracja z klientami AI

Zasoby w Atlasie można przeglądać na interaktywnej mapie oraz filtrować według kraju, dialektu i typu licencji. Ułatwia to wyszukiwanie projektów spełniających konkretne wymagania prawne lub techniczne.

Ciekawym elementem projektu jest integracja ze standardem Model Context Protocol (MCP). Repozytorium zawiera serwer MCP, który pozwala asystentom AI odpytywać bazę Atlasu w trybie offline. Dzięki temu dowolny zgodny klient AI może bezpośrednio przeszukiwać katalog i odpowiadać na pytania programistów — na przykład o to, jaki otwarty model syntezy mowy dla wybranego dialektu sprawdzi się na urządzeniach mobilnych.

Zestawienie zasobów wskazuje konkretne luki

Liczba wpisów w katalogu odzwierciedla stan zgłoszonych projektów, a nie całościowy poziom prac badawczych w danym regionie. Najwięcej pozycji przypisano Arabii Saudyjskiej (355), Zjednoczonym Emiratom Arabskim (184) oraz Egiptowi (175). W podziale na odmiany językowe dominuje współczesny standardowy język arabski (441 wpisów), a za nim plasują się kategorie mieszane i maghrebskie.

Twórca katalogu zwraca uwagę, że wiele rozwiązań dla lokalnych odmian języka powstaje dzięki pracy pojedynczych twórców i społeczności, a ich dorobek rzadko bywa systematycznie katalogowany.

Atlas wskazuje również 15 konkretnych luk w otwartych zasobach dla języka arabskiego. Na liście braków znalazły się m.in. otwarta synteza mowy dla dialektów kuwejckiego i katarskiego, libijski korpus tekstowy, palestyński model rozpoznawania mowy oraz otwarty benchmark dla arabskiego pisma odręcznego. W obecnej wersji repozytorium nie ma także ani jednego wpisu powiązanego z Mauretanią.