Microsoft udostępnia model transkrypcji na żywo i nowe generatory mowy
Microsoft AI udostępnił MAI-Transcribe-2-Streaming – model przeznaczony do transkrypcji mowy w czasie rzeczywistym. Narzędzie obsługuje 60 języków, a pierwsze częściowe wyniki zwraca po nieco ponad 100 milisekundach. Według deklaracji Microsoftu rozwiązanie zajmuje pierwsze miejsce pod względem dokładności w zestawieniu Artificial Analysis. Do końca roku promocyjny koszt usługi wynosi 0,54 dolara za godzinę przetworzonego materiału audio.
Równolegle firma wprowadziła dwa modele zamiany tekstu na mowę: standardowy MAI-Voice-2.1 oraz zoptymalizowany pod kątem szybkości MAI-Voice-2.1-Flash. Oprogramowanie potrafi generować wypowiedzi w 23 językach, zachowując tożsamość głosu i nadając mu naturalny akcent właściwy dla danego języka.
Oba warianty głosowe umożliwiają klonowanie głosu na podstawie zaledwie kilkusekundowej próbki nagrania. W przeprowadzonym teście z udziałem 4000 osób około połowa uczestników uznała wygenerowane próbki za nagrania prawdziwych ludzi. Microsoft deklaruje wbudowanie zabezpieczeń ograniczających nadużycia, jednak nie ujawnia szczegółów dotyczących mechanizmu ich działania.
Wersja MAI-Voice-2.1-Flash charakteryzuje się deklarowanym opóźnieniem na poziomie 150 milisekund. Koszt jej użycia ustalono na 15 dolarów za milion znaków, podczas gdy wariant standardowy wyceniono na 22 dolary za milion znaków. Nowe narzędzia udostępniono w Microsoft Foundry oraz MAI Playground, a modele syntezy mowy trafiły również do katalogu platformy OpenRouter.
