LLM

S1-mini: Nowy standard w czyszczeniu transkrypcji ASR od Superwhisper

Branża rozpoznawania mowy (ASR) od dawna boryka się z problemem „brudnych” danych. Nawet najlepsze systemy, takie jak Whisper, wiernie oddają każde zająknięcie, powtórzenie czy nieporadne sformułowanie, co sprawia, że surowa transkrypcja często nie nadaje się do bezpośredniej publikacji. Rozwiązaniem ma być S1-mini – nowy, kompaktowy model od Superwhisper, który zamiast zajmować się samym dźwiękiem, pełni rolę inteligentnego redaktora tekstu.

Dlaczego to ważne właśnie teraz? S1-mini to pierwszy model typu open-weights stworzony specjalnie do czyszczenia transkrypcji, który eliminuje konieczność wysyłania wrażliwych nagrań do chmury. W dobie rosnących wymagań dotyczących prywatności, narzędzie to pozwala na pełną obróbkę danych lokalnie, bez kompromisów w zakresie jakości tekstu wyjściowego.

Kompaktowa moc ukryta w 462 MB

S1-mini to model o parametrach rzędu 0,6B, oparty na architekturze Qwen3 z 28 warstwami i strukturą GQA. Mimo swoich niewielkich rozmiarów – wersja skwantyzowana GGUF zajmuje zaledwie 462 MB – wykazuje się imponującą skutecznością na poziomie 94,8% dokładności tokenów na zbiorze ponad 7,5 tysiąca przypadków testowych. Kluczowe jest tu jednak to, czym S1-mini nie jest: – S1-mini to normalizator tekstu, a nie transkrybent czy model do czatu – zaznaczają twórcy w dokumentacji. To wyspecjalizowane narzędzie, które w potoku przetwarzania danych zajmuje miejsce tuż po systemie ASR.

Model automatycznie usuwa wypełniacze (tzw. filler words), koryguje przejęzyczenia, stosuje interpunkcję i poprawną wielkość liter. Co więcej, potrafi inteligentnie formatować dane: dyktowane frazy typu – kropka com – czy kwoty pieniężne zamieniane są na standardowy zapis cyfrowy i symbole, co jest kluczowe w dokumentacji medycznej czy prawniczej.

Precyzyjna kontrola bez zbędnych halucynacji

Superwhisper postawił na minimalizm w interfejsie. Sterowanie modelem odbywa się za pomocą linii kontrolnej opartej na trzech osiach: Styl (od casual po formal), Struktura (proza lub lista) oraz Kontekst. Taka konstrukcja pozwala na uzyskanie przewidywalnych wyników bez ryzyka, że model zacznie dopisywać fakty, których mówca nie wypowiedział.

Dla deweloperów istotne są jednak pewne techniczne niuanse. S1-mini wymaga wyłączenia mechanizmu – myślenia – oraz stosowania zachłannego dekodowania (greedy decoding) z temperaturą ustawioną na zero. Zignorowanie tych ustawień drastycznie obniża jakość generowanego tekstu. Warto dodać, że obecna wersja v1 wspiera wyłącznie język angielski.

Prywatność przede wszystkim

Udostępnienie wag modelu na licencji Apache 2.0 otwiera drzwi dla przedsiębiorstw dbających o bezpieczeństwo. S1-mini może pracować lokalnie na procesorze laptopa. Dzięki temu wrażliwe transkrypcje audio nigdy nie muszą opuszczać infrastruktury klienta. Model jest już dostępny w serwisie Hugging Face, co pozwala na jego darmową integrację z własnymi aplikacjami do notatek czy systemami CRM.