Bez kategorii

TBC i AWS ogłaszają model wideo „z neuronów”. W działaniu nie ma żadnych neuronów

The Biological Computing Co. i Amazon Web Services ogłosiły współpracę nad modelem wideo, który — jak twierdzi firma — generuje obraz pięć razy szybciej i przy 80 proc. niższych kosztach wnioskowania niż model bazowy. Ogłoszeniu nie towarzyszy produkt. Dostępny jest tylko formularz zapisu do wczesnego dostępu, a TBC nie podaje, na jakim modelu bazowym pracuje ani jakich rozdzielczości i długości klipów dotyczy obietnica.

Nazwa firmy sugeruje, że w obliczeniach biorą udział komórki nerwowe. Nie biorą. To, co TBC wpięłoby w model klienta, to oprogramowanie: adapter mniejszy niż 0,1 proc. rozmiaru modelu bazowego, działający na standardowej infrastrukturze. Nie potrzeba do tego biologicznego sprzętu ani zmiany procedur. „Neurony zostają w laboratorium” — tak ujmuje to sama firma.

Biologia siedzi więc w sposobie tworzenia oprogramowania, nie w jego działaniu. TBC hoduje komórki korowe na chipie z 4096 elektrodami, stymuluje je elektrycznie i mierzy, jak pobudzenie rozchodzi się w przestrzeni oraz jak zanika w czasie. Z tych pomiarów powstają niewielkie moduły, które wpięte w istniejące modele dyfuzyjne zmieniają ich zachowanie.

Czym jest ten adapter

Metodę widać wyraźnie na publicznym eksperymencie TBC z modelem świata Oasis — dyfuzyjnym modelem o około 600 milionach parametrów, który generuje klatki Minecrafta na podstawie działań gracza. Modele tego typu mają charakterystyczny problem: każda kolejna klatka zależy od poprzedniej, więc drobne błędy narastają i po kilku sekundach scena rozmywa się w bezkształtną plamę.

Zespół stymulował hodowlę obrazami — dane wizualne zamieniono na wzorce impulsów i podano komórkom przez wybrane elektrody. Neurony zareagowały, a pomiar pokazał, jak daleko sięga pobudzenie i jak szybko zanika. Te wartości stały się podstawą adaptera „Neural Dynamics Adapter”: modułu, który wpisuje w model jedną zasadę odczytaną z komórek — aktywność działa głównie lokalnie i wygasa. Działa to jak tłumik, który utrzymuje spójność sąsiednich fragmentów obrazu. Adapter ma około 156 tysięcy parametrów, a architektura modelu bazowego pozostaje bez zmian.

Na dziesięciu testowych wideo adapter wypadł o około 19 proc. lepiej niż sam Oasis, o 15 proc. lepiej niż zwykły fine-tuning i o 5 proc. lepiej niż adaptacja LoRA. Miara to entropia różnicowa obrazów, czyli ile informacji wizualnej zostało w klatce.

W kolejnym projekcie TBC zbudowało większy adapter — około trzech procent dodatkowych parametrów — i podniosło liczbę klatek z dwóch do blisko dziesięciu na sekundę. Zysk nie brał się z samego adaptera, lecz z ograniczenia liczby kroków obliczeniowych na klatkę. Niezależny test infrastrukturalny przeprowadzony przez Bluesky Compute wykazał około 4,4-krotnie niższy koszt wnioskowania i ponad trzykrotnie więcej spójnego wideo.

Czego brakuje w zapowiedzi z AWS

Dla komercyjnego modelu nie ma żadnych z tych szczegółów. TBC nie ujawnia modelu bazowego, sprzętu, rozdzielczości, długości klipu ani metryki jakości. „Pięć razy szybciej” i „80 procent taniej” to przy tym jeden efekt podany na dwa sposoby: jedna piąta czasu na GPU to właśnie 80-procentowa oszczędność, a komunikat nie precyzuje, do czego dokładnie odnosi się to porównanie. Nie ma też kontrolowanego zestawienia metody TBC z czysto cyfrowymi technikami, takimi jak destylacja czy cache’owanie, na tym samym modelu bazowym.

Eksperyment z Oasis pokazuje więc przede wszystkim metodę: skąd bierze się reguła wpisana w adapter i ile jest warta na konkretnym modelu. Ogłoszenie z AWS to na razie zapowiedź. Pod nazwą „neuron-derived” kryje się sposób powstania adaptera, nie sposób jego działania — a komercyjny produkt pozostaje komunikatem bez parametrów.