Hardware

Eksperymentalny procesor optyczny z UCLA analizuje 15 nagrań naraz. Wykrywa deepfake’i ze średnią dokładnością 97,8 proc.

Badacze z Uniwersytetu Kalifornijskiego w Los Angeles (UCLA) opracowali eksperymentalny hybrydowy procesor optyczno-neuronowy przeznaczony do wstępnego wykrywania deepfake’ów. W odróżnieniu od wielu klasycznych systemów cyfrowych, które analizują nagrania jedno po drugim, układ wykorzystuje zjawisko fizycznej propagacji światła do równoległej oceny wielu materiałów wideo w jednym przebiegu.

W teście laboratoryjnym przeprowadzonym na 15 filmach z bazy Celeb-DF system uzyskał średnią dokładność na poziomie 97,79 proc. Czułość układu, czyli zdolność do poprawnego rozpoznawania zmanipulowanych nagrań, wyniosła 99,86 proc., natomiast swoistość — 95,72 proc. Wynik ten dotyczy ściśle określonych warunków testowych i konkretnego zbioru danych, a nie uniwersalnej skuteczności wobec wszelkich fałszywych treści w sieci.

Kompromis między liczbą nagrań a dokładnością

Konstrukcja układu opiera się na podziale zadań między elektronikę i optykę. Lekki cyfrowy enkoder wstępnie przetwarza cechy przestrzenne i czasowe każdego nagrania, zamieniając je we wzór fazowy wyświetlany na modulatorze światła. Następnie fala świetlna przechodzi przez pasywny dekoder optyczny złożony z warstw dyfrakcyjnych, gdzie operacje obliczeniowe zachodzą bezpośrednio w trakcie propagacji promieniowania.

Eksperymenty pokazały jednak wyraźny kompromis przy próbie zwiększenia skali. Gdy badacze podnieśli liczbę jednocześnie analizowanych nagrań z 15 do 18, średnia dokładność detekcji spadła do 96,13 proc. W trudniejszych wariantach manipulacji zespół dołożył do układu dwie dodatkowe pasywne warstwy dyfrakcyjne, co podniosło dokładność o około 6,8 proc. Ponieważ warstwy te działają bez dodatkowego zasilania elektrycznego, rozbudowa części optycznej nie pociąga za sobą takiego wzrostu poboru energii, jak dodawanie kolejnych warstw w cyfrowych sieciach neuronowych.

Test z generatorem VEO-3

Osobny sprawdzian przeprowadzono na materiałach wideo wygenerowanych przez model VEO-3. Tego typu generatory tworzą syntetyczne wideo od podstaw, często bez artefaktów typowych dla klasycznych podmian twarzy. Po niewielkim dostrojeniu procesor osiągnął na wcześniej niewidzianych próbkach z VEO-3 dokładność 94,80 proc. oraz czułość 97,61 proc. Wynik ten pokazuje podatność architektury na adaptację, lecz nie stanowi dowodu na równą skuteczność wobec wszystkich nowo powstających modeli generatywnych.

Autorzy projektu nie pozycjonują procesora jako samodzielnego narzędzia mającego zastąpić zaawansowane detektory cyfrowe. Układ został zaprojektowany jako szybkie sito pierwszego kontaktu: ma masowo i równolegle przesiewać duże strumienie wideo, odfiltrowując ewidentnie autentyczne materiały, a nagrania oznaczone jako podejrzane przekazywać do dokładniejszej weryfikacji cyfrowej. Rozwiązanie pozostaje na etapie eksperymentu laboratoryjnego i nie zostało dotąd wdrożone komercyjnie.