Weryfikacja dokumentów przy onboardingu. Dlaczego narzędzie do paszportów nie sprawdzi wyciągu bankowego
Paszport, wyciąg bankowy, rachunek za media czy wypis z rejestru działalności gospodarczej — zdalny onboarding wymaga weryfikacji zupełnie różnych typów plików. W praktyce nie istnieje jedno uniwersalne narzędzie, które równie skutecznie radzi sobie z każdym z nich, ponieważ metody fałszowania różnią się w zależności od rodzaju dokumentu.
W procesach weryfikacyjnych występują cztery główne kategorie nadużyć, z których każda wymaga innych metod detekcji:
- Fizyczne podróbki: wymagają sprawdzania zabezpieczeń blankietu, geometrii i cech fizycznych oraz weryfikacji liveness, aby upewnić się, że przed kamerą znajduje się prawdziwy dokument, a nie jego wydruk lub zdjęcie wyświetlone na ekranie.
- Edycja autentycznych plików cyfrowych: polega na modyfikacji danych w prawdziwym dokumencie PDF; jej wykrycie opiera się na analizie metadanych, struktury pliku, artefaktów kompresji czy niespójności czcionek.
- Dokumenty generowane przez AI: tworzone syntetycznie od podstaw, wymagają modeli wychwytujących specyficzne ślady generatywne, zniekształcenia mikrotekstur lub błędy w układzie graficznym.
- Seryjne oszustwa oparte na szablonach: polegają na masowym składaniu wniosków z wykorzystaniem tych samych wzorców lub spreparowanych danych. Dokument oceniany w izolacji może wyglądać na całkowicie poprawny, a podejrzenia budzi dopiero to, że ten sam szablon czy element graficzny pojawia się w wielu różnych zgłoszeniach.
Dwie grupy dokumentów i różne specjalizacje
Kluczowy podział funkcjonalny dotyczy typu weryfikowanych materiałów. Pierwszą grupę stanowią urzędowe dokumenty tożsamości, takie jak dowody osobiste czy paszporty. Drugą są dokumenty uzupełniające — wyciągi bankowe, paski wynagrodzeń, deklaracje podatkowe czy dokumentacja firmowa. Narzędzie zoptymalizowane pod kątem odczytu strefy MRZ i zabezpieczeń dowodu osobistego zazwyczaj nie potrafi ocenić spójności salda na wyciągu ani wykryć manipulacji w tabeli finansowej.
Przegląd siedmiu popularnych rozwiązań pokazuje wyraźne różnice w ich architekturze i przeznaczeniu:
- AU10TIX: łączy moduły do sprawdzania tożsamości z osobnym modułem AnyDoc do analizy dokumentów uzupełniających (wyciągi, rachunki, licencje). System zawiera moduł Serial Fraud Monitor, który analizuje powiązania i anomalie krzyżowe między wieloma wnioskami, zamiast badać każdy plik wyłącznie osobno.
- Resistant AI: specjalizuje się w badaniu dokumentów cyfrowych (PDF, obrazy). Koncentruje się na analizie metadanych, strukturze plików i czcionkach, a także na porównywaniu zgłoszeń między sobą w celu wykrywania powtarzających się szablonów i ingerencji cyfrowych.
- Inscribe: łączy techniczną analizę pikseli i metadanych z weryfikacją spójności treści oraz wykrywaniem seryjnych powiązań między wnioskami. Narzędzie jest projektowane pod kątem dokumentacji finansowej, podatkowej i rejestrowej firm, a także praw jazdy.
- Ocrolus: rozwiązanie stworzone głównie z myślą o procesach kredytowych. Rozdziela detekcję manipulacji w samym pliku od weryfikacji danych liczbowych. Poza analizą manipulacji tekstem sprawdza logiczną poprawność sald, sum czy kwot podatkowych na wyciągach i formularzach dochodowych.
- Regula: wyspecjalizowane oprogramowanie do dokumentów tożsamości. Bada zabezpieczenia blankietów, dane z warstwy wizualnej i kodów kreskowych oraz informacje odczytywane ze strefy MRZ i chipów NFC, a w procesach zdalnych wykrywa próby podstawienia kopii lub obrazu wyświetlanego na ekranie.
- Microblink: silnik ukierunkowany na szybką weryfikację dokumentów tożsamości. Sprawdza zabezpieczenia, spójność pól i autentyczność dokumentu pokazywanego przed aparatem. Pozwala dostosować rygor reguł decyzyjnych do profilu ryzyka organizacji.
- Incode: platforma tożsamościowa rozwijająca moduł Deepsight for Documents, ukierunkowany na wykrywanie syntetycznych dokumentów generowanych przez AI oraz prób wstrzykiwania spreparowanych strumieni wideo do procesu weryfikacji.
Jak porównywać skuteczność w praktyce
Podawane przez producentów wskaźniki dokładności i czasu przetwarzania pochodzą z ich własnych środowisk testowych i nie stanowią obiektywnego rankingu. Wysoka skuteczność uzyskana na dobrej jakości skanach z jednego kraju nie gwarantuje, że system poradzi sobie z nieostrymi zdjęciami z telefonu lub niestandardowymi dokumentami firmowymi z innego regionu.
Przed wyborem rozwiązania konieczne jest przeprowadzenie testów na własnych danych. Rzetelne porównanie powinno uwzględniać:
- próbkę autentycznych dokumentów z rzeczywistego procesu (w tym zdjęcia słabej jakości, wykonane w trudnym oświetleniu),
- zestaw przykładów oszustw obejmujący wszystkie istotne dla organizacji ryzyka: fizyczne manipulacje, edycję PDF, dokumenty generowane syntetycznie oraz zgłoszenia seryjne,
- rozdzielenie testów dla dokumentów tożsamości i dokumentów finansowych,
- pomiar nie tylko wykrytych nadużyć, lecz także odsetka fałszywych alarmów (błędnego odrzucenia prawdziwych klientów) oraz liczby spraw kierowanych do ręcznej weryfikacji,
- jakość uzasadnienia werdyktu — automatyzacja nie eliminuje w całości pracy analityków, a w sprawach niejednoznacznych kluczowa jest czytelna informacja o powodzie oznaczenia pliku jako podejrzanego.
Ostateczny dobór technologii nie zależy od uniwersalnych deklaracji dostawców, lecz od tego, jakie dokumenty trafiają do procesu i czy głównym zagrożeniem są sfałszowane tożsamości, zmanipulowane dane finansowe czy masowe ataki z wykorzystaniem powtarzalnych szablonów.
