Medyczne AI jak leki. Naukowcy z Bristolu proponują nowy standard testowania algorytmów
Współczesna medycyna od dekad radzi sobie z substancjami, których mechanizm działania na poziomie komórkowym nie zawsze jest w pełni zrozumiały. Zamiast jednak rezygnować z ich stosowania, lekarze wypracowali surowe procedury weryfikacji i precyzyjne instrukcje obsługi. Naukowcy z University of Bristol przekonują na łamach swojej najnowszej pracy, że to samo podejście należy zastosować wobec sztucznej inteligencji. Proponują oni framework „Learning Ensemble” (LE), który ma zapobiec sytuacjom, w których algorytmy imponują skutecznością w laboratorium, ale zawodzą w zderzeniu z rzeczywistością szpitalną. Propozycja została opisana w pracy zatytułowanej „Explainable machine learning practices: opening another black box”, dostępnej w repozytorium University of Bristol oraz jako preprint w serwisie arXiv pod numerem 2012.08333v3.
Kiedy statystyka kłamie
Głównym problemem medycznego AI jest tendencja do wyłapywania fałszywych korelacji. Systemy potrafią postawić trafną diagnozę nie na podstawie analizy biologicznej, lecz wychwytując markery techniczne obrazu, charakterystyczne dla konkretnego aparatu RTG. W badaniach z 2021 roku wykazano na przykład, że niektóre modele rozpoznawały COVID-19 nie po zmianach w płucach, lecz po detalach tła zdjęcia rentgenowskiego. Szczegółowa analiza tego problemu w kontekście obrazowania klatki piersiowej została opublikowana w bazach PubMed oraz PMC, wskazując na ryzyko powielania uprzedzeń systemowych przez algorytmy uczące się cech technicznych zamiast klinicznych.
Badacze z Bristolu sugerują, by zamiast walczyć z naturą „czarnej skrzynki” algorytmów, skupić się na dokumentowaniu warunków ich użycia. Koncepcja LE dzieli ten proces na trzy kluczowe obszary:
- Granice operacyjne: Dokumentacja musi precyzyjnie określać, na jakich danych system był trenowany i dla jakich placówek oraz urządzeń jest przeznaczony. Ma to wyeliminować błędy wynikające z przenoszenia AI do środowiska, którego algorytm „nie rozumie”.
- Równość diagnostyczna: Modele często osiągają dobre średnie wyniki, ale znacznie częściej mylą się w grupach defaworyzowanych społecznie. Bez systematycznego testowania pod kątem sprawiedliwości diagnostycznej AI może pogłębiać istniejące nierówności w opiece zdrowotnej.
- Użyteczność kliniczna: System technicznie sprawny może być klinicznie bezużyteczny. Dowodzi tego przykład algorytmu oceniającego ryzyko u pacjentów z zapaleniem płuc i astmą. W danych treningowych ta grupa przeżywała częściej, więc AI uznała ich za osoby niskiego ryzyka. W rzeczywistości ich dobre wyniki były efektem agresywnego leczenia na SOR, a nie braku zagrożenia. Dla systemu segregacji pacjentów (triage) taka informacja jest błędna i niebezpieczna.
Punkt wyjścia dla regulacji
Zamiast wymagać od programistów pełnej przejrzystości kodu, co w przypadku głębokiego uczenia jest niemal niemożliwe, framework stawia na rygorystyczną walidację zewnętrzną. Naukowcy traktują swoją propozycję jako punkt wyjścia do dyskusji o standardach, a nie gotowe, uniwersalne rozwiązanie. Budowa niezawodnego AI pozostaje procesem żmudnym, wymagającym traktowania algorytmu jak produktu medycznego, który potrzebuje jasnej „ulotki” z przeciwwskazaniami i precyzyjnym zakresem stosowania.
