Bez kategorii

Basecamp Research ma 140 mln dolarów na modele biologiczne. To zakład o dane, nie o gotowe leki

Basecamp Research, londyński startup rozwijający modele biologiczne, zebrał 140 mln dolarów w rundzie prowadzonej przez S32. Do inwestorów dołączyły m.in. Nvidia, Anthology Fund Anthropica, NATO Innovation Fund i Redalpine. Firma szkoli modele z rodziny EDEN na materiale genetycznym zbieranym w miejscach, które dopiero zaczęto badać — w lasach deszczowych, oceanach, gorących źródłach i na Antarktydzie. Zwycięskim pomysłem jest przekształcenie ewolucji w dane treningowe, a tych danych — w leki.

To jednak nie jest zakład o to, że AI wkrótce zaprojektuje gotowe terapie. Opublikowany przez firmę pipeline pokazuje, że żaden z sześciu programów terapeutycznych nie wyszedł poza etap optymalizacji kandydatów (lead optimization). Runda 140 mln dolarów to przede wszystkim zakład o skalę danych biologicznych — a tych, zdaniem CTO Phila Lorenza, publiczne bazy nie zastąpią.

Biologia potrzebuje danych z natury

Lorenz przekonuje, że problem biologii jest nieporównywalnie trudniejszy niż modeli językowych. Publiczne bazy genetyczne są bowiem głęboko niereprezentatywne. Z analiz Basecamp wynika, że ok. 68 proc. objętości sekwencji w Sequence Read Archive pochodzi od zaledwie pięciu gatunków, a sam człowiek to 54 proc. Dla badań medycznych to zrozumiałe, ale dla modelu, który ma poznać różnorodność procesów biologicznych, to poważne ograniczenie. Lorenz porównuje to do trenowania modelu językowego wyłącznie na gazetach z 1975 roku.

Dlatego Basecamp zbiera własne próbki, współpracując z lokalnymi badaczami w ponad 30 krajach. Pierwsza generacja EDEN trenowała na 9,7 biliona tokenów nukleotydowych z ponad miliona nowo zsekwencjonowanych gatunków. W momencie rozmowy z The Decoder zbiór liczył już ok. 15 bilionów tokenów, a firma planuje jego mniej więcej stukrotny wzrost. Ramy dla tego daje ogłoszony w marcu projekt Trillion Gene Atlas, w którym z Nvidią i Anthropic chcą zgromadzić dane na poziomie biliona genów. Na ile plan jest zaawansowany, firma nie ujawnia.

Antybiotyk bez poprawek i rekombinazy w komórkach

To, że model potrafi projektować aktywne cząsteczki, firma pokazuje na konkretnych wynikach. W czerwcu opisano kandydata EDEN-7 — wygenerowanego przez model bez późniejszych poprawek. U myszy zakażonych bakteriami opornymi na wiele leków działał mniej więcej tak samo jak antybiotyk ostatniej szansy. Badania prowadzono z zespołem Césara de la Fuente z University of Pennsylvania. W pracy o rodzinie modeli EDEN, która nie przeszła jeszcze recenzji, autorzy podają, że 97 proc. wybranych kandydatów — krótkich peptydów przeciwdrobnoustrojowych — wykazało aktywność w laboratorium. Zastrzeżenie jest istotne: wskaźnik dotyczy starannie wyselekcjonowanego zestawu, a nie wszystkich możliwych projektów modelu.

Własne programy terapeutyczne firmy opierają się na rekombinazach serynowych — enzymach, które potrafią wstawić duży fragment DNA w wybrane miejsce ludzkiego genomu. To odpowiedź na problem chorób dziedzicznych, w których mutacje bywają różne u różnych pacjentów; zamiast naprawiać każdą z osobna, enzym wstawiałby zdrową kopię genu. Narzędzia tego typu narodziły się w ewolucyjnym konflikcie bakterii z fagami, ale zanim zadziałają w ludzkim genomie, trzeba je gruntownie przeprogramować. W pracy o EDEN autorzy raportują, że połowa wygenerowanych rekombinaz była aktywna w ludzkich komórkach. W styczniu firma poinformowała, że zmodyfikowane tą metodą limfocyty T usunęły w laboratorium ponad 90 proc. komórek nowotworowych.

Pipeline, który studzi emocje

Te wyniki laboratoryjne i testy na myszach to jednak wciąż bardzo wczesny etap. Opublikowany przez Basecamp pipeline pokazuje, że żaden z sześciu programów nie wyszedł poza etap optymalizacji kandydatów. Cztery z nich to terapia CAR-T in vivo dla nowotworów krwi, terapia dla choroby autoimmunologicznej, terapia genowa wątroby w fenyloketonurii oraz peptydy przeciwko opornym patogenom. Dwa kolejne są we wczesnych badaniach. Lorenz w rozmowie z The Decoder przyznaje, że cząsteczki działają, ale do wejścia do kliniki „potrzeba jeszcze bardzo wiele”.

Równie ważne jak wielkość danych jest ich jakość. Lorenz przekonuje, że w ciągu ostatnich sześciu miesięcy firma trenowała identyczne architektury na własnych i publicznych danych — i to własne dawały wyraźnie lepsze krzywe uczenia, a różnica rosła z rozmiarem modelu. Znaczna część mocy obliczeniowych idzie też na uczenie ze wzmocnieniem: jedna trzecia GPU firmy jest zarezerwowana na eksperymenty z uczeniem ze wzmocnieniem, które mają pomóc w zadaniach takich jak ocena bezpieczeństwa i toksykologii. Jakie wymierne zyski przyniosły te eksperymenty, Lorenz nie zdradza.

Dostęp przez Claude, ale nie open source

Basecamp nie planuje otwartego udostępnienia modeli. Część możliwości EDEN jest osiągalna przez Claude — badacz może opisać zadanie w języku naturalnym, a Claude sięgnie po EDEN, by wskazać kandydatów do dalszych badań. Brak otwartej publikacji Lorenz tłumaczy względami bezpieczeństwa i umowami z partnerami dostarczającymi próbki. Wielu z nich woli, by komercyjne wykorzystanie modelu przynosiło im udział w zyskach, niż żeby mieli do czynienia z modelem, którego użycia nikt nie kontroluje.

Firma deklaruje, że nie rozpoczyna poboru próbek bez zgód właścicieli ziemi oraz lokalnych i krajowych rządów, a każdy token treningowy można przypisać do dokładnej lokalizacji i zgody. To partnerstwa są fundamentem modelu biznesowego — i to one, zdaniem Lorenza, odróżniają Basecamp od firm opierających się wyłącznie na publicznych bazach.

Basecamp ma więc kolejne 140 mln dolarów, architekturę zbudowaną wokół danych z natury i wstępne wyniki, które pokazują, że model potrafi projektować cząsteczki aktywne biologicznie. Czy zamienią się one w bezpieczne i skuteczne terapie dla ludzi — pokażą dopiero badania przedkliniczne i kliniczne. Na razie to zakład o dane, a nie obietnica bliskich leków.