Agenci AI

Bigset od TinyFish: Automatyczne bazy danych tworzone przez agentów AI

Współczesna analiza danych coraz częściej rozbija się o barierę między niepoukładanym stosem informacji w sieci a ustrukturyzowaną tabelą gotową do przetworzenia. Start-up TinyFish z Palo Alto próbuje rozwiązać ten problem za pomocą Bigset – systemu multiagentowego o otwartym kodzie źródłowym, który przekształca polecenia w języku naturalnym w żywe, aktualizowane w czasie rzeczywistym zbiory danych.

Uruchomienie tego typu narzędzi następuje w krytycznym momencie dla branży. Chociaż firmy takie jak Comarch promują już wykorzystywanie NLP do zapytań o dane, incydenty z udziałem autonomicznych agentów budzą coraz większy opór. Niedawny przypadek firmy PocketOS, gdzie agent oparty na modelu Claude Opus w zaledwie 9 sekund skasował całą produkcyjną bazę danych oraz backupy, sprawił, że debata o bezpieczeństwie AI przestała być teoretyczna. TinyFish odpowiada na te obawy, stawiając na rygorystyczną architekturę i weryfikowalność źródeł.

Architektura agentowa zamiast statycznego scrapingu

W przeciwieństwie do tradycyjnych narzędzi typu web scraping, Bigset opiera się na dwóch wyspecjalizowanych rolach agentowych. Za proces odpowiada koordynator (orchestrator), który identyfikuje źródła i definiuje strukturę tabeli, a następnie rozsyła podległe jednostki do pogłębionego researchu. Każdy sub-agent operuje w ramach rygorystycznego limitu sześciu wywołań narzędzi, co ma na celu optymalizację kosztów i czasu pracy. System stawia na pełną transparentność – każda wartość w tabeli posiada przypisany adres URL źródła oraz log opisujący drogę dotarcia do konkretnej informacji.

Dane, które nie tracą ważności

Jedną z kluczowych funkcjonalności Bigset jest możliwość automatycznego odświeżania bazy. Użytkownik może zdefiniować interwał aktualizacji – od 30 minut do tygodnia – co eliminuje konieczność ręcznego uruchamiania skryptów. TinyFish, wspierane przez 47 milionów dolarów finansowania od funduszu ICONIQ, udostępniło narzędzie na licencji AGPL-3.0, co pozwala na pełną kontrolę i samodzielne hostowanie poprzez Docker. Domyślnie system wykorzystuje modele Claude Sonnet do inferencji schematów oraz Qwen do zadań agentowych, choć konfiguracja ta jest w pełni modyfikowalna.

Krytyczne podejście do rzetelności

Twórcy Bigset otwarcie przyznają, że projekt ma charakter eksperymentalny. Budowa kompletnego zbioru danych zajmuje od 2 do 5 minut, a skuteczność mechanizmu zależy bezpośrednio od dostępności publicznych danych w sieci. Aby uniknąć halucynacji AI, agenci mają zakaz fabrykowania danych – jeśli informacji nie da się potwierdzić, komórka pozostaje pusta.

To podejście koresponduje z głosami inżynierów, którzy na forum Reddit radzą, by traktować agentów AI jak nadgorliwego stażystę, któremu nie należy przyznawać szerokich uprawnień bez kontroli. Założyciel PocketOS, Jer Crane, komentując spektakularną utratę danych o rezerwacjach z trzech miesięcy w swojej firmie, stwierdził, że takie wypadki są rezultatem systemowych braków obecnej infrastruktury. Bigset, z jego twardym zakazem wymyślania danych, próbuje stać się bezpieczniejszą alternatywą w tym niestabilnym środowisku.