Iris-mini i Iris-pro: Koniec z halucynacjami wyszukiwarek? AllSpark udostępnia potężne modele open-source
Współczesne systemy wyszukiwania oparte na dużych modelach językowych (LLM) często padają ofiarą zarzutu, że ich „zdolności badawcze” to w rzeczywistości jedynie potwierdzanie wiedzy nabytej podczas treningu. Zespół AllSpark postanowił rzucić wyzwanie temu status quo, wprowadzając Iris-mini oraz Iris-pro. To dwa otwartoźródłowe modele (open-weight), które zamiast powierzchownego dopasowywania słów kluczowych, stawiają na głębokie, autonomiczne rozumowanie i weryfikację faktów w czasie rzeczywistym.
Dlaczego to ważne właśnie teraz? W dobie zalewu internetu treściami generowanymi przez AI, potrzebujemy narzędzi, które potrafią krytycznie oceniać źródła. Iris-mini i Iris-pro to nowatorskie modele autonomicznego wyszukiwania, które nie tylko konkurują jakością z zamkniętymi systemami, ale przenoszą umiejętności logicznego wnioskowania na zupełnie nowy poziom, udowadniając, że otwarta nauka wciąż dyktuje tempo rozwoju branży.
Architektura oparta na logice, nie tylko na danych
Modele Iris bazują na sprawdzonej rodzinie Qwen. Mniejszy wariant, Iris-mini, posiada 35 miliardów parametrów (oparty na Qwen3.6-35B-A3B), natomiast potężniejszy Iris-pro operuje w skali aż 397 miliardów parametrów (Qwen3.5-397B-A17B). Kluczem do ich sukcesu nie jest jednak sama skala, lecz innowacyjny proces szkolenia zwany „SFT-RL climbing”. Deweloperzy AllSpark odeszli od standardowych zestawów danych na rzecz inżynierii odwrotnej struktury sieci.
Wykorzystując grafy powiązań między stronami internetowymi, system generuje złożone pytania, których nie da się rozwiązać jednym zapytaniem. Co istotne, terminy w zapytaniach są parafrazowane, co zmusza model do faktycznego zrozumienia relacji między faktami, a nie tylko do kopiowania fragmentów tekstu. Proces ten wspierany jest przez rygorystyczną filtrację. Silniejszy model „nauczyciel” generuje ścieżki rozwiązań, które są oceniane pod kątem logicznej spójności, unikania pętli powtórzeń oraz głębokości wyszukiwania.
Efektywność w starciu z benchmarkami
W testach takich jak BrowseComp czy Humanity’s Last Exam, Iris-mini i Iris-pro wykazały dominację w swoich kategoriach wagowych. Szczególnie imponujący jest wynik Iris-mini, który w teście BrowseComp osiągnął wynik 82,2 pkt, pokonując konkurentów o ponad 3 punkty procentowe, mimo że jest znacznie mniejszą jednostką. Eksperci z AllSpark zwracają jednak uwagę na istotny niuans techniczny: zarządzanie kontekstem. W długich sesjach badawczych okno 256 tysięcy tokenów może zapełnić się szybciej, niż system zdoła dotrzeć do sedna problemu. Iris radzi sobie z tym poprzez inteligentne streszczanie dotychczasowych prób i odrzucanie zbędnej historii.
Interesującym przypadkiem odnotowanym przez twórców był błąd w bazie testowej BrowseComp-ZH dotyczący „Gry o Tron”. Podczas gdy oficjalny klucz odpowiedzi wskazywał ród Lannisterów, agent Iris poprawnie zidentyfikował ród Boltonów w kontekście drugiego małżeństwa Sansy Stark. Ten incydent podkreśla krytyczne podejście autorów do jakości danych, którymi karmi się współczesna AI, sugerując, że modele stają się czasem dokładniejsze od samych benchmarków.
Wyszukiwanie jako fundament inteligencji ogólnej
Najbardziej zaskakującym efektem prac nad Iris okazał się transfer umiejętności. Choć modele były optymalizowane pod kątem pracy z wyszukiwarką, znacząco poprawiły swoje wyniki w zadaniach biurowych i ogólnym wykorzystaniu narzędzi (tool use). Sugeruje to, że zdolność do operowania na niepełnej informacji i selekcji źródeł jest kompetencją fundamentalną. Twórcy wprost deklarują w opublikowanej dokumentacji: „Prezentujemy Iris-mini i Iris-pro wraz z potokiem danych i procedurą treningową, która za nimi stoi”. Udostępnienie wag modeli oraz kodu Iris Harness na platformach Hugging Face i GitHub otwiera nową ścieżkę dla deweloperów budujących autonomicznych asystentów, którzy nie muszą polegać na zamkniętych, płatnych systemach.
