Poetiq rzuca wyzwanie gigantom: samodoskonaląca się inteligencja bez fine-tuningu
Zamiast grzebać w bebechach sieci neuronowych, inżynierowie z Poetiq postawili na inteligencję zewnętrzną. Ich najnowszy Meta-System osiągnął status State-of-the-Art na morderczym benchmarku LiveCodeBench Pro (LCB Pro), nie dotykając ani jednej linii kodu źródłowego testowanych modeli.
Koniec z ręcznym sterowaniem
To uderzenie w dotychczasowy paradygmat optymalizacji. Tradycyjnie, aby wycisnąć więcej z modelu, inżynierowie budują ręcznie tak zwane „harnessy” – warstwy infrastruktury zarządzające promptami i strukturą odpowiedzi. Poetiq stwierdził, że ludzie są w tym za wolni.
Ich rozwiązanie to rekurencyjne samodoskonalenie. Meta-System sam projektuje strategie zadawania pytań i weryfikacji kodu, ucząc się na błędach w czasie rzeczywistym. Efekt? GPT 5.5 High z nakładką Poetiq osiągnął wynik 93,9%, deklasując swoją bazową wersję.
Lekcja od mniejszych modeli
Najciekawsze rzeczy dzieją się jednak w segmencie średnim. Gemini 3.0 Flash, model uznawany za budżetowy, po doposażeniu w harness od Poetiq przeskoczył wynikami takie potęgi jak Claude Opus 4.7 czy GPT 5.2 High. To jasny sygnał: architektura jest drugorzędna wobec metody egzekucji.
Największy skok zanotował Kimi K2.6, którego skuteczność wystrzeliła o 30 punktów procentowych. Jeśli te liczby potwierdzą się w zastosowaniach produkcyjnych, rynek czeka zmiana priorytetów z „tresowania” modeli na budowanie inteligentnych systemów orkiestracji.
Dlaczego LCB Pro to test prawdy?
W świecie AI benchmarki są często „zatrute” – modele znają odpowiedzi, bo te wyciekły do ich zbiorów treningowych. LCB Pro gra inaczej. Pobiera zadania z bieżących konkursów programistycznych i ukrywa rozwiązania (ground-truth). Rozwiązanie musi być nie tylko poprawne merytorycznie, ale też zmieścić się w limitach zużycia pamięci i czasu wykonania.
Model, który przechodzi LCB Pro, naprawdę umie kodować, a nie tylko sprawnie wyszukiwać gotowce w pamięci.
Najważniejsze fakty z raportu Poetiq:
- Agnostyczność sprzętowa: Harness zbudowany dla Gemini zadziałał na każdym innym modelu bez poprawek.
- Magia na poziomie Hard: W najtrudniejszych zadaniach Gemini 3.1 Pro skoczył z marginalnych 7,7% na 58,3% skuteczności.
- Dominacja GPT 5.5 High: Wynik 93,9% to obecnie absolutny szczyt możliwości AI w generowaniu proceduralnej logiki.
- Zoptymalizowany koszt: Małe modele z nakładką biją giganty bez niej.
Wszystko to osiągnięto wyłącznie przez standardowe API. Bez dostępu do wag modelu, bez dopasowywania (fine-tuning) i bez ukrytych optymalizacji producenta. To brutalna demonstracja siły oprogramowania, które potrafi zarządzać inteligencją skuteczniej niż jej twórcy.
Meta-System udowodnił, że przyszłość AI to nie tylko większe serwerownie, ale przede wszystkim sprawniejsze pętle zwrotne w procesie myślowym maszyn.
