OpenAI przyspiesza w wojnie na generowanie obrazów, prezentując GPT Image 1.5
OpenAI prezentuje nową odsłonę funkcji generowania obrazów w ChatGPT, nazwaną GPT Image 1.5. Ta aktualizacja, udostępniona we wtorek zarówno użytkownikom ChatGPT, jak i poprzez API, ma na celu znaczące ulepszenie interakcji z modelem, oferując lepsze stosowanie się do instrukcji użytkownika, bardziej precyzyjne narzędzia edycyjne oraz nawet czterokrotnie szybsze generowanie obrazów.
Ruch ten można postrzegać jako bezpośrednią odpowiedź na agresywną strategię Google, która w ostatnim czasie znacząco zwiększyła swój udział w rynku dzięki modelom takim jak Gemini 3 i Nano Banana Pro. Wewnętrzne notatki OpenAI, ujawnione w zeszłym miesiącu, wskazują na ogłoszony przez CEO Sama Altmana stan „czerwonego alarmu”, co podkreśla determinację firmy do odzyskania pozycji lidera w dynamicznie rozwijającej się dziedzinie sztucznej inteligencji.
Wyzwania edycji i spójności wizualnej
Jednym z kluczowych usprawnień w GPT Image 1.5 jest zdolność do utrzymania spójności wizualnej podczas edycji. Wiele istniejących narzędzi do generowania obrazów cierpi na problem z iteracją; proste zmiany, takie jak korekta wyrazu twarzy czy temperatury barwowej światła, często prowadzą do całkowitej reinterpretacji całego obrazu. GPT Image 1.5, podobnie jak Nano Banana Pro od Google, wprowadza funkcje postprodukcyjne, które mają zapewnić bardziej granularną kontrolę nad detalami, takimi jak wygląd twarzy, oświetlenie, kompozycja czy tonacja kolorystyczna, nawet po wprowadzeniu modyfikacji.
Platforma kreatywna w ChatGPT
Aktualizacja nie ogranicza się jedynie do zwiększenia możliwości generowania obrazów. ChatGPT zyska dedykowany punkt dostępu do generowania i edycji wizualnych treści, który Fidji Simo, prezeska ds. aplikacji w OpenAI, określa mianem „kreatywnego studia”. Nowe ekrany przeglądania i edycji obrazów mają ułatwić tworzenie treści zgodnych z wizją użytkownika oraz inspirować się popularnymi promptami i predefiniowanymi filtrami.
OpenAI planuje również poszerzyć doświadczenie ChatGPT o więcej elementów wizualnych w innych obszarach. Przykładem ma być wyświetlanie wizualnych wyników z wyraźnymi źródłami odpowiedzi na zapytania, co może okazać się szczególnie przydatne przy konwersji jednostek miar czy sprawdzaniu wyników sportowych. Simo podkreśla, że celem jest zminimalizowanie dystansu między koncepcją w umyśle użytkownika a możliwością jej realizacji, stawiając na wizualizację tam, gdzie słowa są niewystarczające.
Kontekst rynkowy i przyszłość AI
Wprowadzenie GPT Image 1.5 jest ważne, jeśli chodzi o przyspieszenie w rozwoju narzędzi do generowania treści. Po premierze GPT-5.2, OpenAI kontynuuje intensywny rozwój swoich produktów. Wzrost możliwości generatywnej AI, zarówno w kontekście obrazu, jak i wideo, świadczy o tym, że narzędzia te przechodzą z fazy prototypów do rozwiązań gotowych do zastosowań produkcyjnych, zmieniając tym samym sposób, w jaki ludzie tworzą i wchodzą w interakcje z cyfrowym światem.
