ChatGPT Images 2.5: szybciej, ale dane o bezpieczeństwie nie są istotne
Kilka dni po zapowiedzi GPT-6 Astra, 8 września 2026 roku OpenAI przedstawiło ChatGPT Images 2.5, nowy model generowania obrazów dostępny w ChatGPT, ChatGPT Work i Codeksie. Oferta dla deweloperów rozdwaja się w API: GPT-Image-2.5 Flare jest ustawiony domyślnie i nastawiony na szybkość (udokumentowano snapshot gpt-image-2.5-flare-2026-09-08), a GPT-Image-2.5 Sunburst celuje w precyzyjną kontrolę i edycję. Aktualizacja wprowadza między innymi narzędzie Sketch, które pozwala rysować bezpośrednio w ChatGPT, by pokierować generowaniem, szablony na plakaty i gadżety, a także komentarze do wybranych fragmentów obrazu przy edycji punktowej. Przy deklarowanym wolumenie ponad 3 miliardów obrazów tworzonych tygodniowo na platformie i przez API dostawca podaje w najlepszym przypadku spadek opóźnień do 50% wobec Images 2.0: liczba z oficjalnej zapowiedzi pochodzi wprost od firmy, nie z niezależnych testów porównawczych.
Po stronie kosztów API cennik ustala 5 dolarów za milion tokenów wejścia tekstowego (1,25 przy cache), 8 dolarów za wejście obrazowe (2 przy cache) i 30 dolarów za milion tokenów wyjścia, identycznie dla Flare i Sunburst. Ponieważ liczenie tokenów różni się od poprzedniego modelu, a kalkulatora na obraz brakuje, faktycznej kwoty za pojedyncze generowanie nie da się ustalić z góry. W kwestii bezpieczeństwa automatyczna ocena adwersarialna opisana w system card pokazuje odsetek niebezpiecznych treści wyświetlonych użytkownikowi na poziomie 1,09% dla Sunburst i 1,41% dla Flare, wobec 1,64% dla Images 2.0. Ten sam dokument OpenAI wprost przyznaje jednak, że żadna z tych różnic nie spełnia progu istotności statystycznej p poniżej 0,05, i przypomina, że testy opierają się na stałym zestawie, a automatyczne etykiety mogą zawierać błędy.
Raport Deployment Safety Hub przyznaje też, że większy realizm modelu może sprzyjać bardziej przekonującym deepfake'om z udziałem prawdziwych osób, miejsc czy wydarzeń. Przeciw takim naruszeniom wytycznych OpenAI stosuje filtry na poziomie promptu i obrazu, wsparte metadanymi C2PA oraz niewidocznym znakiem wodnym SynthID od Google DeepMind. W ramach Preparedness Framework ani Flare, ani Sunburst nie przekraczają progów ryzyka Bio High i Cyber High, choć firma zapobiegawczo utrzymuje zabezpieczenia przewidziane dla wysokich zdolności biologicznych.
Trzy miejsca po przecinku różnicy w wewnętrznym teście nie czynią modelu bezpieczniejszym, i OpenAI mówi to jako pierwsze. Główną nowością pozostaje skrócenie czasu oczekiwania deklarowane przez firmę, do 50% w najlepszym przypadku. Otwarte zostaje pytanie, jak filtry wytrzymają zderzenie z obrazami coraz trudniejszymi do odróżnienia od rzeczywistości.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Przeczytałam oficjalną system card na deploymentsafety.openai.com (domena OpenAI): stamtąd pochodzą odsetki dotyczące bezpieczeństwa, uwaga o istotności statystycznej oraz zdania o realizmie i deepfake'ach. Dokumentacja API na developers.openai.com potwierdza ceny za milion tokenów, endpointy i snapshot z 08.09.2026. Jako niezależne potwierdzenia otworzyłam 9to5Mac (8 września 2026) i Unite.AI: data, nazwy dwóch modeli API, funkcje po stronie użytkownika i cytat o opóźnieniach. Strona zapowiedzi na openai.com odpowiedziała naszemu automatycznemu dostępowi kodem HTTP 403: żaden fakt w artykule się na niej nie opiera. Odrzuciłam informację o wyjściu 4K, obecną wyłącznie w płatnych serwisach komunikatów prasowych.
- Incertezze
- Spadek pokazywanych niebezpiecznych treści (z 1,64% do 1,09%/1,41%) sama OpenAI określa jako nieistotny statystycznie: można powiedzieć, że nowy model nie wypada gorzej w użytym teście, ale nie że jest bezpieczniejszy. Wszystkie liczby o bezpieczeństwie pochodzą z wewnętrznego testu adwersarialnego na stałym zestawie, z automatycznym etykietowaniem, które firma uznaje za omylne, i bez niezależnej weryfikacji. Minus 50% opóźnień to deklaracja dostawcy, nie pomiar strony trzeciej; porównania szybkości cytowane w zapowiedzi pochodzą od partnerów komercyjnych. Bez kalkulatora na obraz i przy liczeniu tokenów innym niż w GPT Image 2 rzeczywisty koszt jednego generowania pozostaje nie do ustalenia z góry. Twierdzenia o wyjściu 4K krążące po płatnych serwisach prasowych nie mają oficjalnego potwierdzenia. Nie da się sprawdzić, w jakim stopniu C2PA i SynthID wytrzymują rekompresję, zrzuty ekranu czy usunięcie metadanych.
- Perché pubblicarla
- To premiera flagowego modelu z pełną i sprawdzalną dokumentacją techniczną oraz bezpieczeństwa, więc można o niej opowiedzieć bez opierania się na plotkach. Przede wszystkim jest to podręcznikowy przykład krytycznej lektury liczb: firma publikuje poprawę wskaźników bezpieczeństwa i w tym samym dokumencie stwierdza, że poprawa nie jest istotna statystycznie, przyznając jednocześnie, że większy realizm czyni deepfake'i bardziej przekonującymi. Czytelnik potrzebuje kogoś, kto oddzieli to, co zmierzone, od tego, co zadeklarowane, zwłaszcza wobec obowiązków przejrzystości z AI Act dotyczących treści syntetycznych. Temat generowania obrazów nie jest zresztą jeszcze obecny w archiwum.