ChatGPT Images 2.5: sneller, maar de veiligheidscijfers zijn niet significant
Enkele dagen na de aankondiging van GPT-6 Astra presenteerde OpenAI op 8 september 2026 ChatGPT Images 2.5, het nieuwe beeldgeneratiemodel voor ChatGPT, ChatGPT Work en Codex. Voor ontwikkelaars splitst het aanbod zich in de API: GPT-Image-2.5 Flare staat standaard aan en mikt op snelheid (met de gedocumenteerde snapshot gpt-image-2.5-flare-2026-09-08), terwijl GPT-Image-2.5 Sunburst zich richt op precieze controle en bewerking. De update voegt functies toe zoals de Sketch-tool, waarmee je rechtstreeks in ChatGPT tekent om de generatie te sturen, sjablonen voor posters en merchandise, en gerichte opmerkingen bij delen van een afbeelding om alleen dat stuk aan te passen. Tegen een opgegeven volume van meer dan 3 miljard beelden per week via platform en API meldt de aanbieder in het beste geval tot 50% minder latentie dan Images 2.0: een cijfer uit de officiële aankondiging dat rechtstreeks van het bedrijf komt en niet uit onafhankelijke benchmarks van derden.
Wat de API-kosten betreft: 5 dollar per miljoen tokens voor tekstinvoer (1,25 bij cache), 8 dollar voor beeldinvoer (2 bij cache) en 30 dollar per miljoen tokens voor output, gelijk voor Flare en Sunburst. Omdat het tellen van tokens afwijkt van het vorige model en een rekenmodule per afbeelding ontbreekt, is het werkelijke bedrag per generatie vooraf niet te bepalen. Op het vlak van veiligheid laat de geautomatiseerde adversariële evaluatie in de system card een aandeel onveilige, aan de gebruiker getoonde content zien van 1,09% voor Sunburst en 1,41% voor Flare, tegenover 1,64% voor Images 2.0. Toch geeft datzelfde document van OpenAI uitdrukkelijk toe dat geen van deze verschillen de drempel van statistische significantie van p kleiner dan 0,05 haalt, en herinnert het eraan dat de tests op een vaste set berusten en dat automatische labels fouten kunnen bevatten.
Het rapport van de Deployment Safety Hub erkent ook dat het grotere realisme van het model kan bijdragen aan overtuigender deepfakes van echte personen, plaatsen of gebeurtenissen. Tegen zulke schendingen van de richtlijnen zet OpenAI filters in op prompt- en beeldniveau, aangevuld met C2PA-metadata en het onzichtbare SynthID-watermerk van Google DeepMind. Voor het Preparedness Framework komen Flare noch Sunburst boven de risicodrempels Bio High of Cyber High uit, al houdt het bedrijf uit voorzorg de maatregelen voor hoge biologische capaciteiten in stand.
Drie decimalen verschil op een interne test maken een model niet veiliger, en OpenAI zegt het als eerste. Het echte nieuws blijft de kortere wachttijd die het bedrijf opgeeft, tot 50% in het beste geval. De vraag blijft open hoe de filters standhouden tegenover beelden die steeds minder van de werkelijkheid te onderscheiden zijn.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Ik heb de officiële system card op deploymentsafety.openai.com (OpenAI-domein) gelezen: daar komen de veiligheidspercentages vandaan, net als de noot over statistische significantie en de passages over realisme en deepfakes. De API-documentatie op developers.openai.com bevestigt de prijzen per miljoen tokens, de endpoints en de snapshot van 08-09-2026. Als onafhankelijke bevestiging opende ik 9to5Mac (8 september 2026) en Unite.AI: datum, namen van de twee API-modellen, gebruikersfuncties en het citaat over de latentie. De aankondigingspagina op openai.com gaf HTTP 403 op onze geautomatiseerde toegang: geen enkel feit in dit artikel steunt erop. Het cijfer over 4K-output heb ik laten vallen, dat staat alleen op betaalde persberichtenkanalen.
- Incertezze
- OpenAI noemt de daling van getoonde onveilige content (van 1,64% naar 1,09%/1,41%) zelf niet statistisch significant: je kunt zeggen dat het nieuwe model op de gebruikte test niet slechter uitvalt, niet dat het veiliger is. Alle veiligheidscijfers komen uit een interne adversariële test op een vaste set, met automatische labeling die het bedrijf feilbaar noemt, en zonder onafhankelijke controle. De min 50% latentie is een opgave van de leverancier, geen meting door derden; de snelheidsvergelijkingen in de aankondiging komen van commerciële partners. Zonder rekenmodule per afbeelding en met een tokentelling die afwijkt van GPT Image 2 blijven de werkelijke kosten per generatie vooraf onbepaalbaar. De beweringen over 4K-output op betaalde persberichtensites hebben geen officiële bevestiging. Hoe goed C2PA en SynthID hercompressie, screenshots of het verwijderen van metadata doorstaan, valt niet te verifiëren.
- Perché pubblicarla
- Het is de release van een vlaggenschipmodel met volledige en verifieerbare technische en veiligheidsdocumentatie, dus te vertellen zonder op geruchten te leunen. Bovenal is het een schoolvoorbeeld van kritisch cijfers lezen: het bedrijf publiceert een verbetering van zijn veiligheidsmetingen en verklaart in hetzelfde document dat die verbetering niet statistisch significant is, terwijl het toegeeft dat het grotere realisme deepfakes overtuigender maakt. De lezer heeft iemand nodig die het gemetene scheidt van het beweerde, zeker met het oog op de transparantieplichten van de AI Act voor synthetische content. Beeldgeneratie is bovendien nog niet gedekt in ons archief.