ChatGPT Images 2.5: más rápido, pero los datos de seguridad no son significativos
Pocos días después del anuncio de GPT-6 Astra, el 8 de septiembre de 2026 OpenAI presentó ChatGPT Images 2.5, el nuevo modelo de generación de imágenes disponible en ChatGPT, ChatGPT Work y Codex. La oferta para desarrolladores se desdobla en la API entre GPT-Image-2.5 Flare, fijada como opción predeterminada y centrada en la velocidad (con el snapshot documentado gpt-image-2.5-flare-2026-09-08), y GPT-Image-2.5 Sunburst, orientada al control de precisión y a la edición. La actualización incorpora funciones como la herramienta Sketch, que permite dibujar directamente en ChatGPT para guiar la generación, plantillas para carteles y merchandising, además de comentarios puntuales sobre partes de la imagen para editar solo lo necesario. Frente a un volumen declarado de más de 3.000 millones de imágenes creadas por semana entre la plataforma y la API, el proveedor indica una reducción de la latencia de hasta el 50 % respecto a Images 2.0 en el mejor de los casos: un dato citado en el anuncio oficial que procede directamente de la empresa y no de pruebas independientes de terceros.
En los costes de la API, la tarifa fija 5 dólares por millón de tokens para la entrada de texto (1,25 en caso de caché), 8 dólares para la entrada de imágenes (2 en caché) y 30 dólares por millón de tokens para la salida, con valores idénticos para Flare y Sunburst. Como el recuento de tokens difiere del modelo anterior y no hay calculadora por imagen, el importe real de cada generación no puede determinarse de antemano. En materia de seguridad, la evaluación adversaria automatizada que recoge la system card muestra una proporción de contenidos no seguros mostrados al usuario del 1,09 % para Sunburst y del 1,41 % para Flare, frente al 1,64 % de Images 2.0. Aun así, el propio documento de OpenAI admite de forma explícita que ninguna de esas diferencias respeta el umbral de significación estadística de p inferior a 0,05, y recuerda que las pruebas se basan en un conjunto fijo y que las etiquetas automáticas pueden contener errores.
El informe del Deployment Safety Hub reconoce también que el mayor realismo del modelo puede facilitar deepfakes más convincentes sobre personas, lugares o hechos reales. Para frenar estas infracciones de sus directrices, OpenAI aplica filtros a nivel de prompt y de imagen, acompañados de metadatos C2PA y del marcado de agua invisible SynthID de Google DeepMind. En cuanto al Preparedness Framework, ni Flare ni Sunburst superan los umbrales de riesgo Bio High o Cyber High, aunque la empresa mantiene por precaución las mitigaciones previstas para capacidades biológicas elevadas.
Tres decimales de diferencia en una prueba interna no hacen que un modelo sea más seguro, y OpenAI es la primera en decirlo. La novedad principal sigue siendo la reducción de los tiempos de espera que declara la empresa, hasta el 50 % en el mejor de los casos, y queda abierta la pregunta de cuánto aguantarán los filtros ante imágenes cada vez más indistinguibles de la realidad.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- He leído la system card oficial en deploymentsafety.openai.com (dominio de OpenAI): de ahí salen los porcentajes de seguridad, la nota sobre la significación estadística y las frases sobre realismo y deepfakes. La documentación de API en developers.openai.com confirma los precios por millón de tokens, los endpoints y el snapshot fechado el 08-09-2026. Como confirmaciones independientes abrí 9to5Mac (8 de septiembre de 2026) y Unite.AI: fecha, nombres de los dos modelos de API, funciones para el usuario y la cita sobre la latencia. La página de anuncio en openai.com devolvió HTTP 403 a nuestro acceso automático: ningún dato del artículo se apoya en ella. Descarté la cifra sobre salida en 4K, presente solo en circuitos de notas de prensa de pago.
- Incertezze
- La propia OpenAI declara que la caída de contenidos no seguros mostrados (del 1,64 % al 1,09 %/1,41 %) no es estadísticamente significativa: puede decirse que el nuevo modelo no sale peor en la prueba utilizada, no que sea más seguro. Todas las cifras de seguridad proceden de un test adversario interno con conjunto fijo y etiquetado automático que la empresa admite falible, sin verificaciones independientes. El menos 50 % de latencia lo declara el proveedor, no lo midió un tercero; las comparaciones de velocidad citadas en el anuncio vienen de socios comerciales. Sin calculadora por imagen y con un recuento de tokens distinto al de GPT Image 2, el coste real por generación sigue siendo indeterminable de antemano. Las afirmaciones sobre una salida en 4K que circulan por sitios de notas de prensa de pago no tienen confirmación oficial. No es verificable hasta qué punto C2PA y SynthID resisten la recompresión, las capturas de pantalla o la eliminación de metadatos.
- Perché pubblicarla
- Es el lanzamiento de un modelo puntero con documentación técnica y de seguridad completa y verificable, contable sin depender de rumores. Sobre todo es un caso de manual de lectura crítica de las cifras: la empresa publica una mejora en sus métricas de seguridad y en el mismo documento declara que esa mejora no es estadísticamente significativa, mientras admite que el mayor realismo hace más convincentes los deepfakes. El lector necesita que alguien distinga lo medido de lo declarado, también de cara a las obligaciones de transparencia del Reglamento de IA sobre contenidos sintéticos. Además, la generación de imágenes todavía no está cubierta en el archivo.