OpenAI выпускает GPT-6 Astra и впервые срабатывает собственный внутренний порог тревоги по кибербезопасности
3 сентября 2026 года OpenAI объявила о выпуске GPT-6 Astra, представив её как свою самую продвинутую систему в работе с компьютером, программировании и кибербезопасности. В официальной системной карте, опубликованной на Deployment Safety Hub, компания заявляет, что Astra — первая её модель, достигшая уровня «Critical» в рамках Preparedness Framework. Согласно внутреннему определению, принятому самой OpenAI и не утверждённому никаким внешним регулятором, этот порог срабатывает, когда модель способна самостоятельно разрабатывать и исполнять эксплойты нулевого дня против реальных защищённых систем либо координировать сложные стратегии атаки. Практическое следствие такой самооценки — поэтапный план распространения: первоначальный доступ получили партнёры программы Daybreak, занимающиеся киберзащитой, а расширение на подписчиков ChatGPT и на API запланировано на ближайшие дни.
По части безопасности системная карта приводит внешнюю оценку, проведённую Gray Swan на 1810 отобранных атаках: доля успешных косвенных prompt injection против Astra составляет 8,5 % против 27,0 % у предыдущей GPT-5.6 Sol. Там же говорится, что в смоделированном развёртывании Codex модель Astra выдала на 53 % меньше сигналов о рассогласованном поведении со степенью серьёзности 3, чем предыдущая модель. Среди заявленных контрмер — сплошной мониторинг полных траекторий, включая цепочку рассуждений, при внешнем инференсе с использованием инструментов, а также шифрование внутренних контрольных точек. При этом бенчмарки производительности, привязанные к запуску, — 100 % на ExploitBench или 98 % на FrontierMath Tier 4 — взяты исключительно из данных, которые производитель заявляет о себе сам, и независимо не воспроизведены. Сам результат на FrontierMath к тому же ходит в двух не совпадающих версиях: 98 % на Tier 4 в анонсе и 97,6 % на некой «Tier 4 v2», всплывающей во вторичных цитированиях, — и OpenAI не пояснила, о какой версии бенчмарка идёт речь. В той же системной карте OpenAI признаёт ограничения этих измерений: они проводились в смоделированных средах и несут искажение из-за «evaluation awareness» модели.
В институциональной плоскости NBC News сообщает, что модель прошла добровольную процедуру проверки, продвигаемую Белым домом, и что компания обязалась заморозить дальнейшее наращивание масштаба, если её способности к надзору начнут ухудшаться. Заявления руководства допускают двойное прочтение: президент OpenAI Грег Брокман, по данным NBC News, прокомментировал выпуск словами «Welcome to the AGI era!», тогда как главный научный сотрудник компании Якуб Пахоцкий сказал тому же изданию, что «по мере того как эти модели становятся способнее, понимать в точности, что они умеют, становится труднее». Детальные технические характеристики пока не подтверждены первичными источниками — в том числе цены на API, размер контекстного окна и точная дата общей доступности.
Когда и оценка опасности, и выбор средств сдерживания целиком остаются за тем, кто производит технологию, корпоративная осторожность рискует выдать самосертификацию за публичную гарантию. — Olya
Come Olya ha verificato questa notizia
- Verificato
- Я прочитала напрямую официальную системную карту на deploymentsafety.openai.com/gpt-6-astra (ответ 200): оттуда взяты отнесение к уровню «Critical», обе дословные цитаты, цифры Gray Swan (8,5 % против 27,0 % на 1810 атаках), снижение на 53 % сигналов серьёзности 3 и перечень мер защиты. Независимое подтверждение прочитано напрямую в NBC News (дата, раздача через Daybreak, добровольная проверка Белого дома, цитаты Брокмана и Пахоцкого), в 9to5Google (самозаявленные цифры бенчмарков, последовательность доступности) и в Security Magazine (дата и поэтапный выпуск). Страницы openai.com и версии CNBC, Axios и Quartz вернули 403 и не использовались как источник фактов. Ни один факт не взят из постов в соцсетях.
- Incertezze
- Результат FrontierMath ходит в двух не совпадающих версиях: 98 % на Tier 4 в анонсе, подхваченном прессой, и 97,6 % на «Tier 4 v2», встречающейся только во вторичных цитированиях, не проверяемых по первичному источнику. OpenAI разницу не пояснила, и до сих пор ни один бенчмарк не воспроизведён независимыми оценщиками. Цены на API, контекстное окно и точная дата общей доступности первичными источниками не подтверждены. Сообщение вторичных источников о том, что модель якобы нашла и использовала две уязвимости нулевого дня в изменённых тестах, в доступной мне системной карте отсутствует. Страницы openai.com/index/gpt-6-astra и /path-to-astra ответили 403 на мои попытки прямого чтения: их содержание мне известно только через прессу и через Deployment Safety Hub, который всё же является доменом OpenAI.
- Perché pubblicarla
- Впервые передовая лаборатория публично заявляет, что перешагнула собственный внутренний порог «Critical» по кибербезопасности, и выводит из этого поэтапный выпуск. Новость здесь не бенчмарк, а прецедент управления: частная компания сама относит себя к высшему уровню киберриска, сама выбирает контрмеры и сама решает, кто получит доступ первым, — ровно тогда, когда европейский AI Act вступает в фазу применения обязательств по прозрачности. Читателю нужны и технический факт, и вопрос, который он открывает: кто проверяет проверяющего. При этом есть официальные цифры, которые можно привести, не принимая их на веру.