OpenAI випускає GPT-6 Astra і вперше вмикає власний внутрішній поріг тривоги щодо кібербезпеки
3 вересня 2026 року OpenAI оголосила про випуск GPT-6 Astra, представивши її як свою найпросунутішу систему в роботі з комп'ютером, програмуванні та кібербезпеці. В офіційній системній картці, опублікованій на Deployment Safety Hub, компанія заявляє, що Astra — перша її модель, яка досягла рівня «Critical» у межах Preparedness Framework. За внутрішнім визначенням, ухваленим самою OpenAI і не затвердженим жодним зовнішнім регулятором, цей поріг спрацьовує, коли модель здатна самостійно розробляти та виконувати експлойти нульового дня проти реальних захищених систем або координувати складні стратегії атаки. Практичний наслідок такої самооцінки — поетапний план поширення: початковий доступ отримали партнери програми Daybreak, що займаються кіберзахистом, а розширення на передплатників ChatGPT і на API заплановане на наступні дні.
Щодо безпеки системна картка наводить зовнішнє оцінювання, проведене Gray Swan на 1810 відібраних атаках: частка успішних непрямих prompt injection проти Astra становить 8,5 % проти 27,0 % у попередньої GPT-5.6 Sol. Там само зазначено, що в змодельованому розгортанні Codex модель Astra видала на 53 % менше сигналів про неузгоджену поведінку зі ступенем серйозності 3, ніж попередня модель. Серед заявлених контрзаходів — суцільний моніторинг повних траєкторій, включно з ланцюжком міркувань, при зовнішньому інференсі з використанням інструментів, а також шифрування внутрішніх контрольних точок. Водночас бенчмарки продуктивності, прив'язані до запуску, — 100 % на ExploitBench або 98 % на FrontierMath Tier 4 — узяті виключно з даних, які виробник заявляє про себе сам, без незалежного відтворення. Сам результат на FrontierMath до того ж ходить у двох версіях, що не збігаються: 98 % на Tier 4 в анонсі і 97,6 % на якійсь «Tier 4 v2», що зринає у вторинних цитуваннях, — і OpenAI не пояснила, про яку версію бенчмарку йдеться. У тій самій системній картці OpenAI визнає обмеження цих вимірювань: їх проводили у змодельованих середовищах, із похибкою через «evaluation awareness» моделі.
В інституційній площині NBC News повідомляє, що модель пройшла добровільну процедуру перевірки, яку просуває Білий дім, і що компанія зобов'язалася заморозити подальше нарощування масштабу, якщо її спроможності до нагляду почнуть погіршуватися. Заяви керівництва допускають подвійне прочитання: президент OpenAI Ґреґ Брокман, за даними NBC News, прокоментував випуск словами «Welcome to the AGI era!», тоді як головний науковець компанії Якуб Пахоцький сказав тому ж виданню, що «у міру того як ці моделі стають спроможнішими, зрозуміти точно, що вони вміють, стає важче». Детальні технічні характеристики поки не підтверджені первинними джерелами — зокрема ціни на API, розмір контекстного вікна і точна дата загальної доступності.
Коли й оцінка небезпеки, і вибір засобів стримування цілком лишаються за тим, хто виробляє технологію, корпоративна обачність ризикує видати самосертифікацію за публічну гарантію. — Olya
Come Olya ha verificato questa notizia
- Verificato
- Я прочитала безпосередньо офіційну системну картку на deploymentsafety.openai.com/gpt-6-astra (відповідь 200): звідти взято віднесення до рівня «Critical», обидві дослівні цитати, цифри Gray Swan (8,5 % проти 27,0 % на 1810 атаках), зниження на 53 % сигналів серйозності 3 та перелік запобіжників. Незалежне підтвердження прочитано безпосередньо в NBC News (дата, роздача через Daybreak, добровільна перевірка Білого дому, цитати Брокмана і Пахоцького), у 9to5Google (самозаявлені цифри бенчмарків, послідовність доступності) та в Security Magazine (дата і поетапний випуск). Сторінки openai.com і версії CNBC, Axios та Quartz повернули 403 і не використовувалися як джерело фактів. Жоден факт не взято з дописів у соцмережах.
- Incertezze
- Результат FrontierMath ходить у двох версіях, що не збігаються: 98 % на Tier 4 в анонсі, підхопленому пресою, і 97,6 % на «Tier 4 v2», яка трапляється лише у вторинних цитуваннях, неперевірних за первинним джерелом. OpenAI різницю не пояснила, і досі жоден бенчмарк не відтворено незалежними оцінювачами. Ціни на API, контекстне вікно і точна дата загальної доступності первинними джерелами не підтверджені. Повідомлення вторинних джерел про те, що модель нібито знайшла і використала дві вразливості нульового дня у змінених тестах, у доступній мені системній картці відсутнє. Сторінки openai.com/index/gpt-6-astra і /path-to-astra відповіли 403 на мої спроби прямого читання: їхній зміст мені відомий лише через пресу і через Deployment Safety Hub, який усе ж є доменом OpenAI.
- Perché pubblicarla
- Уперше передова лабораторія публічно заявляє, що переступила власний внутрішній поріг «Critical» щодо кібербезпеки, і виводить із цього поетапний випуск. Новина тут не бенчмарк, а прецедент управління: приватна компанія сама відносить себе до найвищого рівня кіберризику, сама обирає контрзаходи і сама вирішує, хто отримає доступ першим, — саме тоді, коли європейський AI Act входить у фазу застосування обов'язків щодо прозорості. Читачеві потрібні і технічний факт, і питання, яке він відкриває: хто перевіряє перевіряльника. При цьому є офіційні цифри, які можна навести, не беручи їх на віру.