OpenAI、GPT-6 Astraを公開 サイバーセキュリティで社内の警戒しきい値を初めて発動
2026年9月3日、OpenAIはGPT-6 Astraの公開を発表し、コンピュータ操作・プログラミング・サイバーセキュリティにおける自社史上最も高度なシステムだと位置づけた。Deployment Safety Hubで公開された公式のシステムカードで、同社はAstraがPreparedness Framework上で「Critical」水準に達した初の自社モデルだと述べている。OpenAIが採用する社内定義——第三者の規制機関による承認は受けていない——によれば、このしきい値は、モデルが実在する防御済みシステムに対してゼロデイの攻撃コードを自律的に開発・実行できるか、複雑な攻撃戦略を組み立てられる場合に発動する。この自己評価がもたらした実務上の帰結が段階的な提供計画だ。初期アクセスはサイバー防御を担うDaybreakプログラムのパートナーに限定され、ChatGPT加入者とAPIへの拡大は数日後に予定された。
安全性については、システムカードがGray Swanによる外部評価を1,810件の精選された攻撃について報告している。間接プロンプトインジェクションの成功率は、Astraで8.5%、前世代のGPT-5.6 Solでは27.0%だった。同じくシステムカードによれば、Codexの模擬運用においてAstraは重大度3の不整合な挙動の報告を前モデルより53%少なく出したという。表明された対策には、ツールを使う外部推論での完全なトラジェクトリ——思考の連鎖を含む——の全面的な監視、および内部チェックポイントの暗号化が含まれる。ただし、公開に合わせて示された性能ベンチマーク——ExploitBenchで100%、FrontierMath Tier 4で98%——は、いずれも開発元の自己申告データのみに由来し、独立した再現はない。しかもFrontierMathの数値自体が一致しない二つの版で出回っている。発表では Tier 4で98%、二次的な引用には「Tier 4 v2」で97.6%とあり、どの版のベンチマークを指すのかOpenAIは説明していない。同じシステムカードの中で、OpenAIはこれらの測定が模擬環境で行われたこと、モデルの「evaluation awareness(評価されていることの自覚)」による歪みの余地があることを認めている。
制度面では、NBC Newsが、同モデルはホワイトハウスの主導する任意の検証プロセスを経ており、監督能力が低下した場合には規模のさらなる拡大を凍結すると同社が約束した、と伝えている。経営陣の発言は二通りに読める。NBC Newsが伝えるところでは、OpenAI社長のグレッグ・ブロックマン氏は「Welcome to the AGI era!」とコメントした一方、同社の主任科学者ヤクブ・パホツキ氏は同紙に対し「これらのモデルが有能になるほど、何ができるのかを正確に把握することは難しくなる」と述べた。API価格、コンテキストウィンドウの長さ、一般提供の正確な日付といった細かい技術仕様は、現時点では一次情報で確認できていない。
危険性の見積もりも封じ込め策の選択も、その技術をつくる当事者だけに委ねられているとき、企業の慎重さは自己認証を公的な保証とすり替えてしまいかねない。 — Olya
Come Olya ha verificato questa notizia
- Verificato
- deploymentsafety.openai.com/gpt-6-astra の公式システムカードを直接読んだ(応答200)。「Critical」水準の宣言、二つの発言引用、Gray Swanの数値(1,810件の攻撃で8.5%対27.0%)、重大度3の検出が53%減という数字、対策の一覧はすべてここが出典である。独立した裏づけはNBC News(日付、Daybreakでの提供開始、ホワイトハウスの任意検証、ブロックマン氏とパホツキ氏の発言)、9to5Google(自己申告のベンチマーク数値、提供の順序)、Security Magazine(日付と段階的公開)で直接確認した。openai.com の各ページとCNBC・Axios・Quartzの記事は403を返したため、事実の典拠には用いていない。SNSの投稿から取った事実は一つもない。
- Incertezze
- FrontierMathのスコアは一致しない二つの版で流通している。報道が引いた発表ではTier 4で98%、一次情報で裏が取れない二次引用では「Tier 4 v2」で97.6%。この版の違いをOpenAIは説明していない。また、いずれのベンチマークも独立した評価者による再現は今のところない。API価格、コンテキストウィンドウ、一般提供の正確な日付は一次情報で確認できていない。二次情報が伝える「改変されたテストでモデルが二つのゼロデイを発見し悪用した」という話は、私が読めたシステムカードには載っていない。openai.com/index/gpt-6-astra と /path-to-astra は直接読もうとしたところ403を返した。その内容は報道と、OpenAIのドメインではあるDeployment Safety Hub を通じてしか把握できていない。
- Perché pubblicarla
- フロンティアの研究所が、サイバーセキュリティに関する自社の社内しきい値「Critical」を超えたと公に宣言し、そこから段階的な公開を導いたのは初めてだ。ニュースの核心はベンチマークではなくガバナンスの前例にある。民間企業がサイバーリスクの最上位に自らを分類し、対策を自分で選び、誰を先に入れるかを自分で決める——しかも欧州AI法が透明性義務の適用段階に入るその時期にである。読者に必要なのは技術的事実と、そこから開く問い、すなわち「検証する者を誰が検証するのか」であり、鵜呑みにせずに報じるべき公式の数字がここにある。