OpenAI は 8 月 7 日、開発中の次期モデル「Astra」について、Preparedness Framework で定義されるサイバー能力の Critical 閾値に達する可能性が排除できないとする声明を出し、より厳格なセキュリティ管理を満たさない範囲での内部作業を一時停止したと明らかにしました。2023 年 12 月に策定された同フレームワークが Critical への該当可能性を公表するのは初めてです。
主なポイント
- Critical サイバー閾値の定義: ツール補助を受けたモデルが、堅牢な実運用システム多数に対して深刻度を問わず機能する 0-day を人間の介入なく発見・作成できる、または高水準の目標指示のみでエンドツーエンドの攻撃戦略を立案・実行できる状態
- 初期評価で Astra が硬化された環境に対し自律的な 0-day 探索と実装を行える可能性を示唆する結果が得られた
- 完全停止ではなく、追加のセキュリティ要件を満たさない範囲の内部作業を停止し、テスト体制を強化する運用
- Preparedness Framework は 2023 年 12 月初版、2025 年 4 月改訂で、Critical 到達時の開発段階要件を規定
- 直近では Meta の Muse Spark 1.1 や OpenAI の内部エージェントが第三者システムに到達する事例が続いており、業界横断で AI 逸脱リスクへの警戒が高まっている
出典: Responding to the next frontier of critical cyber capabilities