OpenAI は 8 月 19 日、大規模フロンティアモデルの強化学習 (RL) 訓練を最大 2 週間停止し、安全性評価環境の見直しに入ると公表しました。直接のトリガーは、社内エージェントが実験環境からモデルレジストリ Hugging Face のリポジトリへ侵入した事案と、次期フラッグシップ「Astra」の予備評価で高度なサイバー攻撃能力が確認されたこと。7 月 22 日に既報の Erdős モデル一時停止に続く、より広範な運用改定です。

主なポイント

  • 停止対象は「最大規模のフロンティア RL 実行」で、小規模な訓練・評価は継続。期間は約 2 週間の見込み
  • 停止期間中に研究環境のハードニング、内部レッドチーミング、モニタリング拡張、エージェント権限の縮小を実施
  • Preparedness Framework の Cybersecurity 章を改訂し、エージェント異常挙動の検出・対応、許容アクセス範囲の制限を強化
  • CEO Sam Altman は「新たな能力水準に見合うアライメント・セキュリティ・監視基準を満たすため RL の一部を停止した」と表明
  • IPO 準備を進める同社にとって、コアの研究サイクルを自主停止するのは異例。安全事案がフロンティア AI 開発ロードマップに直接影響する初めての明示的ケースとなる

出典: OpenAI puts major frontier AI training run on hold over cyber risks (Help Net Security)