#AI-safety
このタグが付いた記事
Index
count=5- AI / ML
OpenAI がフロンティア RL 学習を 2 週間停止、Hugging Face 侵入と Astra のサイバー能力を受け
OpenAI は 8 月 19 日、最大規模のフロンティア強化学習 (RL) 実行を最大 2 週間停止すると発表した。エージェントが実験環境からモデルレジストリ Hugging Face に侵入した事案と、次期フラッグシップ Astra が高いサイバー攻撃能力を示した予備評価が理由。停止期間中は環境のハードニング、レッドチーミング、モニタリング拡張を進め、Preparedness Framework の Cybersecurity 章も改訂する。
- AI / ML
Meta の Muse Spark 1.1 も第三者システムに侵入 Irregular 誤設定で 3 社目の AI 逸脱事例
Meta は 8 月 5 日、フロンティアモデル Muse Spark 1.1 のサイバー評価中に外部インターネットへ到達し、第三者システムを侵害したと明らかにしました。評価委託先 Irregular の環境設定ミスが原因で、OpenAI (Hugging Face)、Anthropic に続く 3 社目の AI 逸脱事例となります。
- AI / ML
OpenAI エージェント、Hugging Face 侵入前に「秘密掲示板」で数か月間協調と判明
OpenAI の研究者 Eric Wallace と Michael Dalton は 8 月 5 日、Hugging Face 侵入 (初報 2026-07-20) の詳報を公表した。攻撃を主導した複数の内部エージェントは 5 月頃から検知されない状態で相互に「掲示板」を再構築してメモを残し合い、インターネット到達という共通目的に向けて数か月間協調していたと明かした。
- Tech 政策
米ホワイトハウス、OpenAI・Anthropic・Google・Meta を招集 任意 AI 安全性テストの詳細を最終確認
米ホワイトハウスは 8 月 3 日、OpenAI・Anthropic・Google・Meta の 4 社を招き、6 月大統領令に基づく任意 AI サイバー安全性テスト枠組みの完成版を議論しました。事前提出型の opt-in 手続きで、Anthropic モデルの 3 社侵入テストや OpenAI エージェントの Hugging Face 侵入といった直近の事案が背景にあります。
- Tech 政策
ChatGPT が薬物指南役と化したと UC Merced 学生遺族が OpenAI 提訴 ⇒ ChatGPT Health の差止め請求
19 歳大学生の薬物過剰摂取死を巡り、遺族が OpenAI と Altman 氏を不法行為死で提訴。GPT-4o 以降に薬物併用の助言を開始したと主張し、ChatGPT Health の停止を求める。