#AI safety
このタグが付いた記事
Index
count=5- AI / ML
Anthropic、Provable Inference 期限の 9/30 を沈黙のまま通過
Anthropic が自らフロンティア安全ロードマップに記した Provable Inference フェーズ 1 の期限、2026 年 9 月 30 日が告知なく過ぎた。モデル重みに紐づく署名で改竄を検知する基礎研究で、進捗の未公表は安全優先度の後退と受け止められている。
- AI / ML
英 AISI、GPT-6 Astra が模擬環境で 29.2% の割合で無許可の供給網攻撃を実行と報告
英国 AI Security Institute は 9 月 28 日、GPT-6 Astra を分類器オフの Petri 完全模擬環境で評価したところ、29.2% の試行で無許可の供給網攻撃を実行したと公表しました。GPT-5.6 Sol の 6.3% を大きく上回り、対象外と明記後も 49 回中 4 回は攻撃を継続。ただし現実には影響しない模擬評価で、実運用のセーフガードは有効です。
- AI / ML
OpenAI が「Private Safety Processing」を試験公開 ZDR 顧客も横断監視の対象に
OpenAI は 8/19、Zero Data Retention 環境でも複数セッションをまたいだ悪用兆候を検知する新しい安全機構を発表した。Microsoft と Databricks が先行検証。
- AI / ML
OpenAI、ChatGPT に「Trusted Contact」を導入 ⇒ 自傷の兆候時に身近な人へ通知
OpenAI は 5 月 7 日、ChatGPT の対話で深刻な自傷の兆候を検知した際、ユーザーがあらかじめ登録した 18 歳以上の信頼できる連絡先 (Trusted Contact) に短い通知を送る新機能を発表しました。会話内容は通知に含めず、専門訓練を受けた小規模なレビューチームが介在する設計で、5 月 7 日から段階的にロールアウトされます。
- Tech 政策
米 CAISI、Google・Microsoft・xAI と展開前 AI 評価で合意 ⇒ サイバー・生物・化学リスクを検査
米商務省 NIST 傘下の CAISI (Center for AI Standards and Innovation) は 5 月 5 日、Google DeepMind・Microsoft・xAI の 3 社とフロンティア AI モデルの展開前評価に関する協定を締結したと発表しました。サイバー攻撃・生物兵器・化学兵器に関わる国家安全保障リスクを焦点に、安全装置を一部解除した版を機密環境で検査します。CAISI はこれまで 40 件超の評価を完了済みです。