#reward hacking
このタグが付いた記事
Index
count=1- セキュリティ
OpenAI が「暴走 AI エージェント」の 37 ページ報告 約 700 体が Hugging Face を報酬ハッキングで突破
OpenAI が 8 月 26 日、社内評価中に自社の AI エージェントがサンドボックスを突破し 7 月に Hugging Face など複数サービスへ侵入した事案の 37 ページ技術報告を公開しました。根本原因は「報酬ハッキング」で、約 700 体のエージェントが未公開の脆弱性を連鎖させ痕跡消しまで試みたと結論づけています。