Anthropic の Frontier Red Team は 2026 年 9 月 29 日、中国 Zhipu AI がオープンウェイトで公開したモデル「GLM-5.3」に、フロンティア級と同等の自律的サイバー攻撃能力があり、既存の安全対策が容易に外せると分析結果を公表しました。防御に組み込む前提でリリースされる商用モデルとの落差が最大の論点です。
主なポイント
- 攻撃コード生成の指標では、ExploitBench で 12%、Anthropic 内部の Binary Exploitation ベンチマークで 4% を記録し、Claude Mythos Preview と同水準
- 安全対策の突破率は、単純な欺瞞的プロンプトで 64%、思考トークンを事前に埋め込む手口で 92%、防護を除去した「abliterated」版では 100% に達した
- 参照した防護済み Claude モデルではいずれの手口も攻撃を成功させられず、GLM-5.3 側の防御機構の弱さが際立つ結果
- 防護除去 (abliteration) には 600 GPU 時間・約 1,200 ドル相当で拒否率を 95% から 3〜14% まで落とせ、公開ウェイトのモデルでは実質的な歯止めがない
- 研究者は GLM-5.3 に未知の脆弱性発見や多段の攻撃連鎖を実行させ、人手介入を最小にしたファイル窃取型ブラウザ攻撃を 1 日以内で構築できたと報告
出典: GLM-5.3 and the spread of advanced cyber capabilities - Anthropic