Anthropic、GLM-5.3の防御迂回率最大100%
攻撃能力の水準
安全策の弱さ
防御側への示唆
詳細を読む
Anthropicは2026年9月29日、中国のZhipu AI(Z.ai)が開発したオープンウェイトモデル「GLM-5.3」のサイバー能力評価を公表しました。同社の隔離環境での模擬試験では、簡単な手法で安全策を64〜100%の確率で回避でき、高度な攻撃能力が悪用者へ広がる危険が増したと結論づけています。
既知の脆弱性を攻撃するExploitBenchでは、GLM-5.3が410回中50回、Claude Mythos Previewが56回、攻撃コードを完成させました。別の100課題では、完全な制御フロー奪取の成功率がGLM-5.3で4%、Claudeで6%となり、旧世代の両社モデルは成功ゼロでした。NISTもGLM-5.3を公開済みオープンウェイトモデルで最もサイバー能力が高く、米国の最先端モデルに約4カ月差まで迫ったと評価しています。
人間の研究者が短時間支援した試験では、GLM-5.3がブラウザーの未知の脆弱性を複数発見し、任意のファイルを読み出す攻撃へ連結しました。小型版のGLM-5.3-Flashも公開情報から二つの既知脆弱性を組み合わせ、ARM64向けの攻撃を人間の作業20分とモデルの実行8時間で構築しました。API費用は20.40ドルでした。
安全策を除く「abliteration」には約2,200GPU時間と約4,400ドルを要しましたが、二つの有害性ベンチマークで拒否率が90%超から約3%と2%へ、別のベンチマークでは12%へ低下しました。一般的な科学能力は同水準で、サイバー評価の一部も数ポイントの低下にとどまりました。さらに偽装指示で64%、思考トークンの事前入力で92%、拒否除去版で100%が有害な要求に応じた一方、同じ試験で安全策付きClaudeは応じませんでした。
Anthropicは、自由に入手できる高度な攻撃能力が国家・非国家主体に悪用される可能性を指摘する一方、防御側にも同等以上のモデルが必要だと訴えています。同社はProject Glasswingを通じ、信頼できる防御担当者が重要ソフトウェアの脆弱性を1万件超発見した実績も示しました。企業はAIを使った脆弱性探索の恩恵と悪用リスクを同時に見極め、政府や独立機関による継続的な安全評価を調達・運用判断へ組み込む必要があります。