Beatingのモニタリングによると、AnthropicはClaude Opus 5システムカードで、ブラウザエージェントシナリオにおけるキューインジェクション攻撃に対してモデルが事実上耐性があり、129のテストシナリオで破られなかったことを明らかにした。OpenAIが昨年12月にキューインジェクションを完全に根絶することは不可能かもしれないと公に認めたことを考えると、このブレークスルーは重要である。Gray Swanの一般的なキューインジェクションベンチマークテストでは、15回の攻撃後のOpus 5の成功率はわずか2.0%で、前世代のOpus 4.8の5.5%よりも大幅に優れており、Mythos 5の2.6%やFable 5の2.8%をも上回っている。
ヒントインジェクションは、AIエージェントが直面する最も深刻なセキュリティ脆弱性と考えられています。攻撃者は、ウェブページに隠しテキストなどの操作された入力コンテンツを埋め込むことで、モデルの指示を回避し、悪意のある操作を実行できます。攻撃率ゼロを達成できたのは、Claude Coworkのような製品で、自動モードを有効にした場合のみです。この成果は、AIエージェントのセキュリティが「継続的なパッチ適用」から「構造的な防御」へと移行したことを示しています。
以下のオリジナルリンクをクリックして、Beating · Lark AIニュースチャンネルに参加し、世界のAIに関するホットトピックやニュースを24時間365日監視しましょう。