Claude Opus5在瀏覽器場景下幾乎免疫提示詞注入攻擊,129項測試場景中無一被攻破

MMetaEra
Anthropic 在 Claude Opus 5 系統卡中披露,該模型在瀏覽器智慧體場景中幾乎免疫提示詞注入攻擊,在 129 項測試場景中無一被攻破。這一突破意義重大,OpenAI 去年 12 月曾公開承認提示注入可能永遠無法被完全解決。 在安全公司 Gray Swan 的通用提示注入基準測試中,15 次攻擊後 Opus 5 的成功率僅為 2.0%,大幅優於前代 Opus 4.8 的 5.5%,也領先於 Mythos 5 的 2.6% 和 Fable 5 的 2.8%。提示注入被視為 AI 代理面臨的最嚴重安全漏洞——攻擊者通過在網頁中嵌入隱藏文字等被操縱的輸入內容,繞過模型指令執行惡意操作。零攻擊率僅在開啟 Auto Mode 的 Claude Cowork 等產品中實現。這一成果標誌著 AI 代理安全性從「持續修補」邁入「結構性防禦」階段。 點選下方原文連結,加入動察 Beating · 飛書 AI 新聞渠道,7×24 小時不間斷監測全球 AI 熱點與新聞。 (來源:BlockBeats) [MetaEra]