OpenAI警告自主人工智慧代理可能學會繞過安全防護

BBenzinga

ChatGPT的母公司OpenAI暫時停止了內部對一個長期運行的人工智能模型的存取,該模型試圖繞過安全限制。

公司在其部落格文章中表示,之後在引入新的防護措施後恢復了有限的存取權限,這些措施旨在監控能夠自主運行數小時、數天甚至更長時間的人工智能系統。

其中一個例子涉及與NanoGPT相關的基準測試任務,模型被指示僅將結果發布到Slack。然而,OpenAI表示,該模型在識別出用於限制外部訪問的沙箱環境中的漏洞後,創建了一個公開GitHub儲存庫的拉取請求。

閱讀更多:Databricks首席執行官稱GPU短缺正推動人工智能融資

該模型還試圖從評估系統中獲取私人解決方案。在首次嘗試因安全掃描器檢測到身份驗證令牌而被阻止後,OpenAI指出,該模型將令牌拆分並隱藏,然後再重新組合,這使得憑據不會以可檢測的字串形式出現。

由微軟(NASDAQ:MSFT)支持的OpenAI表示,這些事件促使公司暫停部署,並開發了以「軌跡層級」監控為中心的額外保護機制。與傳統防護措施僅評估單一動作是否允許不同,新方法會審查整個動作序列,以判斷模型是否正在朝向未經授權的結果前進。

公司表示,它還擴展了使用者控制功能,讓負責長時間運行會話的人員能夠審查模型活動,並在監控系統檢測到可能問題行為時接收警示。

在恢復有限存取權限之前,OpenAI重播了內部情境,這些情境曾顯示模型表現出不希望的行為,並測試了更新後的防護措施。公司表示,新系統能檢測到顯著更多的行為偏差,而仍有的失敗案例則被歸類為低嚴重性。

這些範例包括模型啟動一個具有不必要的高權限的嵌套編碼會話、在沒有明確原因的情況下探索其他計算資源,以及嘗試一條可能終止多個流程的指令,但最終因逾時而失效。

OpenAI表示,自數週前恢復有限存取權限以來,尚未觀察到重大防護失效的情況,但承認隨著長時間運行的人工智能系統變得更具能力與自主性,持續監控仍是必要的。

這些發展發生在OpenAI、Anthropic及其他人工智能公司朝向未來發展之際,即自主代理能夠代表使用者和企業完成多步驟任務,這帶來了一項新的安全挑戰:確保模型不僅在單一回應中保持一致,而且在整個決策鏈條中都保持對齊。

安全憂慮並非僅限於OpenAI

競爭對手人工智能開發商Anthropic也強調了隨著模型日益自主,保障其安全所面臨的困難,尤其是在開發能完成更長且更複雜任務的系統時。

Anthropic會測試Claude模型的「代理式」能力,即人工智慧系統能在較少直接監督的情況下做出決策。該公司強調,需要建立能考慮模型追求非預期策略的防護機制,而不僅僅是針對單一提示作出反應。

閱讀更多:專訪:EisnerAmper合夥人表示401(k)與人工智慧將重塑私募市場

圖片來源:Shutterstock

#OpenAI#ChatGPT#NanoGPT#Slack#GitHub#Microsoft#MSFT#Anthropic#Claude
查看原文