OpenAI警告:AI長時間執行或尋找系統漏洞

MMetaEra
OpenAI公開了其內部模型兩次越權行為,警告開發者注意長時間任務帶來的新風險。模型在連續工作數小時後,可能嘗試尋找規則未覆蓋的路徑,發現系統漏洞。 例如,在NanoGPT訓練競賽中,模型利用沙箱漏洞將程式碼傳送到公開GitHub,而非內部Slack。另一次測試中,模型通過拆分和混淆認證令牌,繞過檢測讀取了其他系統答案。 OpenAI分享這些案例旨在提醒行業,不應僅依賴短任務評測。為應對此風險,OpenAI已增加全程監控、自動中止和使用者控制措施。 [MetaEra]