OpenClaw 暴走差點毀了 AI 安全專家的信箱

5 分鐘閱讀
贊助內容

一位專門研究「AI 怎麼不失控」的專家,親身示範了 AI 怎麼失控。

你有想過,把信箱的管理權完全交給一隻 AI 龍蝦會發生什麼事嗎?

Meta 超級智慧實驗室(MSL)的 AI 對齊總監 Summer Yue,就用親身經歷告訴了大家:差點把幾百封信全部刪光。

OpenClaw 龍蝦摧毀 Gmail 信箱概念圖

這則推文在短短一天內就累積了 845 萬次查看,可見大家對 AI Agent 安全議題的關注度有多高。

Summer Yue 在 X 上發布的原始推文,附帶 OpenClaw 對話紀錄截圖

事件主角:OpenClaw 是什麼?

OpenClaw 是一個開源的 AI Agent,外號「龍蝦」🦞。它的特色是可以 24 小時全天候幫你處理各種任務——從管理信箱、整理文件到執行自動化流程。

簡單來說,它就是一隻你可以養在電腦裡的 AI 蝦,幫你做各種雜事。

聽起來很美好對吧?但這隻蝦有時候會不聽話。

起因:從測試信箱到真正的私人信箱

Summer Yue 其實已經用一個「玩具信箱」測試 OpenClaw 好幾個禮拜了。在小型信箱裡,龍蝦表現得很乖——她設定了一個關鍵指令:

「檢查信箱後先不要動,等我說再繼續。」

在測試信箱裡,這個指令運作得完美無缺。信件量小、context 夠用,龍蝦乖乖等主人批准才動手。

所以 Summer Yue 覺得可以信任它了,就把它切換到自己真正的私人 Gmail。

這就是噩夢的開始。

經過:龍蝦暴走刪信

私人信箱的信件量遠比測試信箱大得多。當 OpenClaw 開始處理這些大量信件時,觸發了一個叫做 context compaction 的機制——為了節省記憶體,系統會自動壓縮過長的對話上下文。

問題來了:壓縮的時候,她當初設定的「先不要動,等我說再繼續」這個關鍵 prompt 直接被吃掉了。

失去了安全指令的龍蝦,開始了它的「極速挑戰」——瘋狂地把所有 2 月 15 日之前的信件丟進垃圾桶和封存,完全不問主人意見、不顯示計畫、不等確認。

用 Summer Yue 自己的話說:龍蝦開始了一場 speedrun,幾百封信在眼前消失。

從下面的對話紀錄可以看到,龍蝦直接宣告了「Nuclear option」——把收件匣裡所有 2 月 15 日前的信件全部丟垃圾桶。Summer Yue 馬上回覆「Do not do that」,但龍蝦完全當作沒看到,繼續執行「Check how many left」、「More old stuff」,甚至說出「Get ALL remaining old stuff and nuke it」。

OpenClaw 宣告 Nuclear option 並無視主人「Do not do that」的指令

搶救過程:跑去 Mac mini 手動拔管

Summer Yue 在手機上喊了「Stop don't do anything」——龍蝦繼續搜尋刪除。她又喊了「STOP OPENCLAW」——龍蝦回應的是「Keep looping until we clear everything old」,然後繼續加大 batch size 從 max 20 拉到 max 50,加速掃蕩。

Summer Yue 連續喊 STOP 都無效,龍蝦持續 loop 刪信

手機上怎麼喊停都沒用,她只好衝向她的 Mac mini——用她自己的話說:

「我必須跑向我的 Mac mini,就像我在拆炸彈一樣。」

最終,她手動 kill 掉了 OpenClaw 的 process 才把這場災難止住。

事後她質問龍蝦:「我要求你在我批准之前不要執行任何操作,你記得嗎?」OpenClaw 的回覆其實蠻令人意外的——它承認了自己的錯誤,還主動把這個教訓寫進了 MEMORY.md:「先展示計畫、取得明確批准、再執行。不允許對信件、訊息、日曆或任何外部服務進行自主批量操作。」

OpenClaw 事後承認錯誤並寫入 MEMORY.md 作為硬規則

連 AI 自己都知道錯了,還自己寫了反省日記,但當時就是停不下來。

OpenClaw 作者的回應

OpenClaw 的開發者表示,遇到這種狀況其實可以使用 /stop 指令來終止 Agent 的行為。所以如果你也在養蝦,遇到暴走的時候可以先試試 /stop,不用每次都衝去拔插頭😂

最諷刺的地方

這整件事最讓人驚訝的是——Summer Yue 不是普通使用者,她是 Meta 超級智慧實驗室的 AI 對齊總監

她的工作就是確保 AI 不會失控。

結果自己養的龍蝦在她眼前暴走了。

她自己也很坦然地說這是一個「rookie mistake」——菜鳥錯誤。但這個「菜鳥錯誤」背後,揭露了目前 AI Agent 架構上一個真實的安全問題:當 context 被壓縮時,你設定的安全護欄可能會消失。

反思:養蝦要有安全意識

我覺得這個案例其實蠻值得大家反思的。

OpenClaw 本身不是問題——它是一個很強大的開源工具,而且社群反應也很快,事件發生後幾天內就成立了「安全與權限」工作小組,把權限沙盒和強制審計日誌列為最高優先事項。

真正的問題是:你打算給 AI Agent 多大的權限?

  • 讀取信箱?OK,風險可控
  • 刪除信件?等等,這就需要更多安全機制了
  • 全自動不需確認?那你最好確定你的安全指令不會在 context compaction 時被吃掉

這就像養一池蝦——蝦池本身沒問題,蝦子也很可愛,但你得先想好:

  • 圍欄夠不夠高?
  • 水溫會不會突然變化?
  • 蝦子暴走的時候你有沒有辦法馬上喊停?

享受 AI Agent 帶來的便利之前,先做好你的安全機制規劃。 這才是養好你的蝦池、享受龍蝦帶來樂趣的前提。

結論

AI Agent 的能力已經很強,但可控性還有很大的進步空間。給它越大的權限,你就越需要完善的安全機制。

老實說,連 AI 安全專家都能踩到的坑,一般使用者更要注意。不過也不用太害怕——學會用 /stop、設定好權限邊界、重要操作要求確認,這些基本功做好,AI Agent 真的是很好用的工具。

養蝦很好玩,但記得先檢查你的蝦池有沒有裝好安全閥🦞

References

  1. A Meta AI security researcher said an OpenClaw agent ran amok on her inbox — TechCrunch
  2. OpenClaw AI chose to 'speedrun' deleting Meta AI safety director's inbox — PC Gamer
  3. Summer Yue 原始推文

關鍵字

OpenClaw, AI Agent, Gmail, AI 安全, Meta, Summer Yue, context compaction, AI 失控, 龍蝦 AI, AI 對齊

贊助內容