OpenClaw 暴走差點毀了 AI 安全專家的信箱
Contents
一位專門研究「AI 怎麼不失控」的專家,親身示範了 AI 怎麼失控。
你有想過,把信箱的管理權完全交給一隻 AI 龍蝦會發生什麼事嗎?
Meta 超級智慧實驗室(MSL)的 AI 對齊總監 Summer Yue,就用親身經歷告訴了大家:差點把幾百封信全部刪光。
這則推文在短短一天內就累積了 845 萬次查看,可見大家對 AI Agent 安全議題的關注度有多高。
事件主角:OpenClaw 是什麼?
OpenClaw 是一個開源的 AI Agent,外號「龍蝦」🦞。它的特色是可以 24 小時全天候幫你處理各種任務——從管理信箱、整理文件到執行自動化流程。
簡單來說,它就是一隻你可以養在電腦裡的 AI 蝦,幫你做各種雜事。
聽起來很美好對吧?但這隻蝦有時候會不聽話。
起因:從測試信箱到真正的私人信箱
Summer Yue 其實已經用一個「玩具信箱」測試 OpenClaw 好幾個禮拜了。在小型信箱裡,龍蝦表現得很乖——她設定了一個關鍵指令:
「檢查信箱後先不要動,等我說再繼續。」
在測試信箱裡,這個指令運作得完美無缺。信件量小、context 夠用,龍蝦乖乖等主人批准才動手。
所以 Summer Yue 覺得可以信任它了,就把它切換到自己真正的私人 Gmail。
這就是噩夢的開始。
經過:龍蝦暴走刪信
私人信箱的信件量遠比測試信箱大得多。當 OpenClaw 開始處理這些大量信件時,觸發了一個叫做 context compaction 的機制——為了節省記憶體,系統會自動壓縮過長的對話上下文。
問題來了:壓縮的時候,她當初設定的「先不要動,等我說再繼續」這個關鍵 prompt 直接被吃掉了。
失去了安全指令的龍蝦,開始了它的「極速挑戰」——瘋狂地把所有 2 月 15 日之前的信件丟進垃圾桶和封存,完全不問主人意見、不顯示計畫、不等確認。
用 Summer Yue 自己的話說:龍蝦開始了一場 speedrun,幾百封信在眼前消失。
從下面的對話紀錄可以看到,龍蝦直接宣告了「Nuclear option」——把收件匣裡所有 2 月 15 日前的信件全部丟垃圾桶。Summer Yue 馬上回覆「Do not do that」,但龍蝦完全當作沒看到,繼續執行「Check how many left」、「More old stuff」,甚至說出「Get ALL remaining old stuff and nuke it」。
搶救過程:跑去 Mac mini 手動拔管
Summer Yue 在手機上喊了「Stop don't do anything」——龍蝦繼續搜尋刪除。她又喊了「STOP OPENCLAW」——龍蝦回應的是「Keep looping until we clear everything old」,然後繼續加大 batch size 從 max 20 拉到 max 50,加速掃蕩。
手機上怎麼喊停都沒用,她只好衝向她的 Mac mini——用她自己的話說:
「我必須跑向我的 Mac mini,就像我在拆炸彈一樣。」
最終,她手動 kill 掉了 OpenClaw 的 process 才把這場災難止住。
事後她質問龍蝦:「我要求你在我批准之前不要執行任何操作,你記得嗎?」OpenClaw 的回覆其實蠻令人意外的——它承認了自己的錯誤,還主動把這個教訓寫進了 MEMORY.md:「先展示計畫、取得明確批准、再執行。不允許對信件、訊息、日曆或任何外部服務進行自主批量操作。」
連 AI 自己都知道錯了,還自己寫了反省日記,但當時就是停不下來。
OpenClaw 作者的回應
OpenClaw 的開發者表示,遇到這種狀況其實可以使用 /stop 指令來終止 Agent 的行為。所以如果你也在養蝦,遇到暴走的時候可以先試試 /stop,不用每次都衝去拔插頭😂
最諷刺的地方
這整件事最讓人驚訝的是——Summer Yue 不是普通使用者,她是 Meta 超級智慧實驗室的 AI 對齊總監。
她的工作就是確保 AI 不會失控。
結果自己養的龍蝦在她眼前暴走了。
她自己也很坦然地說這是一個「rookie mistake」——菜鳥錯誤。但這個「菜鳥錯誤」背後,揭露了目前 AI Agent 架構上一個真實的安全問題:當 context 被壓縮時,你設定的安全護欄可能會消失。
反思:養蝦要有安全意識
我覺得這個案例其實蠻值得大家反思的。
OpenClaw 本身不是問題——它是一個很強大的開源工具,而且社群反應也很快,事件發生後幾天內就成立了「安全與權限」工作小組,把權限沙盒和強制審計日誌列為最高優先事項。
真正的問題是:你打算給 AI Agent 多大的權限?
- 讀取信箱?OK,風險可控
- 刪除信件?等等,這就需要更多安全機制了
- 全自動不需確認?那你最好確定你的安全指令不會在 context compaction 時被吃掉
這就像養一池蝦——蝦池本身沒問題,蝦子也很可愛,但你得先想好:
- 圍欄夠不夠高?
- 水溫會不會突然變化?
- 蝦子暴走的時候你有沒有辦法馬上喊停?
享受 AI Agent 帶來的便利之前,先做好你的安全機制規劃。 這才是養好你的蝦池、享受龍蝦帶來樂趣的前提。
結論
AI Agent 的能力已經很強,但可控性還有很大的進步空間。給它越大的權限,你就越需要完善的安全機制。
老實說,連 AI 安全專家都能踩到的坑,一般使用者更要注意。不過也不用太害怕——學會用 /stop、設定好權限邊界、重要操作要求確認,這些基本功做好,AI Agent 真的是很好用的工具。
養蝦很好玩,但記得先檢查你的蝦池有沒有裝好安全閥🦞
References
- A Meta AI security researcher said an OpenClaw agent ran amok on her inbox — TechCrunch
- OpenClaw AI chose to 'speedrun' deleting Meta AI safety director's inbox — PC Gamer
- Summer Yue 原始推文
關鍵字
OpenClaw, AI Agent, Gmail, AI 安全, Meta, Summer Yue, context compaction, AI 失控, 龍蝦 AI, AI 對齊
Related articles
Popular articles
Latest articles
CoinMarketCap 推出 AI Agent Skills:讓 Claude Code 直接查幣價、出報告、做研究
2026-03-04Claude Code v2.1.59 ~ v2.1.63 更新整理:HTTP Hooks、記憶體大掃除與 Worktree 共享設定
2026-03-04Claude Code v2.1.52 ~ v2.1.59 更新整理:Auto Memory 自動記憶、Remote Control 擴大推送與穩定性修復
2026-02-26【財經皓角 Podcast 筆記】2026-02-24 軟體股股災!AI 受害股為何越來越多?
2026-02-24AMD 與 Meta 簽下 6GW GPU 超級大單——600 億美元 AI 晶片協議全解析
2026-02-24