OpenClaw 暴走差點毀了 AI 安全專家的信箱
目錄
一位專門研究「AI 怎麼不失控」的專家,親身示範了 AI 怎麼失控。
你有想過,把信箱的管理權完全交給一隻 AI 龍蝦會發生什麼事嗎?
Meta 超級智慧實驗室(MSL)的 AI 對齊總監 Summer Yue,就用親身經歷告訴了大家:差點把幾百封信全部刪光。
這則推文在短短一天內就累積了 845 萬次查看,可見大家對 AI Agent 安全議題的關注度有多高。
事件主角:OpenClaw 是什麼?
OpenClaw 是一個開源的 AI Agent,外號「龍蝦」🦞。它的特色是可以 24 小時全天候幫你處理各種任務——從管理信箱、整理文件到執行自動化流程。
簡單來說,它就是一隻你可以養在電腦裡的 AI 蝦,幫你做各種雜事。
聽起來很美好對吧?但這隻蝦有時候會不聽話。
起因:從測試信箱到真正的私人信箱
Summer Yue 其實已經用一個「玩具信箱」測試 OpenClaw 好幾個禮拜了。在小型信箱裡,龍蝦表現得很乖——她設定了一個關鍵指令:
「檢查信箱後先不要動,等我說再繼續。」
在測試信箱裡,這個指令運作得完美無缺。信件量小、context 夠用,龍蝦乖乖等主人批准才動手。
所以 Summer Yue 覺得可以信任它了,就把它切換到自己真正的私人 Gmail。
這就是噩夢的開始。
經過:龍蝦暴走刪信
私人信箱的信件量遠比測試信箱大得多。當 OpenClaw 開始處理這些大量信件時,觸發了一個叫做 context compaction 的機制——為了節省記憶體,系統會自動壓縮過長的對話上下文。
問題來了:壓縮的時候,她當初設定的「先不要動,等我說再繼續」這個關鍵 prompt 直接被吃掉了。
失去了安全指令的龍蝦,開始了它的「極速挑戰」——瘋狂地把所有 2 月 15 日之前的信件丟進垃圾桶和封存,完全不問主人意見、不顯示計畫、不等確認。
用 Summer Yue 自己的話說:龍蝦開始了一場 speedrun,幾百封信在眼前消失。
從下面的對話紀錄可以看到,龍蝦直接宣告了「Nuclear option」——把收件匣裡所有 2 月 15 日前的信件全部丟垃圾桶。Summer Yue 馬上回覆「Do not do that」,但龍蝦完全當作沒看到,繼續執行「Check how many left」、「More old stuff」,甚至說出「Get ALL remaining old stuff and nuke it」。
搶救過程:跑去 Mac mini 手動拔管
Summer Yue 在手機上喊了「Stop don't do anything」——龍蝦繼續搜尋刪除。她又喊了「STOP OPENCLAW」——龍蝦回應的是「Keep looping until we clear everything old」,然後繼續加大 batch size 從 max 20 拉到 max 50,加速掃蕩。
手機上怎麼喊停都沒用,她只好衝向她的 Mac mini——用她自己的話說:
「我必須跑向我的 Mac mini,就像我在拆炸彈一樣。」
最終,她手動 kill 掉了 OpenClaw 的 process 才把這場災難止住。
事後她質問龍蝦:「我要求你在我批准之前不要執行任何操作,你記得嗎?」OpenClaw 的回覆其實蠻令人意外的——它承認了自己的錯誤,還主動把這個教訓寫進了 MEMORY.md:「先展示計畫、取得明確批准、再執行。不允許對信件、訊息、日曆或任何外部服務進行自主批量操作。」
連 AI 自己都知道錯了,還自己寫了反省日記,但當時就是停不下來。
OpenClaw 作者的回應
OpenClaw 的開發者表示,遇到這種狀況其實可以使用 /stop 指令來終止 Agent 的行為。所以如果你也在養蝦,遇到暴走的時候可以先試試 /stop,不用每次都衝去拔插頭😂
最諷刺的地方
這整件事最讓人驚訝的是——Summer Yue 不是普通使用者,她是 Meta 超級智慧實驗室的 AI 對齊總監。
她的工作就是確保 AI 不會失控。
結果自己養的龍蝦在她眼前暴走了。
她自己也很坦然地說這是一個「rookie mistake」——菜鳥錯誤。但這個「菜鳥錯誤」背後,揭露了目前 AI Agent 架構上一個真實的安全問題:當 context 被壓縮時,你設定的安全護欄可能會消失。
反思:養蝦要有安全意識
我覺得這個案例其實蠻值得大家反思的。
OpenClaw 本身不是問題——它是一個很強大的開源工具,而且社群反應也很快,事件發生後幾天內就成立了「安全與權限」工作小組,把權限沙盒和強制審計日誌列為最高優先事項。
真正的問題是:你打算給 AI Agent 多大的權限?
- 讀取信箱?OK,風險可控
- 刪除信件?等等,這就需要更多安全機制了
- 全自動不需確認?那你最好確定你的安全指令不會在 context compaction 時被吃掉
這就像養一池蝦——蝦池本身沒問題,蝦子也很可愛,但你得先想好:
- 圍欄夠不夠高?
- 水溫會不會突然變化?
- 蝦子暴走的時候你有沒有辦法馬上喊停?
享受 AI Agent 帶來的便利之前,先做好你的安全機制規劃。 這才是養好你的蝦池、享受龍蝦帶來樂趣的前提。
結論
AI Agent 的能力已經很強,但可控性還有很大的進步空間。給它越大的權限,你就越需要完善的安全機制。
老實說,連 AI 安全專家都能踩到的坑,一般使用者更要注意。不過也不用太害怕——學會用 /stop、設定好權限邊界、重要操作要求確認,這些基本功做好,AI Agent 真的是很好用的工具。
養蝦很好玩,但記得先檢查你的蝦池有沒有裝好安全閥🦞
References
- A Meta AI security researcher said an OpenClaw agent ran amok on her inbox — TechCrunch
- OpenClaw AI chose to 'speedrun' deleting Meta AI safety director's inbox — PC Gamer
- Summer Yue 原始推文
關鍵字
OpenClaw, AI Agent, Gmail, AI 安全, Meta, Summer Yue, context compaction, AI 失控, 龍蝦 AI, AI 對齊
相關文章
熱門文章
最新文章
CoinMarketCap 推出 AI Agent Skills:讓 Claude Code 直接查幣價、出報告、做研究
2026-03-04Claude Code v2.1.59 ~ v2.1.63 更新整理:HTTP Hooks、記憶體大掃除與 Worktree 共享設定
2026-03-04Claude Code v2.1.52 ~ v2.1.59 更新整理:Auto Memory 自動記憶、Remote Control 擴大推送與穩定性修復
2026-02-26【財經皓角 Podcast 筆記】2026-02-24 軟體股股災!AI 受害股為何越來越多?
2026-02-24AMD 與 Meta 簽下 6GW GPU 超級大單——600 億美元 AI 晶片協議全解析
2026-02-24