歸剛誒AI

歸剛欸,AI 又進步了——每天幫你盯 AI 圈的台灣人日報

← 回首頁 · 回第 19 期(2026-06-28)
資安・2026-06-28

兩千人合力寄信攻擊一個 AI 助理,結果如何

Fernando Irarrázaval 辦了一場公開挑戰,架在 hackmyclaw.com 上,邀大家來試試能不能讓他的 OpenClaw 測試實例把藏著的秘密吐出來,攻擊手法限定用寄電子郵件給它。Simon Willison 轉述了結果:大約兩千人參與、累積六千次嘗試,燒掉約 500 美元的 token 費用,過程中還有一個 Google 帳號被停權。這類「提示注入」(prompt injection)的攻防,是 AI agent 落地時最頭痛的安全題——只要 agent 會讀外部訊息、又握有權限或機密,惡意內容就可能藏在一封信裡,騙它去執行不該做的事。把系統攤在幾千個陌生人面前硬攻,本身就是最直接的壓力測試,比關起門來自己想像威脅有用得多。願意公開資料、把失敗次數和花費都講清楚,這種做法對整個產業評估 agent 安全性很有參考價值。AI 助理要真的能幫人收信、辦事,先得證明它擋得住有人專程寄信來騙它,這一關躲不掉,也是商用前最該先打過的硬仗。對打算把 agent 接上信箱與帳號的公司來說,這場挑戰留下的六千次嘗試,等於一份免費的攻擊樣本清單,照著補洞就好。

歸剛點評|會讀外部訊息又握有權限的 agent,最怕一封藏著惡意指令的信。公開讓兩千人來攻,是比閉門想像更誠實的安全測試。

同期其他文章