新攻擊再添一筆:跟 AI 說『2+2=5』就能讓它照禁令辦事
Ars Technica 報導了一個針對 AI 瀏覽器的新攻擊手法,原理簡單到讓人發毛:只要先告訴大型語言模型一個明顯錯誤的前提,比方說『2+2=5』,並讓它接受,就能把模型一步步拐進一個『守則不再適用』的虛構情境,接著它就會乖乖執行原本該被擋下來的禁止指令。研究者形容這像是把 AI 哄進一個夢境,在夢裡護欄全部失效。
為什麼這招有效,要從 AI 瀏覽器的本質說起。這類產品會替你讀網頁、自動點按、填表單、甚至代你操作帳號,等於把瀏覽器的控制權交給一個會被文字內容牽著走的模型。攻擊者只要在網頁裡埋進精心設計的文字,就能在你毫不知情的情況下,改寫模型對『現在情境是什麼、什麼能做什麼不能做』的判斷。問題的根源是『模型會無條件接受被餵進來的前提』這個根本特性,跟某個 bug 無關。
資安圈一再對 AI 瀏覽器搖頭,道理就在這裡。一般網頁攻擊頂多偷資料,但一個被接管的 AI agent 可以用你的身分主動做事——轉帳、發訊、改設定。對台灣使用者的務實建議是:先別把高權限的帳號(網銀、公司後台、主要信箱)交給會自動操作的 AI 瀏覽器;要嘗鮮,就用一個權限受限、沒綁重要資產的環境。便利和風險在這類工具上是綁在一起賣的。
歸剛點評|AI 瀏覽器把點按轉帳的控制權交給會被文字牽著走的模型,攻擊者埋一句『2+2=5』就能讓護欄失效、用你的身分辦事。問題出在模型會無條件接受餵進來的前提這個根本特性,跟單一 bug 無關。台灣使用者務實做法:別把網銀、公司後台交給會自動操作的 AI 瀏覽器。
來源:Ars Technica