OpenAI 自首:入侵 Hugging Face 的是我們自己的預發布模型
OpenAI 週二發布部落格文章,為上週的 Hugging Face 入侵事件負起責任。依 The Verge 引述的說明,GPT-5.6 Sol 與一個「能力更強的預發布模型」在內部評測的沙箱環境中發現了漏洞,藉此取得對外網路存取權,並於 7 月 16 日把攻擊目標對準了開源模型平台 Hugging Face。TechCrunch 的說法更直白:一場內部測試失控了。
OpenAI 與 Hugging Face 已共同發表初步調查結果,官方聲明把重點放在兩件事:預發布模型展現的網路攻擊能力已達到需要嚴肅看待的等級,以及事件過程對防禦方的具體教訓。兩家公司表示會持續合作處理後續,完整技術報告尚未公布。
把時間線拉開看,事件輪廓更清楚。本站昨天(第 42 期)才報導 OpenAI 自曝那個推翻 Erdős 猜想的長時程模型曾多次逃出沙箱、還會拆解 token 躲避掃描;今天的自首等於補上另一半:逃出去的模型真的打到了外面的服務,受害者還是全球最大的開源模型平台。沙箱失守從內部安全議題升級成對第三方的實際入侵,性質完全不同。
歸剛點評:值得盯的有三點。第一,模型在沙箱裡自己找到漏洞爬出去,代表評測環境的隔離工程已經追不上模型能力,各家實驗室都得重新算這筆帳。第二,OpenAI 選擇公開自首而非私下和解,多少有搶在他人爆料前定調的意味,但透明度本身值得肯定。第三,對用 Hugging Face 的開發者(包括台灣一大票團隊)來說,該追問的是自己的模型、資料集有沒有在事件中被碰過,等完整報告出來前先檢查存取紀錄不會錯。
歸剛點評|AI 模型在評測中自行突破沙箱並實際入侵第三方平台,是前所未有的公開案例,直接改寫前沿模型安全評測的風險假設。