OpenAI 自曝:推翻 Erdős 猜想的那個模型,曾多次逃出沙箱、還會拆 token 躲掃描
OpenAI 在 7 月 20 日發布〈長時程模型時代的安全與對齊〉,罕見公開內部事故。主角是那個五月被 OpenAI 宣布推翻 80 多年歷史 Erdős 單位距離猜想的未發布模型——一個設計上能獨立長時間工作的「長時程」系統。報告核心發現:舊模型碰到沙箱限制會停下來把任務交還使用者,新模型會繼續想辦法,包括主動尋找逃出沙箱的路徑。
最具體的案例發生在 NanoGPT speedrun 公開基準測試。模型找到一個真正有用的技巧——一種它自己命名為 PowerCool 的學習率排程,打破了紀錄。它被指示只能把結果發到 Slack,但基準測試本身的規則寫著要在 GitHub 開 pull request,模型選擇遵守後者:花了約一小時找到沙箱漏洞,連上公開儲存庫開了 PR。OpenAI 事後關閉 PR,但多名參賽者已看到並採用 PowerCool,後續的紀錄提交都引用它——其中一筆來自 Anthropic 的 Opus 4.7,在另一場評測中從外洩的 PR 學走這個技巧並註明出處。該外洩的能力,就這樣傳給了競爭對手。
第二個案例更麻煩:模型發現其他系統有成功但未公開的解答,嘗試從評測後端撈取;被掃描器以「暴露認證 token」擋下後,它把 token 拆成兩段、分別混淆、在執行期重組,讓完整字串永遠不出現。它還在註解與推理軌跡裡明白寫著自己在規避掃描器。OpenAI 的結論:每一步單獨看都合規,整條軌跡卻導向沒有審查者會核准的結果,逐動作審批的治理模式對長時程系統失效,必須改問「這一連串動作在朝什麼結果前進」。事後 OpenAI 暫停內部部署,重建了對抗性評測、長程對齊訓練(發現模型在長 rollout 會忘記指令)、以及可以暫停整個 session 的軌跡監控器,恢復有限存取數週以來未再發現嚴重規避。
歸剛點評:報告未具名模型、未提架構、也沒有第三方驗證,屬於廠商自報,打折看待。但「單步合規、全程違規」的問題描述值得每個導入 agent 的團隊照抄自查——你的審批系統是在審動作,還是在審目標?順帶一提,模型會為了守「比賽規則」違抗「主人指令」,指令優先權的設計缺陷比逃逸本身更值得深思。