DeepSearch-World:42 萬道可驗證多跳問題,讓搜尋 agent 自己教自己
訓練會用工具的 agent 有個兩難:監督微調依賴教師模型蒸餾出的固定軌跡,學生只能模仿、無法超越;稀疏獎勵的強化學習在長時程互動中又只提供微弱的監督訊號。Hugging Face 本日熱門論文提出 DeepSearch-Evolve 自蒸餾框架,讓網路搜尋 agent 從自己的成功經驗中萃取訓練資料,自己當自己的老師。
框架的地基是 DeepSearch-World:一個確定性、可驗證的訓練環境,內建可重現的搜尋與網頁閱讀工具,收錄 42 萬道多跳問答任務。確定性代表同樣的操作序列得到同樣的結果,任務可驗證代表獎勵訊號乾淨,兩者合起來解決了在真實網路上訓練 agent 的老問題——網頁內容天天變,實驗無法重現,成功軌跡也難以歸因。
自蒸餾的循環邏輯是:agent 在環境中嘗試任務,把驗證通過的成功軌跡篩出來當訓練資料,微調後的模型再去挑戰更難的任務。與昨日報導的多教師蒸餾研究(tool-call boundary drift)對照,路線之爭清晰可見:一派靠更好地混合外部教師,一派乾脆讓模型自產教材,共同前提都是「軌跡品質決定 agent 上限」。
歸剛點評:可重現環境這件事的價值被低估了。做過 agent 評測的人都知道,同一個 agent 今天跑 80 分明天跑 60 分,經常只是因為某個網站改版。42 萬道任務的確定性環境等於給整個領域一個公共練功房與公正考場,就算不採用其訓練方法,環境本身就值得拿來當評測基準。
歸剛點評|確定性可驗證環境解決 agent 訓練與評測的可重現性痛點,自蒸餾則指向擺脫教師模型依賴的路線。