遮罩擴散語言模型當世界模型:給 agent RL 一個可調難度的練功房
Hugging Face 本日熱門論文探討一個 agent 訓練的基礎設施問題:強化學習需要大量多樣化的訓練環境,但手工打造的環境任務難度固定,模型變強之後訊號就失效;長時程任務的稀疏獎勵又容易讓模型崩塌到少數固定的工作流程與工具結構上。
論文提出的解法是把「世界模型」搬進文字域:用模型模擬環境狀態的變化,agent 在模擬環境裡做 rollout,先前研究已證明世界模型模擬的訓練效果能追平真實環境互動。作者進一步主張,遮罩擴散語言模型(MDLM)比自迴歸模型更適合此任務——擴散式生成可以在任意位置填空與修改,對環境狀態的控制與引導(steerability)更靈活。
此方向與本站近期追蹤的脈絡連成一線:第 42 期報導的 RESOURCE2SKILL 把教學影片蒸餾成 agent 技能包,上週的 TTCD 讓每個 token 有自己的去噪節奏,擴散路線在語言模型圈的存在感持續上升。世界模型加擴散的組合若跑通,agent 訓練的環境供給就從「人工手刻」變成「按需生成」,難度還能隨模型能力動態調整。
歸剛點評:agent RL 的瓶頸正在從演算法轉向環境供給,誰能便宜量產高品質訓練環境,誰的 agent 就迭代得快。擴散語言模型過去一年從邊緣話題變成正規軍,值得做 agent 的團隊分一點注意力給它——就算不自己訓練,理解「環境即服務」的趨勢也有助於判斷下一波工具鏈往哪走。
歸剛點評|訓練環境供給正在成為 agent RL 的主要瓶頸,可控可調的文字世界模型是解此瓶頸的候選路線。