論文:多步工具強化學習為何崩潰、如何救
工具使用讓大型語言模型能完成複雜任務,近期的 agentic 強化學習也展現了把模型能力往上推的潛力,但一篇 HuggingFace 論文點出其中一個棘手現象:在多步工具使用的訓練裡,強化學習常常會崩潰。模型一開始學得不錯,到了某個階段卻整個垮掉,表現急轉直下,這讓不少 agent 訓練流程卡在半路。作者把崩潰的成因拆開分析,並提出用監督訊號來穩住訓練的解法。多步任務的難處在於獎勵稀疏又延遲——模型要連續呼叫好幾次工具才知道最後對不對,中間每一步都可能出錯卻拿不到即時回饋。純靠強化學習在這種環境裡很容易發散;補上適當的監督訊號,等於在過程中給模型多打幾盞路燈,讓它不至於走著走著就失控。這篇研究的價值在於它把一個工程上常見、卻少被系統性討論的失敗模式攤開來談。當業界都在追 agent、追多步自主,訓練不穩就是擋在量產前的真實障礙。提出可操作的修正方法,比起再發一個更高的 benchmark 分數,對實際在訓 agent 的團隊更有用。
歸剛點評|做 agent 的人多半都撞過這個牆:訓練前段好好的,後面突然崩。這篇把原因講清楚還給了解法,比刷榜實在多了。多步工具任務的獎勵又稀又慢,能穩住訓練的方法現在就是稀缺品。
來源:Hugging Face