HF 論文:post-training 早就藏著免費的 agent 獎勵訊號
Hugging Face 每日論文選了一篇談 AI agent 訓練的研究,標題點名一個被忽略的「免費午餐」。背景是這樣:過程獎勵模型(process reward model)能對 LLM 的每一步動作打分,做到步驟層級的細緻評估,對需要長串操作的 agent 特別有用。問題在於,agent 的場景又長又難——一連串互動、有些動作做了無法回頭、環境回饋還帶隨機性,靠人工標註或蒙地卡羅估計來建這種獎勵模型,成本高到幾乎不可行。這篇論文的主張是,強化學習的 post-training 過程其實已經悄悄產出了建構這類獎勵訊號需要的材料,等於現成的東西被擱在一旁沒人撿。研究團隊提出「進度優勢」的概念,把訓練裡本來就有的訊號重新利用,讓步驟級的評估不必再額外砸大錢標資料。對想把模型訓練成可靠 agent 的團隊來說,能少花一筆標註成本、又拿到細緻的過程回饋,是很實際的好處,也讓打造長流程 agent 的門檻往下降了一截。對沒有大筆預算去買人工標註的小團隊來說,先把訓練裡已經有的訊號榨乾,是比急著加資料更划算的一步。
歸剛點評|做可靠的 agent 卡在獎勵訊號太貴。這篇說訓練過程裡早就有現成材料,撿起來用就能省下大筆標註錢——對小團隊尤其關鍵。
來源:Hugging Face