論文:JetSpec 用平行樹草稿突破推測解碼天花板
推測解碼是替自回歸大型語言模型加速的常用手法:先讓一個小模型草擬好幾個 token,再由大模型平行驗證,正確的就一次採納,省下逐字生成的時間。但這套方法有個擴展上的天花板,草稿一拉長、命中率就掉,加速效果到某個點就上不去。一篇 HuggingFace 論文 JetSpec 想處理的正是這個瓶頸。JetSpec 的解法是平行樹草稿。傳統做法多半草擬一條直線序列,賭它整條都對;JetSpec 改成同時鋪開一棵樹,一次涵蓋多種可能的後續路徑,讓驗證階段有更高機率撞上正確答案。等於把單押一注改成分散下注,提高每一輪驗證能採納的 token 數量,藉此把推測解碼的加速上限往上頂。對在意推論成本與延遲的團隊,這類研究很實際。模型再強,使用者體驗最後還是卡在它吐字多快、每個 token 多貴上;任何能在不傷品質的前提下加速生成的方法,都會直接反映在帳單和回應速度上。JetSpec 把推測解碼的天花板再墊高一層,對跑大規模推論服務的人就是真金白銀的省。
歸剛點評|推論加速這種題目聽起來無聊,卻是省錢的硬功夫。模型多強,使用者只感覺得到它回多快、多貴。JetSpec 把推測解碼的上限再頂高,跑大規模服務的團隊看到的是帳單變小、延遲變短,很實在。
來源:Hugging Face