論文:替長推理壓縮 KV 快取的資訊感知法
大型語言模型的推理能力進步飛快,隨之而來的副作用是 key-value 快取越長越大。模型在生成時要把先前每個 token 的 key 和 value 都存著好回頭參照,當推理鏈拉得很長,這份快取會在預填與解碼兩個階段同時膨脹,吃掉大量記憶體,成為長推理的成本與速度瓶頸。一篇 HuggingFace 論文提出資訊感知的壓縮法來對付它。關鍵字是「資訊感知」。粗暴的做法是一律砍掉舊的快取,但這會誤傷真正重要的內容;論文的思路是評估每一段快取攜帶多少資訊量,把資訊密度低、可有可無的部分優先壓縮,保留對後續推理真正關鍵的那些。等於不是無差別瘦身,而是挑著減,盡量在省記憶體和不掉品質之間取平衡。當下模型動不動就要長篇思考、跑多步推理,這類技術的需求只會更大。推理越長越聰明,但也越貴越慢,KV 快取就是那條最先繃斷的繩子。能在不犧牲推理品質的前提下把快取壓下來,直接決定一個長推理服務跑不跑得起、划不划得來。對部署端,這是實打實的工程紅利。
歸剛點評|模型越愛長篇思考,KV 快取就越肥,記憶體和速度全被它拖累。這篇的聰明處是挑著砍、不是一刀切,把沒用的快取壓掉、留住關鍵的。想跑長推理又不想燒爆預算的團隊,這就是解方。
來源:Hugging Face