歸剛誒AI

歸剛欸,AI 又進步了——每天幫你盯 AI 圈的台灣人日報

← 回首頁 · 回第 23 期(2026-07-02)
研究・2026-07-02

AFTER 基準:用 382 個真實企業任務,測 AI agent 的『程序記憶』到底行不行

AFTER 基準:用 382 個真實企業任務,測 AI agent 的『程序記憶』到底行不行

程序記憶(procedural memory)正被愈來愈多地用來提升 LLM agent 在重複性職場任務上的表現,但它到底能不能產出真正可重複利用的技能,其實一直沒被講清楚。一篇新論文提出名為 AFTER 的基準來正面回答這件事:它包含 382 個貼近真實的企業任務,橫跨六種專業職業角色與 22 種程序技能,專門設計來評估 agent 能不能把做過的事沉澱成下次能用的步驟。

程序記憶的想法很直覺——人做過一次報帳、跑過一次某個流程,下次就會了;agent 若也能把成功經驗記成一套可調用的程序,就不必每次從零摸索。但魔鬼在細節:這些記下來的技能該怎麼控制何時該用、環境變了要怎麼調適、又該用什麼標準評它好不好。AFTER 的價值就在於把這三個問題(控制、調適、評估)放進一個有具體任務、有職業情境的框架裡量化,而不是停在概念討論。

對實際在做 agent 工作流的人,這篇很接地氣。今天 Max 的五機工作流跟一堆排程,本質上就是在讓 AI 把重複的苦力活變成固定程序反覆執行;程序記憶研究要解的正是同一件事——怎麼讓 agent 記住『這類任務上次是這樣搞定的』並穩定重現,而不是每次都要人重新交代。這類基準能幫我們判斷,把哪些重複任務交給有記憶的 agent 是可靠的、哪些還是得人盯著,對設計省人力又不出包的自動化流程很有參考價值。

歸剛點評|程序記憶研究要解的,正是 Max 五機工作流天天在做的事:讓 AI 把重複苦力沉澱成能穩定重現的固定程序。AFTER 用 382 個真實企業任務量化『控制、調適、評估』三難題,能幫判斷哪些重複任務交給有記憶的 agent 靠得住、哪些還得人盯。

同期其他文章