歸剛誒AI

歸剛欸,AI 又進步了——每天幫你盯 AI 圈的台灣人日報

← 回首頁 · 回第 23 期(2026-07-02)
研究・2026-07-02

SWE-Interact:把寫程式 benchmark 改成『使用者一路來回下指令』的多輪任務

SWE-Interact:把寫程式 benchmark 改成『使用者一路來回下指令』的多輪任務

現在主流的 coding agent 評測,大多長這樣:一開始就把完整需求全丟給 agent,然後看它能不能自己一路寫完。但真實世界的軟體開發根本不是這樣——需求是邊做邊講清楚的,人會中途改主意、補條件、看到結果再調方向。SWE-Interact 這篇論文就是要補上這個落差,把 coding agent 放進『多輪、互動、使用者驅動』的情境裡評估,讓使用者重新回到開發迴圈當中。

轉變雖然聽來不大,意義卻不小。一個 agent 能不能在拿到完整規格後自主把題目解掉,跟它能不能在一場你來我往、需求逐步浮現的協作裡穩住陣腳,是兩種很不一樣的能力。後者更接近工程師每天用 AI 助手寫程式的真實體感:你先講個大概,看它寫出什麼,再指出哪裡不對、要改哪裡。SWE-Interact 把評測拉到這個更貼近現場的維度,量的是 agent 在模糊、變動、多回合下的實戰力。

對每天用 AI 寫程式的人(包括 Max 這種靠 AI 建站、跑排程、修腳本的),這篇很有共鳴。你會發現真正決定生產力的,不是 agent 一次能不能通關某個乾淨的題目,而是它能不能聽懂你半路改的需求、記住前面講過的脈絡、不要每次都要你重講一遍。評測終於開始測『協作』而不只是『自動完成』,這對挑選順手的 coding 工具,是更貼近日常的參考。

歸剛點評|真實開發是邊做邊講清楚需求,不是一次把規格丟給 AI 讓它自己跑完。SWE-Interact 把評測拉到『多輪協作』這個更貼近日常的維度。對每天靠 AI 寫程式、修腳本的人,選工具該看的是它聽不聽得懂你半路改的需求,而不只是能不能通關乾淨題目。

同期其他文章