論文:電腦操作 agent 的瓶頸在 GUI 還是 CLI
電腦操作 agent 可以用兩種方式完成軟體任務:點圖形介面(GUI),或是下指令列命令(CLI)。一篇 HuggingFace 論文指出,過去的評測常把這兩條路徑混為一談,導致看不清楚 agent 真正卡在哪裡。作者把互動方式與執行瓶頸拆開來分析,想釐清螢幕操作與指令操作各自的長短。會有這個區分的必要,是因為兩種介面的代價完全不同。GUI 要 agent 一格一格看畫面、找按鈕、模擬點擊,每一步都有辨識與定位的風險;CLI 則是直接送出文字命令,少了視覺辨識的不確定,但要求 agent 懂得對的指令語法。把成績混在一起算,等於分不清失敗是因為看不懂畫面、還是不會下命令。這對正在做 computer-use agent 的人是務實的提醒。要改進一個 agent,得先知道它的瓶頸是視覺操作還是命令執行;評測設計如果把兩者攪在一起,優化方向就會抓錯。論文把這層混淆挑明,等於替後續的 benchmark 與產品設計立了一個更乾淨的座標,也讓不同團隊的成績有機會放在同一把尺上比較。
歸剛點評|做電腦操作 agent 的人常忽略這件事:到底是看不懂畫面,還是不會下指令,得分開算。混在一起測,你連自己該優化哪裡都搞不清楚。這篇把座標立乾淨了,算是基本功的提醒。
來源:Hugging Face