問 AI『1 到 10 挑個數字』幾乎都回 7?新創想把模型從群體思考裡拉出來
開一個聊天機器人,不管是 Claude、ChatGPT 還是 Gemini,打上『給我一個 1 到 10 的隨機數』,你多半會拿到 7;再要一個,通常是 3 或 4;再要,就變 8 或 9。這個小遊戲揭穿了一件事:多數大模型面對開放式問題時,比你想的更可預測、也更不有創意。MIT Technology Review 把這叫『群體思考』——不只單一模型自己重複,連不同公司的模型都會不約而同收斂到很像的答案。
去年 11 月一篇名為《Artificial Hivemind》的論文把這個現象攤開來測,發現 LLM 在開放式提問下的同質化程度高得驚人。研究者推測原因是,現在的模型大多用相似的資料、相似的方法、去訓練做相似的任務,結果就是大家都往同一個平均值靠。這對需要靠 AI 發想、探索、找不一樣角度的場景,是個實實在在的限制。
澳洲新創 Springboards 端出解方,一款叫 Flint 的模型,專門被訓練成對開放式問題給出比主流模型更多樣的回應。值得玩味的是,它點出一個容易被忽略的品質維度:我們評模型時老在比誰答得更準、更對,卻很少問誰答得更不一樣。對用 AI 做內容、做腦力激盪、做創意發想的人(包括 Max 這種靠 AI 產出大量文章與點子的),這是個提醒——當你發現產出愈來愈千篇一律,問題可能不在你的提示詞,而在模型骨子裡的收斂傾向,適時換模型或刻意加大隨機性會有幫助。
歸剛點評|『AI 產出愈來愈像』不一定是你提示詞的錯,而是模型骨子裡就會往平均值收斂。對靠 AI 大量產內容、發想點子的人是實用提醒:評模型別只比誰更準,也要看誰更不一樣;產出變千篇一律時,換模型或加大隨機性會有效。