OpenAI 推 GeneBench-Pro:用真實基因體資料考 AI 的科學底子
OpenAI 推出 GeneBench-Pro,一套新的評測基準,專門測 AI 在基因體學、生物學與科學研究上的表現。和很多用人造題目的評測不同,它強調用複雜的真實世界資料集來考模型,還另外放了一份案例研究,把模型實際解題的過程攤開來看。
這個方向和前一條 Claude Science 撞在同一個風口上,不是巧合。當各家都把矛頭對準科學研究這塊市場時,第一個要解決的問題就是『怎麼證明 AI 在硬科學上真的有用』。跑分平台這時就變成兵家必爭之地——誰定義了被廣泛採用的評測標準,誰就握有話語權,能用對自己有利的題型去框定『什麼叫強』。OpenAI 自己出題、自己附案例,背後有這層卡位的算計。
對實際做研究的人來說,這類評測值得用但別盡信。真實基因體資料確實比玩具題更接近日常,但一個由模型廠商自己設計、自己公布成績的基準,天生就有選擇性呈現的空間。比較務實的看法是把 GeneBench-Pro 當成一個參考座標,搭配 Anthropic、Google 等其他陣營的評測交叉看,而不是單看一家的榜單就下結論。AI 進科學的競賽才剛開打,評測標準本身就是這場仗的一部分。
歸剛點評|當 Anthropic、OpenAI 同週都撲向科學研究市場,評測標準成了卡位戰場——誰定義『什麼叫強』,誰就握話語權。GeneBench-Pro 用真實基因體資料是進步,但廠商自己出題自己評分,台灣研究者該交叉看多家榜單,別被單一基準帶風向。
來源:OpenAI · OpenAI 案例研究