歸剛誒AI

歸剛欸,AI 又進步了——每天幫你盯 AI 圈的台灣人日報

第 23 期2026-07-02(台北時間)

七月第二天,AI 的兩條主線同時拉滿。一條是大廠把戰場推進垂直科學——Anthropic 正式推出串接 60 多個資料庫的 Claude Science,直接把大模型搬進藥廠實驗室,Google 與 OpenAI 在同一賽道緊追。另一條是『規則與閘門』的角力全面浮上檯面:美方鬆綁出口管制讓 Fable 5 全球回歸、Anthropic 聯手三巨頭提越獄評分框架,Cloudflare 則畫下 9/15 大限逼 AI 為爬取內容付費。與此同時,Meta 想賣過剩算力、SpaceX 傳做 AI 手機、Venice AI 靠隱私路線成獨角獸,資金正從『拚模型』往『拚算力與能源』下沉。學界這頭,agent 的程序記憶、技能演化與多輪協作成了共同關鍵字。就在這一天,網際網路之父 Vint Cerf 退休——開放網路的世代交棒給一個到處重新豎閘門的 AI 時代。

產品

Anthropic 正式推出 Claude Science:把大模型搬進藥廠實驗室,鎖定新藥研發

Anthropic 正式推出 Claude Science:把大模型搬進藥廠實驗室,鎖定新藥研發

Anthropic 在 7 月 1 日正式把 Claude Science 推上檯面,這是一套專為科學研究打造的 AI 工作台,把公司的大模型調校到能在實驗室、尤其是藥廠的研發流程裡直接用。過去研究員要在幾十個資料庫、各種檔案格式與分析工具之間來回切換,Claude Science 想把這些全部收進同一個環境,讓人從查文獻、跑分析到寫報告都在一個地方完成。官方數字是串接超過 60 個科學資料庫,並預載基因體學、蛋白質結構分析與化學三大領域的工具箱。

為了把生態圈養起來,Anthropic 在 beta 階段開了補助計畫,提供最高 3 萬美元的使用額度與專案經費,早期重點壓在生物與生醫研究。申請窗口開到 7 月 15 日,7 月 31 日發通知,入選專案從 9 月 1 日跑到 12 月 1 日。這套打法很清楚,先用免費額度把頂尖實驗室綁進來,讓他們的研發工作流長在 Claude 上,之後就很難換掉。

這步棋的時間點也不是巧合。Anthropic 傳出正在準備 IPO,把觸角伸進毛利高、預算深的製藥產業,等於在企業營收之外多開一條科學研發的財源。同一個賽道上,Google 與 OpenAI 都在搶,OpenAI 四月才推過鎖定生物推理的 GPT-Rosalind。對台灣的生技與學研圈來說,這代表未來跟你搶計畫的同行,手上可能多了一台能同時讀六十個資料庫的 AI 助手,門檻抬高的速度會比想像中快。

歸剛點評|AI 大廠的戰線正式從『通用聊天』打進『垂直科學研發』。Anthropic 用免費額度綁住頂尖實驗室的工作流,是為 IPO 鋪高毛利營收;對台灣生技學研圈,這是同行武器升級的訊號,該開始想怎麼把這類工具接進自己的研究管線。
政策

美方鬆綁出口管制,Anthropic 讓 Fable 5 全球回歸,並提議跨廠越獄評分框架

美國商務部撤下對 Anthropic Fable 5 與 Mythos 5 的出口管制,Fable 5 於 7 月 1 日在 Claude 全平台全球恢復。Anthropic 同時聯手 Amazon、微軟、Google 提出替越獄危害打分的產業框架。

美方鬆綁出口管制,Anthropic 讓 Fable 5 全球回歸,並提議跨廠越獄評分框架

6 月 12 日那道命令,要求 Anthropic 對任何外國籍使用者切斷 Fable 5 與更受控的 Mythos 5,範圍連公司自己的非美籍員工都算在內。因為沒辦法即時查證每個人的國籍,Anthropic 乾脆對所有人關掉這兩個模型,等於整整停擺了兩週多。導火線是 Amazon 研究員在 Fable 5 上找到一個越獄手法,能讓模型指出幾個軟體漏洞,其中一次還寫出示範如何利用漏洞的程式碼。

6 月 30 日,商務部撤下管制,Fable 5 在 7 月 1 日於 Claude.ai、Claude Platform、Claude Code 與 Claude Cowork 全球恢復。能解禁,靠的是 Anthropic 訓了一個新的安全分類器,專門盯住報告裡那個攻擊技術,官方說攔截率超過 99%。Mythos 5 因為護欄較少,被綁得更緊,6 月 26 日先開放給約一百家防衛關鍵基礎設施的美國企業與聯邦機構。

更值得看的是後續制度化的動作。Anthropic 找上 Amazon、微軟、Google,提議用一套共同標準替未來的越獄事件打分,從能力增益、影響廣度、武器化難易與可發現性四個維度評級。值得注意的是,模型能不能上線,越來越取決於它在資安攻擊面的表現與政府監管的角力,而不只是跑分高低。對台灣用戶來說,短期最實際的影響是 Fable 5 又能用了;長期則要習慣,前沿模型的可用性會被地緣政治與安全審查反覆牽動。

歸剛點評|這件事把一個殘酷現實攤開:前沿模型的生死不在技術,而在監管紅線。Anthropic 從被迫全球斷線到主動提出評分框架,是想把規則制定權握在自己手上。台灣團隊選 API 時要把『政策風險』也列入評估,別把某個模型的可用性當理所當然。
來源:Anthropic · The Verge · Ars Technica · The Hacker News
產業

Cloudflare 出招逼 AI 付費:9/15 起,混用型爬蟲預設被擋在有廣告的頁面外

Cloudflare 給 AI 公司到 9 月 15 日的期限,把搜尋用爬蟲跟訓練/agent 用爬蟲分開,否則在許多刊物網站上被預設封鎖。Pay Per Crawl 進化成 Pay Per Use,讓內容方按價值收費。

Cloudflare 出招逼 AI 付費:9/15 起,混用型爬蟲預設被擋在有廣告的頁面外

Cloudflare 丟出一條會改寫網路內容經濟的政策。從 9 月 15 日起,平台預設會擋住那些把搜尋、agent、訓練混在一起的『混用型』爬蟲,讓它們進不了有廣告的頁面,除非站主自己改設定。這套新預設會套用在新客戶、既有客戶新開的網站,以及所有免費方案的既有客戶身上。傳統的搜尋爬蟲照樣放行,被針對的是那種一邊假裝來做搜尋、一邊把內容抓去餵模型的行為。

配套的收費機制也升級了。原本的 Pay Per Crawl 演進成 Pay Per Use,收費邏輯從『你抓了幾次』改成『你的內容替 AI 創造了多少價值』。對每一隻 AI 爬蟲,發行商可以三選一:免費放行、按次收費、或直接封鎖,Cloudflare 自己當收款方(Merchant of Record)並提供底層技術。這給了刊物一個過去沒有的籌碼,把流量被白嫖的困境變成一張可以談判的牌。

Cloudflare 的算盤是逼 AI 公司把搜尋跟訓練、agent 用途切乾淨,否則就付錢。這件事牽動的是整個內容供給鏈的權力平衡——過去 AI 公司免費爬走全網,如今守門的 CDN 站出來收過路費。對經營內容網站的人,包括 Max 手上那幾個 AI 日報與資料站,這是一個要開始盤點『我要不要收 AI 爬蟲的錢、還是繼續開放換曝光』的現實問題,9 月 15 日是個該記下來的日子。

歸剛點評|守在全網流量咽喉的 CDN 終於對 AI 白嫖出手,內容方第一次握有『收過路費』的實權。這會直接改變 AI 公司的訓練資料成本結構,也逼每個內容網站主做選擇。經營內容站的人現在就該想清楚 9/15 之後的立場。
來源:TechCrunch · Cloudflare Blog
模型

Gemma 4 上 Cerebras 衝到每秒 1800 token,讓即時語音 AI 真的能用

Hugging Face 與 Cerebras 把 Google DeepMind 的 Gemma 4 帶進即時語音場景。Gemma 4 31B 在 Cerebras 上跑超過每秒 1800 token、首字延遲 1.5 秒,多模態含音訊,Apache 2 授權。

Gemma 4 上 Cerebras 衝到每秒 1800 token,讓即時語音 AI 真的能用

Google DeepMind 的開源多模態模型 Gemma 4 這次跟 Cerebras 合作,把速度推到能做即時語音的等級。Gemma 4 是一整個家族,有 E2B、E4B、31B 與 26B-A4B(MoE)等尺寸,走 Apache 2 授權可商用,音訊能力落在 E2B、E4B 與 12B 上,能做語音辨識、講者分離、影片理解與 agent 推理。開源加上多模態,本來就是想讓開發者把語音助理這類應用自己長出來。

真正的關鍵是速度。Gemma 4 31B 跑在 Cerebras Inference 上超過每秒 1800 token,官方稱是全世界最快的多模態模型;更重要的是首個回應 token 只要 1.5 秒就吐出來。語音互動最怕延遲,人一開口、等超過一兩秒才回話就崩了,Cerebras 說自己是唯一能讓 Gemma 4 用在即時場景的供應商,賣的正是這個『夠快到不尷尬』的體感。6 月 29 日起,Gemma 4 31B 已在 Cerebras Inference Cloud 公開預覽。

把開源多模態模型跟專用推理硬體綁在一起,等於給想做即時語音 AI 的團隊一條不必自己養旗艦閉源模型的路。對台灣的應用開發者,這意味著做客服語音、即時口譯、語音 agent 的技術門檻正在下降,Apache 2 授權也讓商用少了法務顧慮。真正要盤算的是成本與延遲的甜蜜點落在哪裡,以及本機小模型(例如 Mac 上的 Ollama)跟這種高速雲端推理該怎麼分工。

歸剛點評|即時語音 AI 卡了很久的『延遲』問題被硬體端解掉了一大半。開源多模態+每秒 1800 token 的組合,把語音助理、即時口譯這類應用的門檻拉低。想做語音產品的台灣團隊,現在有了不必自建旗艦模型的可行路徑。
來源:Hugging Face · Cerebras · Hugging Face Blog
資金

隱私優先的 Venice AI 成獨角獸:6500 萬美元 A 輪、估值 10 億,年化營收破 7000 萬

主打不記錄對話的 Venice AI 完成 6500 萬美元 A 輪、估值 10 億美元,這是它首次對外募資。公司已獲利,年化營收超過 7000 萬美元,逾 300 萬用戶、每月處理 1.3 兆 token。

隱私優先的 Venice AI 成獨角獸:6500 萬美元 A 輪、估值 10 億,年化營收破 7000 萬

由加密老將 Erik Voorhees 創立的 Venice AI 完成 6500 萬美元 A 輪,估值一舉站上 10 億美元、正式成為獨角獸,而這竟是它第一次對外募資。更少見的是,公司在拿錢之前就已經賺錢——年化營收超過 7000 萬美元,早在 2026 年第一季就轉為獲利。這輪由專注加密的創投 Dragonfly 領投,Coinbase Ventures、North Island Ventures 等跟進。

Venice 的賣點是隱私。它宣稱不記錄、不儲存使用者的提問與回應,對話留在使用者自己的裝置上,同時把競品內建的許多內容過濾拿掉,給的是一個更少審查、更保護隱私的環境。這套定位替它圈出一群特定用戶:平台已有超過 300 萬活躍使用者,每月處理 1.3 兆 token、每天超過 170 萬次 API 呼叫。有趣的是,雖然創辦人出身加密圈,真正用加密貨幣付款的用戶只佔約 8%。

Venice 這個案子值得看,因為它證明了『隱私優先』在生成式 AI 裡撐得起一門生意,能養出獨角獸的商業模式。當主流工具愈來愈往企業合規、內容審查靠攏,市場另一端就冒出對『我的對話不要被存下來』有強烈需求的一群人。對台灣的產品人,這是一個提醒:差異化不一定要拚模型多強,把某個被主流忽略的價值(隱私、無審查、資料自主)做到極致,一樣能長成生意。

歸剛點評|『隱私優先』被證明是能賺錢、還能養成獨角獸的路線,而不是空口號。募資前就獲利、年化營收 7000 萬,含金量很高。給台灣產品人的啟示是:差異化未必要拚模型強度,把主流忽略的價值做到極致同樣能成事。
來源:TechCrunch · GeekWire
產業

Meta 也想把過剩 AI 算力變現,傳籌建雲端業務叫板 AWS、Google Cloud

據報 Meta 正籌建雲端業務,把過剩的 AI 運算能力賣給外部客戶。內部代號 Meta Compute,考慮兩條路:直接賣裸算力,或讓開發者存取託管在 Meta 基礎設施上的 AI 模型。消息傳出股價一度漲 9%。

Meta 也想把過剩 AI 算力變現,傳籌建雲端業務叫板 AWS、Google Cloud

據 Bloomberg 報導,Meta 正在籌建一門雲端生意,把手上過剩的 AI 運算能力賣給外部客戶。這件事被歸在內部代號 Meta Compute 的計畫底下,由基礎設施主管 Santosh Janardhan、Meta 超智能實驗室的 Daniel Gross 與總裁 Dina Powell McCormick 帶頭,目前還在發展中。消息一出,Meta 股價一度漲了約 9%,市場顯然買單。

檯面上有兩條路線在討論。一是像 CoreWeave 那種 neocloud 公司,直接賣裸運算能力;二是讓開發者存取託管在 Meta 基礎設施上的 AI 模型,模式類似 Amazon 的 Bedrock,由 Meta 顧資料中心、按存取量收費。祖克柏在五月的股東會上就說過,進軍雲端運算『絕對在考慮之列』,還提到幾乎每週都有公司來敲門,想買 Meta 的模型存取權或多餘算力。

轉向的背後,是整個產業對 AI 過度投資的焦慮。各家砸下天文數字蓋資料中心、囤晶片,接下來就得想辦法讓這些昂貴資產有回報。Meta 跟前一天傳出類似打算的 SpaceX 一樣,都在把『自用剩下的算力』變成現金流。對台灣看雲端與 AI 基礎設施的人,這代表算力供給端的玩家愈來愈多、競爭會更激烈,中小團隊未來租 GPU 的選擇與議價空間可能因此變大,值得持續盯著價格走勢。

歸剛點評|當蓋資料中心的錢多到還不完,巨頭就開始把自用剩下的算力拿出來賣。Meta 下場等於雲端市場又多一個重量級供給者,長期對租 GPU 的中小團隊是利多——選擇變多、議價空間變大。這是 AI 投資週期進入『要回本』階段的明確訊號。
來源:TechCrunch · CNBC
產品

Google 的 agent 助理 Gemini Spark 登陸 Mac,能整理 Downloads、操作 Workspace

Google 把 24/7 的 agent 助理 Gemini Spark 帶到 Mac(beta),限美國 Google AI Ultra 訂戶。能把 Downloads 裡的 PDF 分類歸檔、操作 Workspace、用本機檔案建試算表,並整合 Canva、Dropbox、Zillow 等第三方 app。

Google 的 agent 助理 Gemini Spark 登陸 Mac,能整理 Downloads、操作 Workspace

Google 把它的 agent 助理 Gemini Spark 搬上了 Mac,這一版加進既有的 Gemini 桌面 app,目前是 beta,只開放給美國的 Google AI Ultra 訂戶。跟一般聊天助理不同,Spark 主打的是真的動手做事:在 Mac 上你可以叫它把 Downloads 資料夾裡的 PDF 依規則分門別類歸檔,也能操作 Workspace app、用你電腦裡的檔案生成試算表,並即時追蹤你關心的主題。

這次也擴大了第三方整合,接上 Canva、Dropbox、Instacart、OpenTable 與 Zillow Rentals 等服務,等於把 agent 的手伸進更多日常應用。Google 還預告『很快』能在手機上指派多步驟任務給 Spark,例如用手機遠端叫桌面 agent 去 Mac 上撈某個檔案的資料;至於在 I/O 2026 展示過的 macOS 語音互動,這次還沒一起到。

把 agent 從『回答問題』推進到『替你操作電腦與跨 app 辦事』,是今年各家 AI 的主戰場,而 Gemini Spark 能整理 Downloads、跨 app 執行任務這件事,也讓信任與安全的份量跟著加重——你等於把檔案系統與帳號權限交給一個會自己動手的助理。對 Max 這種在 Mac mini 上重度用 AI 跑工作流的人,這類桌面 agent 值得實測:它能接手的瑣事(分類檔案、整理下載、生報表),正好是每天吃掉時間、又不需要高階判斷的苦力活。

歸剛點評|桌面 agent 正從『會聊天』走向『會替你操作電腦』,這正是 Max 工作流裡想外包的那類確定性苦力(整理下載、分類檔案、生報表)。值得實測能接手多少;同時也提醒,把檔案與帳號權限交給會自己動手的 agent,安全邊界要先想清楚。
來源:TechCrunch · Engadget
硬體

SpaceX 傳有 AI 裝置原型,外形『很像手機』,疑為進軍無線通訊鋪路

據報 SpaceX 在上市前向投資人展示一款『類似手機』的 AI 裝置原型。搭配它把過剩算力變現的動作,被解讀為想把觸角伸進無線通訊市場的又一個訊號。

SpaceX 傳有 AI 裝置原型,外形『很像手機』,疑為進軍無線通訊鋪路

據報導,SpaceX 在準備上市之前,向投資人秀出一款外形『很像手機』的 AI 裝置原型。細節目前不多,但這個動作被外界讀成一個訊號:SpaceX 想把版圖從火箭與衛星,往消費端的無線通訊市場延伸。它旗下的 Starlink 已經在做衛星直連手機的服務,一台自家的手機形 AI 裝置,剛好能把『衛星網路+終端裝置』串成一條龍。

把這件事跟同期另一則消息擺在一起看更有意思——SpaceX 也被傳在盤算把過剩的運算能力拿出來變現,跟 Meta 的雲端算盤如出一轍。一邊是賣算力、一邊是做終端硬體,都指向同一件事:這家公司想從單純的太空基礎設施,長成一個橫跨網路、算力與消費裝置的綜合體。當然,原型不等於產品,投資人簡報上的東西最後量不量產、長什麼樣,都還有很大變數。

對台灣的硬體與供應鏈圈,這類消息的價值不在『SpaceX 要出手機了』這種標題,而在它透露的方向:衛星直連、AI 終端、算力服務正在被同一批玩家整合。真要落地,背後的通訊晶片、天線、電源與代工需求,很可能又會繞回台灣供應鏈。現階段當成一個值得追蹤的早期訊號就好,別急著下結論。

歸剛點評|火箭公司想做手機,背後是『衛星網路+AI 終端+算力服務』被同一批玩家整合的大方向。真要量產,通訊晶片、天線、代工需求多半會繞回台灣供應鏈。原型不等於產品,現在當早期訊號追蹤,別被標題帶著跑。
來源:TechCrunch
資金

自駕新星 Wayve 開 8500 萬美元員工老股收購,估值站上 85 億

自駕公司 Wayve 推出 8500 萬美元的員工股權出售(tender offer),估值達 85 億美元。用員工老股收購當留才與攬才工具,正成為 AI 新創的一股趨勢。

自駕新星 Wayve 開 8500 萬美元員工老股收購,估值站上 85 億

英國自駕新創 Wayve 開出一輪 8500 萬美元的員工老股收購(employee tender offer),讓員工有機會把手上持股變現,公司估值也在這一輪站上 85 億美元。這不是傳統的對外融資去燒錢,而是給早期員工一個落袋的出口。對一家還沒上市、股票變不了現的高成長公司來說,這是很實在的一種安撫人心。

用員工老股收購當工具,正在 AI 新創圈變成一股趨勢。這幾年頂尖 AI 人才被各家搶到見骨,光靠紙上財富很難把人留住——工程師看得到估值飆高,卻拿不到現金。一輪 tender offer 讓員工能賣掉部分持股、把帳面數字換成真金白銀,等於在不逼公司上市的前提下,同時達成留才與攬才兩個目的。對想挖角的競爭對手,這也是一道防線。

這個現象值得台灣的新創與投資圈注意。它反映的是 AI 人才市場已經熱到,公司得主動設計『中途變現』機制才留得住人,而不是叫大家苦等 IPO。台灣新創過去在員工股權的流動性上普遍偏弱,隨著 AI 帶動的人才競爭外溢,怎麼設計出既留才又不失血的股權方案,會愈來愈是個現實課題。Wayve 這一步,可以當成一個具體範本來研究。

歸剛點評|AI 人才貴到公司得主動造『中途變現』出口才留得住人,苦等 IPO 已經不夠看。這是 AI 人才市場過熱的溫度計。台灣新創在員工股權流動性上一向偏弱,這道題遲早要面對,Wayve 提供了可研究的範本。
來源:TechCrunch
資金

Ashton Kutcher 離開 Sound Ventures,攜 Morgan Beller 另創新基金押 AI 底層

演員兼投資人 Ashton Kutcher 離開一手打造的 Sound Ventures,與 Morgan Beller 合創新創投。Sound 過去以重壓頂尖 AI 實驗室聞名,新基金看來要押的是這些公司底下的基礎設施與能源層。

Ashton Kutcher 離開 Sound Ventures,攜 Morgan Beller 另創新基金押 AI 底層

演員出身的投資人 Ashton Kutcher 要離開他一手打造的 Sound Ventures,和 Morgan Beller 合開一支新的創投基金。Sound Ventures 這些年靠的是集中、高信念的打法,重壓少數幾家領頭的 AI 實驗室而打出名號。Kutcher 這次跳出來另起爐灶,路線看起來換了一層:新基金要追的不是那些站在檯面上的模型公司,而是它們底下那一層——支撐這一切運轉的基礎設施與能源。

往下游走本身就是一個判斷。當第一波資金都湧向做模型、做應用的明星公司,估值被推到很高,聰明錢開始往產業鏈更下游走,去找那些賣鏟子的人:算力、資料中心、電力供應。AI 這幾年的瓶頸愈來愈不是演算法,而是電夠不夠、機房蓋不蓋得出來。押基礎設施與能源,賭的就是不管哪家模型公司最後勝出,這些底層需求都少不了。

對看創投趨勢的人,這是一條清楚的訊號:AI 投資的焦點正在從『誰的模型最強』往『誰供得起算力與電力』移動。Morgan Beller 過去在區塊鏈與新型金融基礎設施上的經歷,也讓這支新基金的視角多了一層。對台灣的投資與產業圈,值得順著這條線去想——在這波往基礎設施下沉的資金裡,台灣在半導體、散熱、電源與代工的既有優勢,能不能接得住這股需求。

歸剛點評|聰明錢開始從『模型明星公司』往下游的算力、資料中心、電力移動,賭的是不管誰勝出、底層需求都少不了。這條『賣鏟子』的投資線,正好對上台灣在半導體、散熱、電源的既有優勢,值得產業圈順著想接單機會。
來源:TechCrunch
研究

問 AI『1 到 10 挑個數字』幾乎都回 7?新創想把模型從群體思考裡拉出來

多數大模型面對開放式問題會收斂到高度雷同的答案,問『1 到 10 選一個數』幾乎都回 7。澳洲新創 Springboards 用一款叫 Flint 的模型訓練出更多樣的回應,試圖解決『AI 群體思考』的老問題。

問 AI『1 到 10 挑個數字』幾乎都回 7?新創想把模型從群體思考裡拉出來

開一個聊天機器人,不管是 Claude、ChatGPT 還是 Gemini,打上『給我一個 1 到 10 的隨機數』,你多半會拿到 7;再要一個,通常是 3 或 4;再要,就變 8 或 9。這個小遊戲揭穿了一件事:多數大模型面對開放式問題時,比你想的更可預測、也更不有創意。MIT Technology Review 把這叫『群體思考』——不只單一模型自己重複,連不同公司的模型都會不約而同收斂到很像的答案。

去年 11 月一篇名為《Artificial Hivemind》的論文把這個現象攤開來測,發現 LLM 在開放式提問下的同質化程度高得驚人。研究者推測原因是,現在的模型大多用相似的資料、相似的方法、去訓練做相似的任務,結果就是大家都往同一個平均值靠。這對需要靠 AI 發想、探索、找不一樣角度的場景,是個實實在在的限制。

澳洲新創 Springboards 端出解方,一款叫 Flint 的模型,專門被訓練成對開放式問題給出比主流模型更多樣的回應。值得玩味的是,它點出一個容易被忽略的品質維度:我們評模型時老在比誰答得更準、更對,卻很少問誰答得更不一樣。對用 AI 做內容、做腦力激盪、做創意發想的人(包括 Max 這種靠 AI 產出大量文章與點子的),這是個提醒——當你發現產出愈來愈千篇一律,問題可能不在你的提示詞,而在模型骨子裡的收斂傾向,適時換模型或刻意加大隨機性會有幫助。

歸剛點評|『AI 產出愈來愈像』不一定是你提示詞的錯,而是模型骨子裡就會往平均值收斂。對靠 AI 大量產內容、發想點子的人是實用提醒:評模型別只比誰更準,也要看誰更不一樣;產出變千篇一律時,換模型或加大隨機性會有效。
人物

『網際網路之父』Vint Cerf 退休,卸下 Google 首席網路傳道者

共同設計網際網路底層協定的 Vint Cerf,將於下週卸下 Google 首席網路傳道者一職、正式退休。他與 Bob Kahn 共同發明的 TCP/IP,是今天整個網路運轉的基礎。

『網際網路之父』Vint Cerf 退休,卸下 Google 首席網路傳道者

被稱為『網際網路之父』之一的 Vint Cerf,將在下週卸下 Google 首席網路傳道者(chief internet evangelist)的職務、正式退休。他和 Bob Kahn 共同設計的 TCP/IP 協定,是今天全世界網路能互通的底層地基——你現在讀這則新聞、每一個封包能從一台機器送到另一台,靠的就是他們半世紀前打下的規則。

Cerf 在 Google 掛著『傳道者』這個少見的頭銜多年,四處為開放網路、數位近用與網路治理發聲。他的退休象徵著網路草創世代的一次交棒——那批親手把網路從實驗室協定變成全球基礎設施的人,正逐漸退到幕後。而接棒的時代,主旋律已經換成 AI:從搜尋、瀏覽器到 agent,網路的樣貌正被生成式 AI 重新改寫。

把 Cerf 退休放在今天這一整版 AI 新聞裡看,格外有味道。當年他們設計協定時信奉的是開放、互通、去中心,讓任何人都能接上網路;如今 AI 時代卻在為『內容要不要付費才給爬』(見今天的 Cloudflare 政策)、『模型能不能出口』(見 Fable 5 事件)這類問題爭執不休。老一輩打造的是一個盡量沒有守門人的網路,新一輩正在重新豎起各種閘門。這一頁交接,值得記上一筆。

歸剛點評|打造開放網路的世代正在交棒,接手的是一個到處重新豎閘門的 AI 時代——內容要付費才給爬、模型要審查才能出口。把 Cerf 退休跟今天的 Cloudflare、Fable 5 新聞並讀,正好照見網路精神的世代轉折,值得記一筆。
來源:TechCrunch
產品

Google 做出好硬體,但 Gemini 還撐不起這台智慧音箱

The Verge 評測 Google 新智慧音箱:硬體做得不錯,但搭載的 Gemini 還沒準備好。智慧音箱多年來苦尋『音樂、計時、控燈之外』的第二幕,AI 本被寄望改寫,實測卻仍差一截。

Google 做出好硬體,但 Gemini 還撐不起這台智慧音箱

The Verge 對 Google 新款智慧音箱的結論很直白:硬體做得漂亮,但塞進去的 Gemini 還沒到能撐起這台機器的程度。智慧音箱這幾年一直在找自己的第二幕——除了放音樂、設計時器、開關燈之外,它到底還能幹嘛,始終沒有好答案。AI 本來被寄予厚望要改寫這件事,Amazon 去年秋天就先用翻新的 Alexa 推了新硬體。

問題出在期待與現實的落差。把一個強大的語言模型接進音箱,理論上該讓它從『只會執行固定指令』升級成『能真正對話、幫你辦事』;但實測下來,Gemini 在這台音箱上的表現還不夠穩、不夠聰明到讓人覺得非它不可。硬體的手感、音質、設計都在水準之上,軟體的大腦卻拖了後腿,這種『身體準備好了、腦子還沒跟上』的錯位,正是目前 AI 硬體最常見的通病。

這則評測的提醒對做 AI 硬體的人特別實在:把大模型塞進裝置不等於體驗就會變好,語音場景對延遲、準確與情境理解的要求極高,稍微卡一下、答錯一次,使用者的信任就掉了。對照今天 Gemma 4 靠 Cerebras 把即時語音延遲壓到 1.5 秒的消息,答案其實呼之欲出——AI 音箱要成,缺的往往不是模型會不會講話,而是它能不能快、能不能準、能不能真的懂你當下要什麼。硬體不是瓶頸,體驗的最後一哩才是。

歸剛點評|把大模型塞進裝置不等於體驗變好——AI 硬體最常見的病就是『身體準備好、腦子沒跟上』。對照今天 Gemma 4 把語音延遲壓到 1.5 秒,答案很清楚:音箱要成,缺的不是會不會講話,是夠不夠快、準、懂你。做 AI 硬體的人該記住這一哩。
來源:The Verge
研究

AFTER 基準:用 382 個真實企業任務,測 AI agent 的『程序記憶』到底行不行

一篇論文提出 AFTER 基準,用 382 個貼近真實的企業任務、涵蓋六種職業角色與 22 種程序技能,檢驗 LLM agent 的程序記憶能否產出可重複利用的技能,並探討如何控制、調適與評估這種記憶。

AFTER 基準:用 382 個真實企業任務,測 AI agent 的『程序記憶』到底行不行

程序記憶(procedural memory)正被愈來愈多地用來提升 LLM agent 在重複性職場任務上的表現,但它到底能不能產出真正可重複利用的技能,其實一直沒被講清楚。一篇新論文提出名為 AFTER 的基準來正面回答這件事:它包含 382 個貼近真實的企業任務,橫跨六種專業職業角色與 22 種程序技能,專門設計來評估 agent 能不能把做過的事沉澱成下次能用的步驟。

程序記憶的想法很直覺——人做過一次報帳、跑過一次某個流程,下次就會了;agent 若也能把成功經驗記成一套可調用的程序,就不必每次從零摸索。但魔鬼在細節:這些記下來的技能該怎麼控制何時該用、環境變了要怎麼調適、又該用什麼標準評它好不好。AFTER 的價值就在於把這三個問題(控制、調適、評估)放進一個有具體任務、有職業情境的框架裡量化,而不是停在概念討論。

對實際在做 agent 工作流的人,這篇很接地氣。今天 Max 的五機工作流跟一堆排程,本質上就是在讓 AI 把重複的苦力活變成固定程序反覆執行;程序記憶研究要解的正是同一件事——怎麼讓 agent 記住『這類任務上次是這樣搞定的』並穩定重現,而不是每次都要人重新交代。這類基準能幫我們判斷,把哪些重複任務交給有記憶的 agent 是可靠的、哪些還是得人盯著,對設計省人力又不出包的自動化流程很有參考價值。

歸剛點評|程序記憶研究要解的,正是 Max 五機工作流天天在做的事:讓 AI 把重複苦力沉澱成能穩定重現的固定程序。AFTER 用 382 個真實企業任務量化『控制、調適、評估』三難題,能幫判斷哪些重複任務交給有記憶的 agent 靠得住、哪些還得人盯。
研究

SkillHone:讓 agent 靠『保留決策歷史』持續進化技能,而不是每次砍掉重練

論文提出 SkillHone 框架,針對 agent 技能所面對的任務與環境會不斷變化的問題。現有方法只在有限回合內改進技能、且只留下最終成品,丟掉了後來的 agent 其實需要的決策歷史。SkillHone 想把這段歷史持久保留下來。

SkillHone:讓 agent 靠『保留決策歷史』持續進化技能,而不是每次砍掉重練

Agent 技能(agent skills)是替語言模型 agent 加上特定任務的程序、腳本與參考資料,讓它更會做某類事。但這些技能要對付的任務和環境會一直變,昨天管用的做法今天可能就不適用。問題是,現有的方法多半只在有限的執行回合裡改進技能,而且只保留最後那個成品,把過程中累積的決策歷史全丟了——偏偏那段歷史,正是之後接手的 agent 最需要的線索。

SkillHone 這篇論文要補的就是這個洞。它主張把 agent 做決策的歷史持久地保存下來,讓技能能靠著這份不斷累積的『為什麼當時這樣選』的紀錄持續演化,而不是每換一批任務就從頭再來。這等於把 agent 的成長從『一次性優化』改成『可累積、可承接』的長期過程,讓後來的 agent 站在前人踩過的坑上前進。

這個思路跟 Max 手上『歸剛誒AI』這類每天跑的排程其實很呼應。每一期日報、每一次抓取與部署,背後都有一堆『這次為什麼這樣選題、這樣改流程』的判斷,如果每天做完就丟、只留最終成品,累積的經驗就浪費了。SkillHone 提醒的是,把決策歷史留下來當養分,AI 系統才會愈跑愈聰明,而不是原地打轉。對設計長期運轉的自動化流程的人,這是值得借鏡的架構觀——別只存結果,也要存下『當時怎麼想的』。

歸剛點評|別只存結果,也要存『當時怎麼想的』——SkillHone 點出 agent 進化的關鍵在保留決策歷史,而非每次砍掉重練。這跟 Max 每天跑的日報排程完全呼應:把選題與改流程的判斷留成養分,系統才會愈跑愈聰明,這是設計長期自動化流程的架構觀。
研究

機器人學會動手後,還記得常識嗎?新研究量測 VLA 模型的知識流失

視覺-語言-動作(VLA)模型多半是拿強大的 VLM 用機器人資料微調而來,但微調後它到底還保留多少常識與事實知識,一直不清楚。這篇論文專門量測 VLA 在適應機器人任務後的知識保留程度。

機器人學會動手後,還記得常識嗎?新研究量測 VLA 模型的知識流失

具身智慧的 VLA(視覺-語言-動作)模型,通常是拿一個本來很強的視覺-語言模型,再用機器人資料去微調而成。問題來了:經過這番改造、學會了控制手臂與感知環境之後,它原本那套常識與事實知識還剩多少?沒人說得準。而且當模型在需要知識的任務上失手時,往往分不清是它根本不知道,還是知道卻沒能力執行——兩種失敗混在一起,很難診斷。

這篇論文正面處理這個模糊地帶,設計方法去量測 VLA 模型在適應機器人任務後的常識與世界知識到底保留了多少。之所以重要,是因為一個會動手的機器人若在過程中悄悄流失了對世界的基本理解,它做出來的動作就可能看似俐落、實則違背常識——好比會精準抓取,卻搞不清該不該抓、抓了會怎樣。把『知不知道』和『做不做得到』拆開來評估,是讓具身 AI 變可靠的必要一步。

對關注機器人與具身 AI 的人,這提醒了一個容易被忽略的代價:把通用大模型特化成專用執行者,往往要付出通識退化的隱形學費。今天另一篇 hf 論文談 agent 的程序記憶、談怎麼讓技能累積不流失,這篇則從反方向敲警鐘——特化的同時別把根基掏空。兩者合起來看,指向同一個核心命題:AI 要真的好用,得同時管好『學到新本事』與『別忘了舊常識』這兩件事。

歸剛點評|把通用大模型特化成會動手的機器人,往往要付『通識退化』的隱形學費——看似俐落卻可能違背常識。這篇把『知不知道』和『做不做到』拆開評估,是具身 AI 走向可靠的必要一步,也提醒所有做模型特化的人:別為了新本事掏空舊根基。
研究

SWE-Interact:把寫程式 benchmark 改成『使用者一路來回下指令』的多輪任務

論文提出 SWE-Interact,評估 coding agent 在多輪、互動、使用者驅動的軟體工程任務上的表現。現有前沿 SWE benchmark 多半一開始就給完整需求、再看 agent 自主完成;SWE-Interact 則把使用者放回迴圈裡。

SWE-Interact:把寫程式 benchmark 改成『使用者一路來回下指令』的多輪任務

現在主流的 coding agent 評測,大多長這樣:一開始就把完整需求全丟給 agent,然後看它能不能自己一路寫完。但真實世界的軟體開發根本不是這樣——需求是邊做邊講清楚的,人會中途改主意、補條件、看到結果再調方向。SWE-Interact 這篇論文就是要補上這個落差,把 coding agent 放進『多輪、互動、使用者驅動』的情境裡評估,讓使用者重新回到開發迴圈當中。

轉變雖然聽來不大,意義卻不小。一個 agent 能不能在拿到完整規格後自主把題目解掉,跟它能不能在一場你來我往、需求逐步浮現的協作裡穩住陣腳,是兩種很不一樣的能力。後者更接近工程師每天用 AI 助手寫程式的真實體感:你先講個大概,看它寫出什麼,再指出哪裡不對、要改哪裡。SWE-Interact 把評測拉到這個更貼近現場的維度,量的是 agent 在模糊、變動、多回合下的實戰力。

對每天用 AI 寫程式的人(包括 Max 這種靠 AI 建站、跑排程、修腳本的),這篇很有共鳴。你會發現真正決定生產力的,不是 agent 一次能不能通關某個乾淨的題目,而是它能不能聽懂你半路改的需求、記住前面講過的脈絡、不要每次都要你重講一遍。評測終於開始測『協作』而不只是『自動完成』,這對挑選順手的 coding 工具,是更貼近日常的參考。

歸剛點評|真實開發是邊做邊講清楚需求,不是一次把規格丟給 AI 讓它自己跑完。SWE-Interact 把評測拉到『多輪協作』這個更貼近日常的維度。對每天靠 AI 寫程式、修腳本的人,選工具該看的是它聽不聽得懂你半路改的需求,而不只是能不能通關乾淨題目。
研究

TRIAGE:替 agent 的每個動作『按角色分功過』,改進代理式強化學習

代理式強化學習要替搜尋、點擊、編輯、導航等面向環境的動作分配功過。標準 GRPO 用最終驗證結果對所有動作 token 給一致的優勢值。TRIAGE 提出依動作角色分型的信用分配,讓不同類型的動作得到更貼切的獎勵訊號。

TRIAGE:替 agent 的每個動作『按角色分功過』,改進代理式強化學習

讓 AI agent 靠強化學習變強,有個很實際的難題:一條任務軌跡裡有搜尋、點擊、編輯、導航、跟物件互動等一大堆面向環境的動作,最後成功或失敗的功過,到底該算在哪個動作頭上?標準的 GRPO 做法是拿最終驗證結果,對所有動作 token 給一個一致的優勢值——不管你這步是關鍵決策還是無關緊要的中間操作,通通吃同一份獎懲。這個訊號有用,但太粗。

TRIAGE 這篇論文提出更細緻的做法:依動作的『角色』分型來分配信用。不同種類的動作在任務裡扮演的份量本來就不同,把它們一視同仁地灌同一個優勢值,會讓學習訊號變糊、效率變差。按角色區分後,關鍵動作能拿到更貼切的獎勵、雜訊動作不被過度強化,agent 學起來就更有方向感。說白了,就是把『整組一起賞罰』改成『看你在這局扮什麼角色、各自論功行賞』。

這類研究是 agent 能力持續變強的底層引擎。今天這一版日報裡好幾篇都在談 agent——程序記憶、技能演化、多輪協作,而 TRIAGE 補的是最底層的訓練訊號怎麼給得更準。對一般使用者,這些細節看起來很遠,但它們決定了你明年用到的 AI agent 會不會更少犯蠢、更懂得哪一步重要。當各家都在拚 agent 誰更能自己動手辦事,能不能把『功過算得準』這件苦工做好,往往就是拉開差距的地方。

歸剛點評|agent 要更會辦事,底層得先把『哪一步該記功、哪一步該記過』算準。TRIAGE 把 GRPO 那種整組一致的粗獎勵,改成按動作角色論功行賞。這類訓練訊號的細活,決定了明年你用到的 AI agent 會不會更少犯蠢——是拉開各家差距的關鍵苦工。

今日快訊