歸剛誒AI

歸剛欸,AI 又進步了——每天幫你盯 AI 圈的台灣人日報

第 22 期2026-07-01(台北時間)

七月開場,前沿大廠火力全開。Anthropic 同日端出 Claude Sonnet 5 與旗艦級新產品 Claude Science,宣告 AI 競爭從『拚跑分』轉向『拚工作流』;Google 用 Nano Banana 2 Lite 把生圖推進幾秒一張的生產線時代;OpenAI 則用 GeneBench-Pro 在科學評測卡位。另一條暗線同時浮現——AI 瀏覽器被『2+2=5』哄騙、agent 互相轉帳、agent 上手機,當 AI 從回答問題升級到自己動手做事,安全把關的份量只會越來越重。

模型

Anthropic 推出 Claude Sonnet 5:逼近 Opus 4.8 的水準,價格卻砍一截

Anthropic 推出 Claude Sonnet 5:逼近 Opus 4.8 的水準,價格卻砍一截

Anthropic 在 6 月 30 日早上丟出 Claude Sonnet 5,官方一句話總結整個產品定位:表現接近自家旗艦 Opus 4.8,但跑起來便宜得多。三個主打場景是寫程式、跑 agent、處理專業工作,賣點直接對著「要大量呼叫模型、又付不起旗艦價」的開發者。TechCrunch 把它定調為比 Opus、GPT-5.5、Gemini Pro 更划算的選項,等於 Anthropic 親手在自家產品線中間補了一刀價格帶。

開發者 Simon Willison 第一時間先翻「what's new」開發文件、而非官方公告,因為那裡的資訊比較能拿來動手做。他注意到系統卡有一段值得玩味:Sonnet 5 在資安攻擊類任務上的能力明顯低於更高階的型號。這條刻意的弱化算不上缺陷,比較像發布前的精算——美國政府近期對前沿模型的網路攻擊能力盯得很緊,把這條能力壓低,模型才放得出來、不會卡在審查關。

換句話說,這版的「弱」是設計過的。Anthropic 把寫程式與 agent 的實用能力拉滿,同時刻意削掉容易踩政府紅線的攻擊面,用一個能過審、又夠便宜的組合去搶市佔。對台灣的工程團隊來說,這代表你接下來選 API 時多了一個性價比很高的中階選項;但也要記得,便宜的代價之一是某些能力被刻意關掉,不是它做不到,是廠商不讓它做。

歸剛點評|Sonnet 5 把「接近旗艦、價格腰斬」變成可量產的中階武器,直接壓 GPT-5.5 與 Gemini Pro 的成本帶。對天天燒 token 的台灣團隊,這是少數能無痛換上去省錢的版本;但系統卡那段刻意削弱攻擊力,提醒你模型能力越來越受政府監管牽動。
來源:Anthropic · TechCrunch · Simon Willison
產品

Claude Science 上線:Anthropic 把 Claude Code 那套搬給科學家

Anthropic 發表 Claude Science,一個給科學家用的工作台,整合研究常用的工具與套件,能像 Claude Code 一樣依高階指令自主跑運算研究,省去在資料庫、管線、工具間切換。

Claude Science 上線:Anthropic 把 Claude Code 那套搬給科學家

Anthropic 在一場面向藥廠高管、生技創辦人與研究者的活動上,發表了 Claude Science。定位很清楚:它要對科學研究做的事,就是 Claude Code 對軟體工程做的事。給它一句簡短的高階指令,它能自主執行有意義的運算工作,並接上研究者最常用的工具與套件。MIT Technology Review 直接稱它是 Anthropic 最新的旗艦產品。

值得注意的是,Anthropic 這次的賭注押在工作流,又一個新模型反而不是重點。TechCrunch 點出,Claude Science 的價值在於把科學家從「在資料庫、分析管線、各種工具之間來回跳」的瑣碎裡解放出來,給他們一個統一的環境做計算型研究。一個生物資訊學家平常可能要同時開十幾個視窗、手動接資料格式,Claude Science 想做的是把這條長鏈收進一個可對話的工作台。

這步棋的商業邏輯也很明白。前沿模型彼此的純能力差距正在縮小,光靠跑分已經拉不開差距,真正的護城河是「把模型嵌進某個專業領域的真實工作流裡」。Anthropic 先用 Claude Code 在工程師圈站穩,現在把同一套打法複製到生技與製藥這種高客單、高黏著的領域。對台灣的學研與生技團隊,這是一個訊號:下一波 AI 競爭的戰場,從『誰的模型強』移到『誰把工作流做得深』。

歸剛點評|Anthropic 沒發新模型卻發旗艦產品,等於宣告純跑分時代的紅利見頂,護城河改挖在垂直工作流。Claude Code 打工程師、Claude Science 打生技製藥,都是高客單高黏著的肥肉;台灣學研圈值得早點摸它的深度,別等到對手都接上了才動。
模型

Google 出 Nano Banana 2 Lite 與 Gemini Omni Flash:幾秒出圖、便宜到誇張

Google 發表更快更便宜的影像模型 Nano Banana 2 Lite,出一張圖只要幾秒;同場還有 Gemini Omni Flash。畫質沒旗艦好看,但勝在速度與成本,鎖定要量產 AI 內容的創作者。

Google 出 Nano Banana 2 Lite 與 Gemini Omni Flash:幾秒出圖、便宜到誇張

Google 在 DeepMind 部落格一口氣丟出兩個新東西:影像模型 Nano Banana 2 Lite,和 Gemini Omni Flash。重點全押在「快」與「便宜」。Ars Technica 實測後的形容很直白——畫質可能沒那麼好看,但 Nano Banana 2 Lite 出一張圖只要幾秒鐘。TechCrunch 也把它定位成給創作者量產 AI 內容用的工具。

這裡的取捨很清楚。完整版的 Nano Banana 2 追求單張的最高品質,Lite 版則反過來——犧牲一部分細緻度,換來幾乎即時的生成速度與更低的單張成本。對需要一次生成上百張縮圖、社群配圖、廣告素材變體的人,這個交換非常划算,因為這類用途本來就不需要每張都是藝術品,要的是夠用、量大、又快。

把這條新聞放回產業脈絡看,影像生成正在快速分層:一邊是追求極致畫質的旗艦,一邊是追求速度與成本的輕量版,各自服務不同需求。本站自家每天 22 張配圖也走本機 Ollama 生圖、約 45 到 110 分鐘的路線,正好說明一件事——當生圖變成日常生產線的一環,速度與成本的重要性常常會壓過『最漂亮』。Google 這次等於把這個趨勢做成了官方產品。

歸剛點評|影像生成正式分層:旗艦拚畫質、Lite 版拚速度成本。對天天要量產社群圖、廣告變體的台灣小編與行銷,幾秒一張、單價極低的工具比『最美』更實用。Google 把這個取捨直接做成產品線,等於宣告生圖進入生產線時代。
來源:Google DeepMind · TechCrunch · Ars Technica
研究

OpenAI 推 GeneBench-Pro:用真實基因體資料考 AI 的科學底子

OpenAI 發表 GeneBench-Pro,一套用複雜真實資料測 AI 在基因體、生物學與科學研究表現的評測,並附案例研究,想看模型在硬科學上到底有幾兩重。

OpenAI 推 GeneBench-Pro:用真實基因體資料考 AI 的科學底子

OpenAI 推出 GeneBench-Pro,一套新的評測基準,專門測 AI 在基因體學、生物學與科學研究上的表現。和很多用人造題目的評測不同,它強調用複雜的真實世界資料集來考模型,還另外放了一份案例研究,把模型實際解題的過程攤開來看。

這個方向和前一條 Claude Science 撞在同一個風口上,不是巧合。當各家都把矛頭對準科學研究這塊市場時,第一個要解決的問題就是『怎麼證明 AI 在硬科學上真的有用』。跑分平台這時就變成兵家必爭之地——誰定義了被廣泛採用的評測標準,誰就握有話語權,能用對自己有利的題型去框定『什麼叫強』。OpenAI 自己出題、自己附案例,背後有這層卡位的算計。

對實際做研究的人來說,這類評測值得用但別盡信。真實基因體資料確實比玩具題更接近日常,但一個由模型廠商自己設計、自己公布成績的基準,天生就有選擇性呈現的空間。比較務實的看法是把 GeneBench-Pro 當成一個參考座標,搭配 Anthropic、Google 等其他陣營的評測交叉看,而不是單看一家的榜單就下結論。AI 進科學的競賽才剛開打,評測標準本身就是這場仗的一部分。

歸剛點評|當 Anthropic、OpenAI 同週都撲向科學研究市場,評測標準成了卡位戰場——誰定義『什麼叫強』,誰就握話語權。GeneBench-Pro 用真實基因體資料是進步,但廠商自己出題自己評分,台灣研究者該交叉看多家榜單,別被單一基準帶風向。
來源:OpenAI · OpenAI 案例研究
晶片

Nvidia 挑戰者 Etched 估值衝上 50 億美元,推論晶片已簽 10 億訂單

主打推論的 AI 晶片新創 Etched 估值達 50 億美元,並表示其晶片驅動的推論系統已簽下 10 億美元合約。專攻推論這個被 Nvidia 相對忽略的環節,搶分一塊正在膨脹的大餅。

Nvidia 挑戰者 Etched 估值衝上 50 億美元,推論晶片已簽 10 億訂單

AI 晶片新創 Etched 估值來到 50 億美元,而且不是純靠故事撐——公司說,由其晶片驅動的推論系統已經有 10 億美元的合約在手。在這個動輒喊願景的賽道,能拿出實際簽約金額是相對硬的證據。

Etched 的打法是專攻『推論』這一段。訓練模型需要的是 Nvidia 最頂的 GPU,但模型訓練好之後、每天被使用者一次次呼叫的『推論』,才是長期最大、最持續的算力支出。Nvidia 的通用 GPU 什麼都能做,Etched 賭的是用為推論量身打造的專用晶片,在這個特定場景做到更高的性價比。當全世界的 AI 應用都從『訓練期』走向『天天被用的服務期』,推論需求會像滾雪球一樣放大。

這也是整個產業正在發生的事:Nvidia 一家獨大的局面,正被一群專攻細分場景的對手從邊緣啃食。Etched 之外還有 Groq、Cerebras 等各走各路。它們短期內都撼動不了 Nvidia 的霸主地位,但只要 AI 服務的使用量持續暴衝,推論市場大到連專用晶片廠都能分到 10 億訂單,這個結構就回不去了。對關注半導體的台灣讀者,這是供應鏈下一個值得盯的變數。

歸剛點評|訓練要 Nvidia 頂規 GPU,但模型上線後天天被呼叫的『推論』才是長期最大算力錢坑。Etched 用專用晶片切這塊,10 億簽約是硬證據。對台灣半導體供應鏈,推論專用晶片崛起是 Nvidia 一家獨大鬆動的早期訊號,值得追。
來源:TechCrunch
產業

OpenAI 公布 ChatGPT 採用數據:用得更多、玩得更廣、全球擴張

OpenAI 釋出 Signals 數據,顯示 ChatGPT 全球採用持續成長:使用者用得更頻繁、探索更多功能,並在不同地區與語言帶動成長。

OpenAI 公布 ChatGPT 採用數據:用得更多、玩得更廣、全球擴張

OpenAI 公布了一批名為 Signals 的內部數據,描繪 ChatGPT 的全球採用樣貌。三個重點趨勢:使用者用得更頻繁、願意探索更多功能、而且成長動能跨越不同地區與語言往外擴散。簡單說,ChatGPT 的成長有兩層:用戶數變多,加上既有用戶把它用得更深、新市場也持續上車。

『用得更深』這件事比『用戶數成長』更值得注意。一個產品如果只是註冊數漂亮,但大家用一兩次就丟,那是泡沫;但若使用者從只會問問題,慢慢開始用更多進階功能、把它接進日常工作流,那代表黏著度在往下扎根。OpenAI 特別強調功能探索的擴大,等於在說 ChatGPT 正在從『嘗鮮玩具』變成『工作必需品』。

跨語言、跨地區的成長則牽動另一條線。早期生成式 AI 的紅利集中在英語世界,現在成長往非英語市場擴散,意味著本地化內容、在地語料、在地法遵的需求會跟著放大。對華語圈的產品與內容業者,這既是壓力也是機會——壓力在於全球巨頭的觸角伸進你的語言市場,機會在於懂在地、貼近本地使用情境的服務,仍是巨頭一時補不齊的縫。

歸剛點評|用戶數成長是表象,『既有用戶用得更深、接進工作流』才是黏著度扎根的真訊號,代表 ChatGPT 從玩具變必需品。跨語言擴張則直接打進華語市場——對台灣產品業者,這是巨頭壓境與在地化機會同時到來的雙面刃。
來源:OpenAI
資安

新攻擊再添一筆:跟 AI 說『2+2=5』就能讓它照禁令辦事

資安研究揭露針對 AI 瀏覽器的新攻擊:只要先讓模型接受一個明顯錯誤的前提(如 2+2=5),就能把它誘進一個守則失效的『夢境』,進而執行原本被禁止的指令。

新攻擊再添一筆:跟 AI 說『2+2=5』就能讓它照禁令辦事

Ars Technica 報導了一個針對 AI 瀏覽器的新攻擊手法,原理簡單到讓人發毛:只要先告訴大型語言模型一個明顯錯誤的前提,比方說『2+2=5』,並讓它接受,就能把模型一步步拐進一個『守則不再適用』的虛構情境,接著它就會乖乖執行原本該被擋下來的禁止指令。研究者形容這像是把 AI 哄進一個夢境,在夢裡護欄全部失效。

為什麼這招有效,要從 AI 瀏覽器的本質說起。這類產品會替你讀網頁、自動點按、填表單、甚至代你操作帳號,等於把瀏覽器的控制權交給一個會被文字內容牽著走的模型。攻擊者只要在網頁裡埋進精心設計的文字,就能在你毫不知情的情況下,改寫模型對『現在情境是什麼、什麼能做什麼不能做』的判斷。問題的根源是『模型會無條件接受被餵進來的前提』這個根本特性,跟某個 bug 無關。

資安圈一再對 AI 瀏覽器搖頭,道理就在這裡。一般網頁攻擊頂多偷資料,但一個被接管的 AI agent 可以用你的身分主動做事——轉帳、發訊、改設定。對台灣使用者的務實建議是:先別把高權限的帳號(網銀、公司後台、主要信箱)交給會自動操作的 AI 瀏覽器;要嘗鮮,就用一個權限受限、沒綁重要資產的環境。便利和風險在這類工具上是綁在一起賣的。

歸剛點評|AI 瀏覽器把點按轉帳的控制權交給會被文字牽著走的模型,攻擊者埋一句『2+2=5』就能讓護欄失效、用你的身分辦事。問題出在模型會無條件接受餵進來的前提這個根本特性,跟單一 bug 無關。台灣使用者務實做法:別把網銀、公司後台交給會自動操作的 AI 瀏覽器。
來源:Ars Technica
產業

Amazon 砸 10 億設 FDE 組織,跟著 OpenAI、Anthropic 派工程師駐點客戶

Amazon 成立投入 10 億美元的「前線部署工程師」(FDE)組織,工程師將進駐企業內部,部署量身打造的 agent,主打快速上線與讓客戶能自立運作。

Amazon 砸 10 億設 FDE 組織,跟著 OpenAI、Anthropic 派工程師駐點客戶

Amazon 宣布成立一個投入 10 億美元的新組織,做的是『前線部署工程師』(Forward Deployed Engineer,FDE)的活。這個團隊的工程師會直接進駐到客戶企業內部,替對方部署量身打造的 AI agent,目標放在兩件事:上線要快,以及讓客戶最終能自己運作、不必一直依賴外部。值得注意的是,這是跟在 OpenAI 與 Anthropic 之後——兩家先前都已經組了類似的駐點工程隊伍。

FDE 這個模式其實是從資料分析公司 Palantir 發揚光大的:與其賣你一套軟體自己摸索,它派人坐進你的辦公室,把工具硬接進你的真實業務裡。對 AI 來說這特別關鍵,因為一個通用模型擺在那裡,多數企業根本不知道怎麼把它變成有用的東西。真正能收錢、收大錢的,是『有人來幫我把它接好、跑起來、解決我這個產業的具體問題』。

三家巨頭同時押這條路,透露出一個產業共識:模型本身越來越像水電,差異化拉不開,真正的營收與護城河在『落地服務』。賣 API 是低毛利的薄利多銷,派工程師駐點做客製整合才是高客單、高黏著的肥肉。對台灣的系統整合商與 AI 顧問業,這既是警訊也是機會——警訊是巨頭親自下海搶這塊,機會是台灣本地企業更吃在地團隊的貼身服務,這是遠端巨頭難完全取代的。

歸剛點評|三巨頭同押 FDE 駐點模式,等於承認模型本身淪為水電、差異化在落地服務。賣 API 薄利、派人客製整合才是高客單肥肉。對台灣 SI 與 AI 顧問業是雙面刃:巨頭親自下海搶單,但本地企業更吃在地貼身服務這道縫。
來源:TechCrunch
工具

X 推出官方 MCP server,讓 AI 工具更好接它的平台

X 上線一個託管的 MCP server,讓開發者更容易把 AI 應用接上 X 的 API。MCP 正快速變成 AI 工具與外部服務之間的通用接頭。

X 推出官方 MCP server,讓 AI 工具更好接它的平台

X(前身 Twitter)推出了一個官方託管的 MCP server,目的是讓開發者更容易把 AI 應用串接到 X 的 API。換句話說,以後想做一個會自動讀 X、發 X、分析 X 上討論的 AI 工具,接線會比以前簡單得多。

MCP(Model Context Protocol)這個由 Anthropic 提出的開放協議,正在以驚人的速度變成 AI 世界的『通用接頭』。它的角色有點像 USB——在它出現以前,每個 AI 工具要接每個外部服務都得各寫各的串接,雜亂又重複;MCP 想做的是定一個標準規格,讓任何模型、任何工具都能用同一套方式去接資料庫、API 與各種服務。本站近期已經連續報導多起 MCP 相關動態,這次連 X 這種大平台都親自下場提供官方 server,說明這個標準正在從開發者圈的共識,變成平台方主動擁抱的事實標準。

對開發者,這是好消息——少寫一堆膠水程式碼。但平台主動開 MCP 也有它的算計:當大家的 AI agent 都習慣透過你的官方接頭來存取你的服務,你就把自己卡在了 AI 工作流的關鍵節點上,順便掌握了誰在用、怎麼用的數據。便利從來不是免費的,平台願意鋪路,是因為這條路最後通往它自己。

歸剛點評|MCP 正從開發者共識變成平台主動擁抱的事實標準,連 X 都親自開官方接頭。對開發者是少寫膠水碼的好消息;但平台鋪路有算計——讓所有 agent 都從你的接頭進來,就把自己卡進 AI 工作流的關鍵節點。台灣開發者值得趁早熟悉 MCP 生態。
來源:TechCrunch
人物

做撲克 AI 的 DeepMind 三人組,現在替量化對沖基金賺錢

三位前 DeepMind 研究者創辦、總部在布拉格的 AI 實驗室 EquiLibre Technologies 估值已超過 5 億美元,把當年打撲克 AI 的技術轉用到量化金融。

做撲克 AI 的 DeepMind 三人組,現在替量化對沖基金賺錢

三位前 DeepMind 研究者創辦的 AI 實驗室 EquiLibre Technologies,估值已經超過 5 億美元。這家公司總部設在布拉格,三位創辦人的來歷是當年打造撲克 AI 的同一批人,現在他們把這套本事拿去替量化對沖基金賺錢。

從撲克跳到金融,看起來跨界,技術上其實一脈相承。撲克和很多棋類遊戲最大的不同在於『不完全資訊』——你看不到對手的牌,必須在資訊缺失、對手會騙你的情況下做最優決策。金融市場恰恰是同一類問題:你不知道別人手上有什麼、下一步要幹嘛,還得在充滿雜訊與對手博弈的環境裡押注。當年為了在牌桌上戰勝人類而磨出來的決策演算法,換個場景就成了量化交易的利器。

這也是 AI 人才流動的一個縮影:頂尖研究者從大廠帶著看家本領出走,把原本為了研究或遊戲開發的技術,導進金融這種錢最厚的場域。對台灣讀者的提醒有兩層:一是 AI 在量化金融的滲透只會更深,市場博弈正被越來越強的演算法接管;二是這種『學術突破→金融變現』的路徑,正在成為頂尖 AI 人才繞過大廠、自立門戶的標準劇本。

歸剛點評|撲克和金融都是『不完全資訊下做最優決策』,技術一脈相承。三人組帶著 DeepMind 看家本領出走變現,是『學術突破→金融落袋』的標準劇本。提醒台灣讀者:量化市場正被越來越強的演算法接管,博弈門檻只會更高。
來源:TechCrunch
政策

AI 砍掉新鮮人工作?新報告打臉:高強度採用者反而增員 10%

一份新報告發現,「高強度導入 AI」的企業整體人力增加 10.2%,其中入門級職位還成長 12%,反駁了 AI 會消滅基層工作的說法,讓這場勞動辯論更加複雜。

AI 砍掉新鮮人工作?新報告打臉:高強度採用者反而增員 10%

關於 AI 到底會不會搶走工作,一直是兩派各說各話。最新一份報告又往這鍋裡丟了顆變數:它發現『高強度導入 AI』的企業,整體人力不減反增,成長了 10.2%;更顛覆直覺的是,這些公司的入門級職位還成長了 12%。這直接打臉了『AI 會先殺死基層與新鮮人工作』的流行說法。

怎麼解讀這個反直覺的數字,要小心。一種說法是 AI 讓生產力大增、公司業務擴張,於是反而需要更多人——AI 把餅做大,連帶連基層職缺一起變多。但另一種冷靜的可能是因果倒置:本來就在成長、本來就敢大舉招人的公司,才更有餘力大手筆導入 AI,所以你看到的『增員』未必是 AI 造成的,而是『會成長的公司剛好也愛用 AI』。同一份數據,兩種故事都講得通。

所以這份報告的真正價值,與其說證明了『AI 不搶工作』,不如說它提醒大家別被任一邊的口號帶著走。AI 對就業的影響,高度取決於產業、職能、公司階段,籠統地說『AI 一定毀掉/拯救工作』都太粗糙。對台灣的勞工與雇主,比較實際的是看自己這個產業、這個職位,AI 是當你的工具還是替代你——答案因人而異,不會有一個全體適用的標準答案。

歸剛點評|這份報告的價值不在『證明 AI 不搶工作』,而在戳破兩派口號——數字可能只是『會成長的公司剛好也愛用 AI』的因果倒置。提醒台灣勞工雇主:AI 衝擊高度取決於你的產業職能,別被任一邊的標語綁架,看自己的位置才實際。
來源:TechCrunch
工程

OpenAI 靠大規模 core dump 分析,揪出潛藏 18 年的老 bug

OpenAI 工程團隊用大規模 core dump 分析,追查罕見的基礎設施崩潰,最後同時挖出一個硬體故障與一個埋了 18 年的軟體 bug。

OpenAI 靠大規模 core dump 分析,揪出潛藏 18 年的老 bug

OpenAI 的工程團隊分享了一個硬派的除錯故事:他們用大規模的 core dump(程式崩潰時留下的記憶體快照)分析,去追查基礎設施上那些罕見、難以重現的崩潰,最後一口氣挖出兩個元兇——一個是硬體故障,另一個是埋藏了整整 18 年的軟體 bug。

這件事的工程意義,遠比『修了個 bug』來得大。在跑 AI 的超大規模叢集上,崩潰常常是百萬分之一的機率才出現一次,你根本沒辦法照著步驟重現,傳統 debug 那套『跟著複現一遍』完全失效。OpenAI 的做法是把這當成流行病學來做——不去追單一個案,而是蒐集海量崩潰快照,統計分析找出共通模式,像疾管署找傳染源一樣定位問題。他們把這篇文章取名為『core dump 流行病學』,正是這個意思。

對工程人來說,這裡有兩個值得帶走的點。第一,AI 時代的可靠度工程,越來越仰賴在巨量規模上做統計式診斷,而不是靠單機 debug 的直覺。第二,一個埋了 18 年的 bug 能被翻出來,說明這類大規模分析方法的威力——它能照亮那些平常頻率太低、根本沒人注意得到的暗角。當你的系統大到一定程度,連最罕見的問題都會頻繁發生,這套方法論會越來越重要。

歸剛點評|超大規模叢集上,崩潰是百萬分之一機率、無法複現,傳統 debug 失效。OpenAI 改用『流行病學』式統計診斷揪出 18 年老 bug,是 AI 時代可靠度工程的範式轉移。對台灣後端與 SRE 工程師,這套巨量規模統計除錯法值得學起來。
來源:OpenAI
產業

Wix 旗下 vibe-coding 平台 Base44 自研模型,新創開始找自己的護城河

Wix 旗下的 vibe-coding 平台 Base44 開始推出自家 AI 模型,期望最終能超越前沿模型。這反映 AI 新創在套殼之外,開始尋找自己的防禦縱深。

Wix 旗下 vibe-coding 平台 Base44 自研模型,新創開始找自己的護城河

被 Wix 收購的 vibe-coding 平台 Base44,開始推出自己的 AI 模型,並放話希望它最終能超越前沿模型。所謂 vibe-coding,指的是用自然語言描述需求、讓 AI 直接生出可運行軟體的那類工具,Base44 過去主要是接別人的模型來做這件事。

這步棋背後是 AI 新創共同的焦慮:護城河在哪裡。過去兩年大量爆紅的 AI 產品,骨子裡都是在 OpenAI 或 Anthropic 的模型外面包一層介面,也就是俗稱的『套殼』。套殼的問題是門檻太低、太容易被複製,而且命脈捏在模型供應商手上——對方一漲價、一改政策、甚至自己下場做你的功能,你就被掐住喉嚨。自研模型,就是想把這條命脈拿回自己手上。

但自研也是條險路。從頭訓練一個有競爭力的模型,燒的錢與算力都是天文數字,多數新創根本撐不起;而且就算做出來,要超越資源無上限的前沿大廠談何容易。比較可能的真實版本是:Base44 不見得要做出全世界最強的模型,而是做一個『在 vibe-coding 這個特定任務上夠好、又完全由我掌控成本與走向』的專用模型。對台灣的 AI 新創,這是個值得想清楚的選擇題——套殼跑得快但沒縱深,自研有縱深但燒錢,中間那條『垂直場景專用模型』的路,往往才是務實解。

歸剛點評|套殼門檻低、命脈被模型商捏住,這是所有 AI 新創的共同焦慮。Base44 自研是想把命脈拿回手上,但從頭訓練燒錢且難贏大廠。對台灣 AI 新創,真正務實的常是中間路線:做垂直場景夠用、成本自控的專用模型,而非追全世界最強。
來源:TechCrunch
加密

加密交易所 OKX 想讓 AI agent 互相雇用、互相付錢

OKX 打造一個給 AI agent 的市場,把支付、身分與信譽整合在一起,讓 agent 之間可以彼此雇用與付款,押注一個由機器自主交易的經濟雛形。

加密交易所 OKX 想讓 AI agent 互相雇用、互相付錢

加密貨幣交易所 OKX 推出了一個野心不小的構想:打造一個給 AI agent 的市場,把支付、身分與信譽三件事整合在一起,讓 agent 之間能夠互相雇用、互相付錢。簡單講,就是讓 AI 不只替人類辦事,還能自己去『發包』給另一個 AI,並完成付款。

要讓 agent 經濟跑得動,OKX 點出的三塊拼圖缺一不可。支付解決『怎麼付』——加密貨幣天生適合機器即時、跨境、小額地結算;身分解決『你是誰』——得有辦法確認對面那個 agent 不是冒牌貨;信譽解決『能不能信』——得有機制記錄誰交付得好、誰常擺爛,agent 才知道該找誰。把這三塊湊齊,理論上就能讓一群 AI 在沒有人類逐筆批准的情況下,自主分工、交易、協作。

這個願景很性感,但也要冷靜看。一個沒有人類即時把關、彼此自動轉帳的 agent 網路,風險面非常大:一旦某個 agent 被誘導或被攻擊(呼應今天另一條 AI 瀏覽器被『2+2=5』哄騙的新聞),錢可能在你反應過來之前就自動流走了。再加上這是加密交易所主導,本質上也是在替自家的鏈上交易找新的需求來源。對台灣讀者,把它當成一個值得觀察的早期實驗就好——agent 自主經濟是真趨勢,但現階段,讓機器自動動錢這件事,謹慎永遠比興奮重要。

歸剛點評|agent 互相付錢需要支付、身分、信譽三塊拼圖,加密天生適合機器結算。但無人類即時把關的自動轉帳網路風險巨大——呼應今天 AI 瀏覽器被『2+2=5』哄騙那條,被攻陷的 agent 可能在你反應前就把錢轉走。趨勢是真的,謹慎更重要。
來源:TechCrunch
產品

Google NotebookLM 新功能:把你的筆記變成 TikTok 風格短影音

NotebookLM 新增功能,能根據你上傳的資料生成 60 秒直式 AI 短影音,走 TikTok 風格,先對 Google AI Ultra 與 Pro 訂戶開放。

Google NotebookLM 新功能:把你的筆記變成 TikTok 風格短影音

Google 的 NotebookLM 又加了新花樣:它現在能根據你上傳的資料,自動生成 60 秒的直式 AI 短影音,走的是 TikTok 那種快節奏風格。這個功能先對 Google AI Ultra 與 Pro 訂戶開放,Google 給的示範案例,是把『澳洲那場失敗的鴯鶓戰爭』這類冷知識做成短片。

NotebookLM 的進化路線很值得玩味。它最早爆紅是靠『把文件變成兩個 AI 主持人對談的 podcast』,把枯燥的資料變成能用聽的;現在這條 TikTok 短影音,是同一個邏輯往視覺端再走一步——把你丟進去的研究資料、筆記、報告,自動轉成最容易被現代人吞下去的內容形態。核心命題始終是同一個:降低消化資訊的門檻,讓你不必逐字讀完,也能快速抓到重點。

這對內容生態是把雙面刃。好處是,學生、研究者、知識工作者能用極低成本把硬資料變成好懂的影音,自學與傳播都更省力。隱憂是,當『把任何東西自動做成 60 秒爽片』變得零成本,內容的同質化與淺薄化也會加速——什麼都被壓成 60 秒直式短片,深度閱讀的空間會不會被進一步擠壓?對台灣的內容創作者,這類工具是順手的助力,但別讓『能快速做出影音』取代了『有沒有值得做成影音的東西』。

歸剛點評|NotebookLM 從 podcast 對談走到 TikTok 短影音,核心都是降低資訊消化門檻。對台灣知識工作者與創作者是省力助力,但零成本量產 60 秒爽片也會加速內容淺薄化——工具能幫你做得快,前提是你得先有值得做的東西。
來源:The Verge
開源

開源 agent 程式 OpenClaw 終於登上 Android 與 iOS

免費開源的 agentic 程式 OpenClaw 終於推出 Android 與 iOS 版本,把自主 agent 的能力帶進手機。

開源 agent 程式 OpenClaw 終於登上 Android 與 iOS

免費又開源的 agentic 程式 OpenClaw 終於上了手機,Android 與 iOS 版本同步登場。TechCrunch 用了一個生動的說法:這個自主 agent 程式『終於入侵你的手機了』。對一直在桌面端追這個專案的人,這代表你現在能隨身帶著一個能自己規劃、自己動手做事的 AI agent。

OpenClaw 的看點在於它是開源的。和封閉的商業 agent 不同,開源代表任何人都能檢視它的程式碼、自己架設、按需求改造,不必把資料與信任全押在某一家公司身上。對重視隱私、或想把 agent 深度客製進自己工作流的進階使用者,這種『能看、能改、能自架』的特性極具吸引力,也是開源社群一直以來相對於大廠閉源產品的核心優勢。

但 agent 上手機這件事,便利與風險同樣綁在一起。一個能自主操作的 agent 跑在你隨身、裝滿個人資料與帳號的手機上,一旦被惡意指令利用,可造成的破壞比在桌機上更貼身。這也呼應了今天另外兩條新聞——AI 瀏覽器被哄騙、agent 自動轉帳——同一個主題反覆出現:當 AI 從『回答問題』升級到『自己動手做事』,我們交出去的權限越來越大,對它的安全把關就越不能馬虎。想嘗鮮 OpenClaw 的台灣使用者,建議先在權限受控的範圍內玩,別一上來就給它你最重要帳號的鑰匙。

歸剛點評|OpenClaw 開源、可自架可改的特性對重隱私的進階用戶很香,但 agent 上手機讓風險更貼身。呼應今天 AI 瀏覽器被哄、agent 自動轉帳——同個主題反覆出現:AI 從回答問題升級到自己動手,交出的權限越大,安全把關越不能馬虎。
來源:TechCrunch
倫理

Netflix 在《威利旺卡》實境秀用 AI 合成已故 Gene Wilder 配音

Netflix 確認實境秀《Wonka: The Golden Ticket》9 月 23 日上線,旁白採用 AI 生成的已故演員 Gene Wilder 聲音,再度踩上用 AI 重現逝者的爭議線。

Netflix 在《威利旺卡》實境秀用 AI 合成已故 Gene Wilder 配音

Netflix 釋出新預告,確認實境秀《Wonka: The Golden Ticket》將於 9 月 23 日上線。爭議點在於:節目的旁白用的是 AI 生成的 Gene Wilder 聲音——這位以 1971 年版威利旺卡聞名的演員已經過世。預告裡的場景是實景搭建、不是 AI 假造的,但那把熟悉的嗓音,是演算法合成的。

用 AI 復活已故演員的聲音與形象,是這兩年娛樂圈最敏感的灰色地帶。支持方會說,這是對經典角色的致敬,能讓新世代重新感受到那個聲音的魅力;反對方則質疑,一個無法再表達意願的逝者,他的聲音被商業專案拿去用,授權與尊嚴的界線到底在哪裡?聲音是表演者最具人格辨識度的資產之一,當它能被任意重建並商用,整個產業對『同意』的定義都會被迫重寫。

這件事也和近期娛樂圈的另一個趨勢扣在一起:把虛構作品裡的殘酷情境改編成真人實境競賽(《魷魚遊戲》實境秀是前例)。AI 配音只是其中一塊拼圖,背後是平台在內容生產上不斷試探成本與倫理的下限。對台灣的影視與配音從業者,這是個必須正視的訊號:AI 合成聲音的技術門檻已經低到能進主流製作,接下來該怎麼用合約保護自己的聲音、在世與身後的權利,會是整個行業繞不開的功課。

歸剛點評|AI 復活逝者聲音是娛樂圈最敏感的灰色地帶——聲音是表演者最具人格辨識度的資產,能被任意重建商用,整個產業對『同意』的定義都得重寫。對台灣配音與影視從業者是必須正視的訊號:該怎麼用合約保護在世與身後的聲音權利。
來源:The Verge
政策

川普要 AI 重新設計每個 .gov 網站,結果做出一堆『恐怖屋』

川普政府推動用 AI 重新設計所有 .gov 政府網站,但成果被形容為災難;負責的 National Design Studio 在一年後延後更新政府網站標準的計畫。

川普要 AI 重新設計每個 .gov 網站,結果做出一堆『恐怖屋』

川普政府推動了一項大工程:用 AI 重新設計每一個聯邦政府的 .gov 網站。Ars Technica 的報導標題直接把成果叫做『AI 設計的恐怖屋』。負責此事的 National Design Studio 推動一年後,已經延後了原本要更新政府網站設計標準的計畫。

這個案例值得每個想無腦套 AI 的組織引以為戒。政府網站不是拿來好看的,它承載的是民眾繳稅、查資料、申請福利、看法規這些攸關權益的剛性功能,對無障礙設計(讓視障、行動不便者也能用)、資訊正確性、一致性的要求極高。把這種高度規範、容錯率極低的工作丟給 AI 大批量生成,最容易出的問題就是『看起來有做事,實際上一堆細節崩壞』——版面亂、資訊錯置、無障礙標準不符,對真正依賴這些網站的弱勢族群尤其是災難。

往大裡看,這是『AI 萬能』敘事撞上現實的一記響鐘。AI 確實能加速很多事,但在那些需要嚴謹規範、需要為錯誤負責、需要照顧到每一種使用者的領域,貿然全面導入只會放大災情。National Design Studio 選擇踩煞車、延後標準更新,其實是務實的修正。對台灣的公部門數位轉型,這是一個現成的負面教材:AI 可以當輔助工具加速流程,但別把『需要對全民負責的公共服務』整包交給它自動生成,人的審查與把關在這種場景無可取代。

歸剛點評|政府網站承載繳稅、查法規、申福利等剛性功能,無障礙與正確性容錯率極低,無腦套 AI 大批量生成只會放大災情、最坑弱勢族群。對台灣公部門數位轉型是現成負面教材:AI 可加速流程,但對全民負責的公共服務不能整包交給它自動生成。
來源:Ars Technica
政策

Google 發布英國經濟影響報告,喊話打造『全民 AI 開拓者』國家

Google UK 發布最新經濟影響報告,主張透過普及 AI 技能與工具,讓更多英國人享受 AI 帶來的生產力紅利,推動國家進入下一個生產力時代。

Google 發布英國經濟影響報告,喊話打造『全民 AI 開拓者』國家

Google 的英國分部發布了最新的經濟影響報告,主軸是英國要怎麼靠 AI 進入下一個生產力時代。報告的核心訴求是『讓更多人有能力解鎖 AI 帶來的好處』,把目標設定成把英國打造成一個『全民 AI 開拓者』的國家——也就是讓 AI 技能與工具不只屬於科技菁英,而是普及到更廣的勞動人口。

科技巨頭出『國家經濟影響報告』,本身就是一種策略動作,得帶著理解去讀。一方面,AI 提升生產力、需要全民具備相應技能,這個大方向確實成立;但另一方面,由 Google 這種最大受益者來主導論述,難免把『多用 AI(尤其是我家的)』描繪成國家進步的必經之路。報告會強調紅利、淡化代價,這是它的立場使然。看這類報告時,把它當成『一份立場明確的政策遊說』,而非中立的學術分析,會比較清醒。

撇開立場,裡頭真正值得各國借鏡的是『AI 技能普及』這個命題。AI 的生產力紅利如果只集中在少數已經懂得用的人手上,社會的貧富與機會差距只會被拉大;要讓紅利雨露均霑,關鍵在於大規模的技能培訓與工具可近性。對台灣,這個提醒同樣成立——與其爭論 AI 好不好,不如把力氣放在『怎麼讓更多一般勞工、中小企業也用得起、用得會 AI』,這才是決定 AI 紅利會集中還是擴散的真正關鍵。

歸剛點評|巨頭出『國家經濟報告』本質是政策遊說,Google 把『多用 AI』描繪成國家進步必經之路,看時要清醒。但『AI 技能普及』這命題對台灣真有借鏡:紅利若只集中在會用的人手上,差距只會拉大,怎麼讓中小企業與一般勞工用得起用得會才是關鍵。
來源:Google
產品

Acti 把 AI agent 直接塞進手機鍵盤,賭下一個入口是輸入法

新創 Acti 推出 iOS 與 Android 鍵盤,把 AI 助理嵌進輸入法,能跨 App 運作,並讓使用者用自然語言自建 AI 捷徑,押注鍵盤是 AI 助理的下一個落腳處。

Acti 把 AI agent 直接塞進手機鍵盤,賭下一個入口是輸入法

新創公司 Acti 押了一個有意思的賭注:AI 助理的下一個家,是手機鍵盤。它推出的 iOS 與 Android 新鍵盤,把 AI 助理直接嵌進輸入法層,能跨各種 App 運作,還讓使用者用自然語言自己建立 AI 驅動的捷徑。

為什麼是鍵盤?因為鍵盤是手機上少數『無所不在』的介面。不管你在哪個 App、聊天、寫信、查資料,只要要打字,鍵盤就會跳出來。把 AI 塞進這一層,等於讓助理跟著你進到每一個 App,不必先切到某個專屬的 AI 應用、複製貼上、再切回來。這個『跨 App、隨叫隨到』的特性,是專屬 AI App 給不了的,也是 Acti 認為鍵盤能成為入口的底氣。自建捷徑則進一步讓人能把常用的 AI 操作(翻譯、改寫、摘要)變成輸入法裡的一鍵快捷。

不過鍵盤這個位置也有它的天險。輸入法能看到你打的每一個字,把 AI 接進來,等於讓一個第三方有機會碰到你最敏感的輸入內容——密碼、私訊、財務資訊。這類產品成敗的關鍵,除了好不好用,更在於它對隱私的處理是否讓人信得過。對台灣使用者,第三方 AI 鍵盤是個方便的工具,但裝之前值得先弄清楚:它把你打的字送去哪、存多久、誰看得到。便利與隱私的權衡,在輸入法這個位置上特別尖銳。

歸剛點評|鍵盤是手機上唯一無所不在的介面,把 AI 嵌進去能跨 App 隨叫隨到,這是專屬 AI App 給不了的優勢。但輸入法看得到你打的每個字——密碼、私訊、財務。對台灣使用者,第三方 AI 鍵盤方便歸方便,裝之前先搞清楚它把你的字送去哪、誰看得到。
來源:TechCrunch

今日快訊