第 21 期2026-06-30(台北時間)
第二十一期。今天的主軸是錢往哪流、規矩誰來定。Anthropic 跟加州州長 Newsom 簽約,把 Claude 用半價塞進整個加州政府——同一家公司,在聯邦那邊跟國防部談崩、被 OpenAI 截走訂單,在州這邊卻成了座上賓,AI 採購開始有了藍紅之分。南韓更猛,三星和 SK 海力士豪砸超過五千億美元蓋四座記憶體新廠,李在明把半導體、實體 AI、資料中心定為國家「三軸」,想趁這波缺貨 RAMageddon 把對手甩開。監管面,TIDAL 七月十五日起對純 AI 音樂斷金流、貼標籤、抓冒名;華府那邊有議員要禁止把你跟聊天機器人講的健康與位置資料賣給資料掮客。從州政府的採購單到串流平台的版稅規則,今天大家都在替 AI 畫線。
政策
加州州長 Newsom 辦公室六月二十九日宣布,與 Anthropic 簽下一紙合作協議,讓全州各級機關與地方政府能以五折價格使用 Claude,內容涵蓋平台存取、員工訓練與技術支援,主要用途是協助公務員草擬文件、整理與分析資料。對 Anthropic 來說,把單一最大的州政府市場一次拿下,是商業與政治雙贏的一步。對照組就在聯邦。今年稍早 Anthropic 與美國國防部就一紙合約鬧翻,Anthropic 想在條款裡明文排除「用 Claude 監控美國人」與「在沒有人類監督下操作自主武器」這兩種用途,國防部長 Hegseth 不接受,最後國防部轉頭跟 OpenAI 簽了。一邊在州政府當座上賓、一邊在聯邦吃閉門羹,這條落差把 AI 採購的政治分裂攤在檯面上:同一套模型,誰能買、拿來幹嘛,已經開始按藍紅版圖切割。我們前幾期追過「前沿模型政治化」,這次換成採購端現身——州與聯邦各買各的,廠商也只好選邊定價。對台灣的政府數位採購來說,這也是一面鏡子:當 AI 變成公部門的基礎工具,要不要在合約裡寫死用途紅線,會直接決定買到的是工具還是麻煩。
歸剛點評|這筆交易表面是折扣,底下是站隊。Anthropic 用「我有底線、不幫你監控人民」的姿態,把一群在意公民自由的州政府客戶圈進來;代價是跟聯邦軍方的生意黃了。對台灣讀者的提醒是:未來政府標案買 AI,比的可能不只是誰便宜、誰強,而是這家廠商願不願意在合約裡寫死「不能拿來幹嘛」。
產業
三星與 SK 海力士計畫投入五千一百八十億美元在南韓西南部蓋四座記憶體新廠,另花五百二十億美元建 HBM 封裝中心;總統李在明把半導體、實體 AI、資料中心定為國家「三軸」,目標二〇二八年商用人形機器人。
全球前兩大記憶體廠三星與 SK 海力士六月二十九日攤開一張天文數字的投資計畫:約五千一百八十億美元在南韓西南部新建四座記憶體晶圓廠,另加約五百二十億美元在中部蓋一座 HBM 高頻寬記憶體封裝中心,合計超過五千五百億美元,部分外電把整體規模算到接近六千億。背景是業界戲稱的「RAMageddon」——AI 建設把記憶體吃到全球缺貨,三星和 SK 海力士正爽賺這波創紀錄需求。南韓總統李在明喊出二〇二六年是南韓必須坐穩「不可取代」工業強權的一年,把半導體、實體 AI、AI 資料中心定為下一個工業時代的「三軸」,並點名龍仁、平澤的現有廠已經「到頂」,催企業加速往西南部投資;更大的國家計畫據報上看一兆美元,連帶押注二〇二八年要做出商用人形機器人。風險也寫在臉上:晶圓廠一蓋好幾年,等廠房落成、這波 AI 需求若退潮,留下的就是過剩產能與崩盤的價格。
歸剛點評|缺貨的時候蓋廠最爽,也最危險。記憶體是出了名的景氣循環產業,今天 AI 把 HBM 搶到完售,三、四年後新廠一起開出來,很可能正好撞上需求降溫——這正是南韓這把豪賭最大的變數。對台灣供應鏈來說,南韓把國力全押在記憶體與實體 AI,等於跟台灣的晶圓代工強項正面錯開又互補,後面的產業板塊值得盯緊。
資金
源自柏克萊研究專案的 AI 模型排行榜 Arena(前身 LMArena),在推出商用服務僅八個月後年化營收衝上一億美元;榜單對大眾免費,營收來自賣給模型實驗室與企業的深度評測服務。
幾乎每個關注 AI 的人都看過的模型排行榜 Arena,把流量變成了真金白銀。這個二〇二三年從加州大學柏克萊分校研究專案起家、今年一月底由 LMArena 改名為 Arena 的團隊宣布,旗下商用產品上線僅八個月,年化營收(run-rate)已衝到一億美元。它的公開排行榜對所有人免費,靠群眾投票把各家大模型兩兩盲測排名;錢則來自二〇二五年九月推出的 AI Evaluations——把社群累積的對戰資料整理成深度效能分析,賣給模型實驗室與企業。成長曲線很猛:今年一月 Arena 宣布完成一億五千萬美元 A 輪、投後估值十七億美元時,年化營收還只有三千萬,幾個月就翻到一億。要提醒的是,這筆錢算「用量計費」、不是訂閱式的經常性收入,客戶用多少付多少,營收波動會比 SaaS 大。一個免費榜單能養出獨角獸,靠的是它站上了「誰來公正評斷模型強弱」的裁判位置。換個角度看,這也說明 AI 產業已經膨脹到連「評測」這個配套環節,都能撐起一門上看億元的獨立生意——淘金潮夠大,連磅秤都有人搶著買。
歸剛點評|當所有實驗室都搶著在你的榜上刷分,你就從旁觀者變成了收費的裁判——這是 Arena 真正值錢的地方。它賣的不是排名,是「中立第三方」這四個字的公信力。不過用量計費的營收容易大起大落,景氣一冷、實驗室評測預算一砍,數字回吐也會很快,一億美元的 run-rate 別當成穩穩落袋。
監管
串流平台 TIDAL 宣布新政策:完全由 AI 生成的曲目不能領版稅、不能靠直接面對粉絲銷售變現,並用自動化工具偵測、標上「AI」徽章,移除冒充真人藝人或涉詐欺的 AI 音樂,七月十五日生效。
串流平台 TIDAL 六月二十九日端出一套對 AI 音樂的新規矩。被判定為「完全由 AI 生成」的曲目,將不能領取版稅、不能透過直接面對粉絲的銷售收錢,平台端一律斷掉變現管道;同時這些曲目會被貼上看得見的「AI」徽章,讓聽眾知道自己聽的是什麼。更進一步,TIDAL 會動用自動化工具,主動找出並移除冒充特定藝人或團體、以及涉及「詐欺行為」的 AI 音樂——後者包含假冒知名藝人、刻意誤導聽眾等情況。整套政策七月十五日生效。TIDAL 給的理由是要「保護並獎勵有機的原創」,避免損害真人藝人和粉絲建立連結的能力,並說很多聽眾根本不想被推送純 AI 作品。平台也強調這是一份「活的文件」,會隨產業變化調整。比起把 AI 音樂一刀全禁,TIDAL 選的是「可以存在,但別想靠平台賺錢、也別想假冒真人」,在創作自由與真人權益之間踩了一條中間線。值得注意的是,TIDAL 自陳這是「活的文件」,留了隨產業變化調整的空間,也等於承認怎麼界定「純 AI」「半 AI」本身就是個會一直被挑戰的灰色地帶。
歸剛點評|重點不在禁不禁,而在「斷金流」這招打得準。AI 灌歌洗版的誘因說穿了就是版稅分潤,TIDAL 直接讓純 AI 曲目領不到錢,等於抽掉刷量工廠的動機,比硬下架更治本。對台灣的獨立音樂人是個值得參考的訊號:平台開始願意用版稅規則替真人撐傘,Spotify 會不會跟進,是下一個看點。
產業
OpenAI 在 X 上貼出一段影片,露出一個方形、帶多個按鍵的裝置,配文「你最愛的 Codex 快捷鍵要升級了」,七月十五日公布;據報是與 Work Louder 合作、Codex 版的 Creator Micro 2 巨集鍵盤。
OpenAI 替它的 AI 編碼工具 Codex 預告了一款硬體。週一在 X(OpenAI Developers 帳號)貼出的影片裡,出現一個方形、帶多個按鍵的裝置,配文寫著「你最愛的 Codex 快捷鍵要升級了」,並標出七月十五日。多家科技媒體比對外型後判斷,這是 OpenAI 與週邊廠商 Work Louder 合作、為 Codex 量身打造的版本,外型神似 Work Louder 的 Creator Micro 2 巨集鍵盤——一塊配有多顆機械軸、一支搖桿與一個觸控感應區的小型巨集鍵盤。要先講清楚,這不是外界一直在等的那台 OpenAI 神祕 AI 裝置(與前蘋果設計師 Jony Ive 團隊合作的那款),定位比較像給重度開發者的實體控制器,把常用的 Codex 指令做成一排可按的快捷鍵。OpenAI 與 Work Louder 都還沒在七月十五日之前公布更多細節。把軟體助手做成桌上一塊看得到、按得到的鍵,反映的是 AI 編碼工具正從聊天框往工作流深處鑽,連肌肉記憶都想接管。同一天 Cursor 把編碼代理搬上手機、OpenAI 替 Codex 做實體鍵盤,兩家一前一後出招,等於同時在搶「人類到底用什麼介面指揮 AI 寫程式」這個入口——軟硬兩路都要卡位。要等七月十五日當天,OpenAI 與 Work Louder 才會把規格與定價講清楚。
歸剛點評|一塊賣給工程師的巨集鍵盤本身是小生意,真正的訊號是 OpenAI 想把 Codex 從「聊天框裡的助手」變成「桌面上的工作站配件」。當你願意為某個工具買實體按鍵,代表它已經長進你的每日流程裡,黏著度跟一次性試用完全不是同一回事——這才是 OpenAI 想要的綁定。
政策
參議員 Warren 與眾議員 Scanlon 預計推出新版《健康與位置資料保護法》,禁止把美國人的健康與位置資訊賣給資料掮客,範圍涵蓋人們向 ChatGPT、Claude 等聊天機器人透露的內容。
美國國會準備對「資料掮客」開刀,而且這次明確把 AI 聊天機器人圈了進來。據報,參議員 Elizabeth Warren(麻州)與眾議員 Mary Gay Scanlon(賓州)將在未來幾週推出新版《健康與位置資料保護法》(Health and Location Data Protection Act),核心是禁止把美國人的健康與位置資訊賣給資料掮客;關鍵在於,範圍涵蓋人們在 ChatGPT、Claude 這類聊天機器人裡透露的內容。這點很要命——大量使用者把症狀、用藥、心理狀態、甚至所在位置講給 AI 聽,這些對話一旦被當成可交易的資料商品,等於把最私密的健康畫像放上市場。法案瞄準的是資料掮客這個長年灰色的中間層:他們把分散的線上行為拼成完整個檔,再轉賣給保險、廣告、雇主甚至討債方。把 AI 對話納入規範,是承認聊天機器人已經變成新一代的隱私重災區。能不能通過是另一回事,民主黨議員提的法案在當前國會未必走得遠,但它先把「AI 對話也是受保護的健康資料」這個觀念釘進立法語言裡。
歸剛點評|你以為跟 AI 聊症狀只是問個健康問題,背後可能是一筆能被打包賣掉的資料。這法案最有意義的地方,是第一次白紙黑字把「跟聊天機器人講的話」算進健康隱私。就算這屆國會擋下它,這個定義一旦立起來,未來只要風向一變就能借屍還魂。台灣在個資法的 AI 適用上也還沒接上,值得借鏡。
產業
Google 把 Gemini 的個人化 AI 生圖擴大給美國符合資格的免費用戶,讓聊天機器人能依你的興趣、以及連動的 Google 各 App 資料來生成圖片。
Google 把 Gemini 的個人化 AI 生圖功能下放給美國符合資格的免費用戶。簡單說,Gemini 能根據你的興趣、以及它從你連動的各個 Google App 裡讀到的資料,生成貼合你個人脈絡的圖片——理論上你不必把偏好一句句打出來,它從你的使用痕跡就猜得到。對 Google 來說,這是把「個人化」當成生成式 AI 的差異化武器:同一句生圖指令,Gemini 因為手上握有你的 Gmail、相簿、地圖等跨產品資料,能給出比通用模型更對味的結果。把這功能免費開放,明顯是要用 Google 帳號生態的資料優勢,去壓對手一頭。但同一枚硬幣的反面,正好呼應今天另一條新聞——當生圖品質建立在「讓 AI 讀你的個人資料」之上,便利與隱私的拉扯只會更尖銳。使用者拿到免費好用的工具,代價是把更多跨產品的行為交給模型咀嚼。把這條和 Warren 那條法案並著看,AI 個人化的甜頭與風險,今天剛好同框:一邊是平台用你的資料做更貼心的生圖,一邊是議員想立法擋住這些資料被進一步轉賣,兩股力道正面對撞。
歸剛點評|免費的個人化,本質是用你的資料換的。Gemini 的真正護城河不是模型多強,而是它能合法翻你的 Gmail、相簿、地圖——這是純做模型的對手拿不到的底牌。對使用者,方便和被讀取是綁在一起賣的;想清楚再連動,別讓「順手好用」蓋過「它到底看了我多少東西」。
產業
HP Inc. 擴大其 OpenAI Frontier 夥伴關係,把 AI 部署到客戶體驗、軟體開發與企業營運等環節。
硬體大廠 HP Inc. 宣布擴大與 OpenAI 的「Frontier」策略夥伴關係,把 AI 更深地鋪進三條主線:客戶體驗、軟體開發、以及企業內部營運。OpenAI 的 Frontier 計畫,定位是讓大型企業把前沿模型導入自家流程的深度合作框架,HP 這次是加碼而非新簽,等於把賭注押得更重。對 HP 來說,這家以 PC 與印表機為本業的老牌硬體公司,正試著用 AI 替疲軟的傳統業務找新故事——無論是讓客服更聰明、讓內部工程團隊用 AI 加速開發,還是把營運流程自動化,核心都是「別只當賣硬體的,要當會用 AI 的公司」。對 OpenAI 來說,多一個 HP 這種規模的企業客戶長期綁定,是把模型從消費端往企業端紮根的重要一步,營收也更穩。這類「大廠全面導入 OpenAI」的案子近期一個接一個,反映的是企業 AI 採購正從試水溫進入整廠輸出的階段:不再是某個部門偷偷試用,而是高層拍板、跨部門一起上。對台灣的中大型企業,這種「整廠導入單一 AI 供應商」的模式很快會成為要面對的選擇題:跟緊一家、流程順但被綁住,或多家併用、彈性高但整合更累,沒有標準答案。
歸剛點評|HP 這步棋是傳統硬體廠的典型焦慮解法——本業成長見頂,就抱緊一個 AI 大腿講新故事給市場聽。對 OpenAI 則是企業營收的紮根。值得注意的是,這種「整廠導入單一模型」的綁定,一旦深了就難拆,等於企業把核心流程的命脈交給一家外部 AI 公司,議價權的天平往哪倒,幾年後才看得出來。
資金
新創 Proception 與特斯拉的商業機密官司和解,並宣布募得一千一百萬美元;公司用一套特別的方法蒐集訓練資料,主攻機器人最難啃的問題之一——靈巧的手。
機器人領域最難搞的問題之一,是「手」。要讓機械手像人手那樣靈巧抓握、調整力道、處理各種形狀的物件,難度遠超過讓機器人走路或搬箱子。專做機器手的新創 Proception 這次帶來兩條消息:一是和特斯拉的一樁商業機密訴訟達成和解,二是宣布募得一千一百萬美元。Proception 的切入點在於用一套與眾不同的方法蒐集訓練資料——機器手要學會靈巧操作,最缺的就是大量、高品質、貼近真實接觸的操作資料,誰能把這個資料瓶頸打開,誰就握住了通往實用人形機器人的關鍵零件。和特斯拉的官司和解,某種程度也說明這個賽道的人才與技術流動有多敏感:頂尖機器手團隊就那幾撥人,商業機密的邊界一不小心就踩線。把這條跟今天南韓押注二〇二八年商用人形機器人並讀,會發現整個產業正同時往「實體 AI」收斂,而「手」正是那塊最硬的拼圖。誰先把靈巧操作這關過了,誰就握住人形機器人從展示走向量產的鑰匙,這也是這筆看似不大的募資真正的份量所在。
歸剛點評|人形機器人吹了好幾年,卡關往往不在大腦在末端——一隻能像人一樣靈巧的手,至今沒人真正做好。Proception 賭的是「資料瓶頸」這個正確的點:手的難不在硬體,在沒有夠多真實操作資料可學。一千一百萬不算大錢,但押在對的瓶頸上,比追熱鬧的人形整機更值得看。
資金
Omen AI 完成三千一百萬美元 A 輪,做的是監測晶片冷卻液、阻止資料中心裡的細菌孳生與管路問題,替液冷時代的資料中心當水質醫生。
AI 算力越堆越高,資料中心的散熱早就從吹風扇進化到液體冷卻,問題是——冷卻液本身會出狀況。新創 Omen AI 完成三千一百萬美元 A 輪募資,做的就是這門不性感但要命的生意:監測晶片冷卻液的狀態,及早揪出細菌孳生、管路污染等問題,避免資料中心因為一灘變質的水而當機。聽起來土,但隨著高階 GPU 集群幾乎全面轉向液冷,冷卻系統一旦因為微生物或水質劣化堵塞、腐蝕,輕則降效、重則整櫃停擺,損失以小時計、以百萬美元計。Omen AI 等於把「水質管理」這個工業老議題,套上感測加 AI 預測的新殼,賣給最怕停機的資料中心業者。這條新聞看似邊角,其實點出 AI 基建的一個盲點:大家盯著買多少 GPU、蓋多少機房,卻容易忽略支撐這一切運轉的水電冷管這些「無聊但不能倒」的環節。當算力競賽燒到極致,賺錢的反而可能是這些在後面顧水管的人。隨著液冷成為高階機房的標配,這種專攻冷卻系統健康的服務,需求只會隨資料中心一座座蓋起來而水漲船高。
歸剛點評|AI 淘金潮裡,賣鏟子的賺最穩——Omen AI 連鏟子都不賣,它賣的是「別讓鏟子生鏽」的保險。當所有人搶著堆 GPU,冷卻水質這種無聊到沒人想碰的環節,反而成了不能倒的命門。這類基建後勤的小生意,往往比追風口的明星題材更耐活。
觀點
OpenAI 發布一份報告,描繪 AI 可能如何改變歐盟各行各業的工作,盤點哪些職業面臨自動化、哪些可能成長、哪些是工作流程被改寫。
OpenAI 發布一份聚焦歐盟勞動市場的報告,試著畫出 AI 接下來會怎麼重塑歐洲各行各業的工作。報告把職業分成幾種命運:有些可能被自動化取代,有些反而因 AI 而成長,更多的則是工作內容與流程被改寫——人還在,但每天做的事換了一批。由 AI 公司自己來盤點「AI 會怎麼影響就業」,立場當然要打個折扣,OpenAI 有動機把故事說得比較樂觀、強調「轉型」與「機會」而非「失業」。但報告的價值在於提供一個可討論的框架:與其抽象地問「AI 會不會搶走工作」,不如具體拆到職業別,看哪些任務真的能被模型接手、哪些需要的人類判斷一時半刻學不走。歐盟一向是科技監管的急先鋒,這份報告也可看成 OpenAI 在政策對話裡先擺好姿態,替自己在歐洲的落地鋪路。我們前幾期談過福特回聘老工程師收拾 AI 品管爛攤——這份報告把那種「哪些判斷力學不走」的故事,放到了整個歐盟的尺度上。
歸剛點評|AI 公司出報告談 AI 對就業的影響,本來就該帶著懷疑的眼光讀——它有充分動機把「取代」講成「轉型」。但別因為立場可疑就整份丟掉:把問題從「會不會失業」拆成「哪些任務會被接手」,這個框架本身有用。真正該追問的是,報告裡輕描淡寫帶過的那些「被改寫」的工作,改寫之後人還剩多少議價空間。
觀點
MIT 科技評論一篇評論點出,企業把 AI 代理工具包裝成有名字、會「向你回報」的同事,是話術問題;把工具擬人成下屬,會模糊責任歸屬與真實能力。
MIT 科技評論一篇評論潑了 AI 代理熱潮一盆冷水:別把 AI 工具當「同事」。文章開頭設了個情境——你某天上班,發現多了個會向你回報的新下屬,但這個下屬不是人,而是一個你公司硬要取名叫「Alex」的 AI 工具。作者的批評直指這套擬人話術:把 AI 代理包裝成有名字、有職稱、會「報告」的虛擬員工,聽起來很潮,實際上會帶來真實的麻煩。一是責任歸屬被模糊——當「Alex」做錯決策,是工具的鍋還是用它的人扛?把它說成同事,等於替廠商和管理層留了一條卸責的後路。二是它誇大了能力——叫它同事,暗示它有同事該有的判斷、擔當與可問責性,但它其實只是個會生成文字的工具,達不到那個門檻。這篇文章的價值在於戳破語言的把戲:產業愛用「AI 同事」「數位員工」這種詞催買氣,但用詞會反過來形塑期待與制度設計。把工具叫成人,最後可能害真人在出事時替機器背鍋。這篇文章也呼應了今天 OpenAI 那份歐盟就業報告裡迴避的問題——當企業樂於用「數位員工」這種詞時,真人勞工在組織裡的位置與議價空間,正被悄悄重新定義。
歸剛點評|「AI 同事」這個詞聽起來貼心,骨子裡是話術。把工具擬人成下屬,最大的風險不是它太弱,而是出事時責任沒人扛——機器不會被開除,最後背鍋的往往是旁邊那個真人。下次聽到廠商喊「數位員工」,先問一句:它做錯了,誰負責?答得出來才叫負責任的部署。
研究
一篇論文提出 Vesta,定位為通用的具身推理模型(generalist embodied reasoning),目標是讓單一模型能在實體任務裡做跨場景的感知與決策。
在機器人與實體 AI 這條線上,今天一篇論文提出名為 Vesta 的模型,定位是「通用具身推理」(generalist embodied reasoning)。所謂具身推理,講的是模型不只在文字世界裡推理,而要把感知、空間理解與行動決策結合起來,讓一個 AI 能在真實或模擬的實體環境中,看懂場景、規劃步驟、做出操作。Vesta 主打「通用」(generalist),意思是不為單一任務量身訂做,而想用一套模型應付多種具身任務——這正是當前機器人研究的聖杯:與其每換一個場景就重訓一個專用模型,不如養出一個能舉一反三的通才大腦。把 Vesta 放進今天的脈絡看格外有意思:南韓押注二〇二八商用人形機器人、Proception 在攻機器手的資料瓶頸,而 Vesta 這類研究補的正是中間那層「大腦」——硬體和資料都到位後,還需要一個能統合感知與行動的推理核心。論文細節與實測強度仍待社群檢驗,但方向上,它代表實體 AI 從「能動」往「會想」推進的一步。當硬體越做越靈巧、訓練資料越補越多,最後決定機器人好不好用的,往往就是這層統合感知與決策的推理大腦。
歸剛點評|人形機器人三件套——能動的身體、靈巧的手、會想的腦,今天剛好一次到齊。Vesta 補的是最抽象也最關鍵的「腦」:一個不挑場景的通用推理核心。論文的實際成色還要等社群跑過才算數,但這個「通才大腦」的方向,正是實體 AI 從表演 demo 走向真能幹活的分水嶺。
研究
阿里 Qwen 團隊釋出兩份機器人技術報告,Qwen-RobotManip 主打對齊解鎖操作規模化,Qwen-RobotNav 則是為代理場景設計的可擴展導航模型。
阿里巴巴的 Qwen 團隊在機器人方向一口氣放出兩份技術報告,把觸角從語言模型伸進實體 AI。第一份 Qwen-RobotManip 談機器人「操作」(manipulation),核心論點是「對齊解鎖規模化」(Alignment Unlocks Scale)——意思是把模型與機器人實際操作做好對齊後,能讓操作能力隨資料與算力放大而持續提升,突破過去機器人學習難以規模化的瓶頸。第二份 Qwen-RobotNav 則聚焦「導航」(navigation),定位是一個為代理(agent)場景設計、可擴展的導航模型,讓機器人在複雜環境裡自己找路、移動到目標。兩份報告合著看,等於 Qwen 想把「動手操作」與「移動導航」這機器人兩大基本能力都用大模型的方法重做一遍。把這條放進今天的機器人專題:南韓出錢、Proception 攻手、Vesta 做通用大腦,而中國這邊由阿里用 Qwen 的模型路線切入操作與導航——實體 AI 的競賽,已經是中美各大實驗室同場較勁。技術報告的真實水準仍需第三方復現,但 Qwen 持續往機器人投入,本身就是個訊號。當操作與導航都能套上大模型的方法論,過去機器人「換場景就要重訓」的老難題,有機會被「一套通用底座」逐步取代。
歸剛點評|語言模型大廠集體跨界做機器人,今天 Qwen 一次端出操作加導航兩份報告,是個明確訊號:實體 AI 不再是機器人公司的專利,做大模型的也全押進來了。對台灣產業的提醒是,下一輪較量不只在雲端跑分,而在「會動的東西」上——而中美的頂尖實驗室,已經在同一張牌桌上了。
社群
Jack Clark 的 Import AI 第 463 期,談自我改進的機器人、一座約一萬張卡的中國 GPU 集群,以及一篇對 AI 時代的省思。
前 OpenAI 政策主管、現任 Anthropic 共同創辦人 Jack Clark 的電子報 Import AI 出到第 463 期,挑了幾個值得記下的觀察。一是「自我改進的機器人」——研究方向開始讓機器人不只執行任務,還能從經驗裡反過來優化自己的行為策略,這是把「機器會學習」往「機器會自己變強」推進的苗頭。二是一座規模約一萬張 GPU 的中國集群,提醒外界中國在算力建設上並沒有因為出口管制而停步,反而在想方設法把手上的卡集中起來辦大事;這條和我們前幾期追的「中國用開源繞過管制」是同一個母題的兩面——硬體圍堵之外,算力與權重都在找縫鑽。Import AI 一向不只報新聞,還夾帶 Clark 對產業走向的判斷,這期還收了一段對 AI 時代略帶感傷的省思。對想看懂 AI 大局的人,這類由業內重量級人物親寫的長期觀察,比單篇快訊更能拼出趨勢的形狀——它幫你把零散的事件接成一條線。這期的兩個主軸——機器人自我改進、中國算力持續集結——也跟我們站內這幾天反覆追的母題彼此呼應,是看懂大局的好補充。
歸剛點評|Import AI 的價值不在它報了什麼新聞,而在 Jack Clark 這種圈內頂級玩家願意把自己的判斷寫下來。這期兩個重點——機器人開始自我改進、中國算力沒被管制卡死——都指向同一件事:技術擴散比政策圍堵跑得快。想看懂 AI 往哪走,這類業內長觀察值得固定追。
產業
AI 編碼工具 Cursor 推出手機 App,讓開發者在移動中也能引導自家的編碼代理(coding agent)工作。
AI 編碼工具 Cursor 推出手機 App,把「指揮 AI 寫程式」這件事搬到了手機上。過去 Cursor 主要活在桌面 IDE 裡,工程師坐在電腦前讓 AI 代理幫忙改程式碼;新的手機 App 則讓你出門在外、人不在電腦前時,也能引導自家的編碼代理繼續工作——派任務、看進度、給指示,通勤路上、咖啡店裡都能遙控。這背後反映一個正在成形的工作模式:當 AI 代理能比較自主地跑一段較長的任務,人類的角色從「逐行寫碼」變成「下指令、審結果」,那麼這個監督動作就不必綁在桌前,手機完全夠用。把這條跟今天 OpenAI 替 Codex 做實體快捷鍵並讀很有意思——一個往手機走、一個往桌面硬體走,兩家都在搶「人類怎麼跟編碼代理互動」這個介面的話語權。誰能讓開發者最順手地把任務交給 AI、又最放心地審查它的產出,誰就握住了下一代開發工具的入口。Cursor 把入口延伸到口袋裡,是搶這場介面戰的一步。當編碼代理越來越能自己跑長任務,「在哪裡、用什麼裝置監督它」就成了開發工具的新戰場,而手機顯然是把監督門檻降到最低的那一塊。
歸剛點評|當 AI 代理能自己跑一段較長的活,人就不必黏在電腦前盯著——這正是 Cursor 把指揮台搬上手機的底氣。它賭的是開發者的角色正從「寫碼的」變成「審碼的、派活的」。介面之爭已經開打:Codex 往桌面做硬體、Cursor 往口袋做 App,搶的都是你跟 AI 協作的習慣入口。
研究
一篇論文提出 AgentOdyssey,用開放式、長程的文字遊戲生成環境,作為測試時持續學習(test-time continual learning)的試煉場,逼代理在長任務中不斷適應。
一篇論文提出 AgentOdyssey,把「文字遊戲」當成訓練與考驗 AI 代理的試煉場。它的設計是開放式、長程(long-horizon)的文字遊戲生成——也就是自動產出一連串沒有固定終點、需要長時間連續決策的文字冒險,讓 AI 代理在裡頭一路闖關。重點放在「測試時持續學習」(test-time continual learning):一般模型訓練完就定型,面對沒見過的新狀況只能硬套舊知識;AgentOdyssey 想逼代理在實際遊玩、面對沒玩過的關卡時,邊玩邊調整、持續累積適應力,而不是一招用到底。用文字遊戲當載體有它的巧妙——文字遊戲規則彈性、狀態複雜、又不需要昂貴的實體或視覺模擬,是測試代理長程規劃與適應能力相對省成本的沙盒。把這條跟 Import AI 那則「自我改進的機器人」並讀,會發現「讓 AI 在過程中自己變強」正成為跨研究線的共同關鍵字——不論是實體機器人還是文字代理,大家都在攻同一道題:怎麼讓模型不要學完就定格。論文成色仍待社群驗證,方向值得追。
歸剛點評|模型最大的死穴之一,是訓練完就定型,遇到沒見過的狀況只能硬套舊招。AgentOdyssey 用便宜又複雜的文字遊戲當沙盒,逼代理邊玩邊學——這跟今天機器人那邊「自我改進」是同一道題的兩種解法。誰先讓 AI 學完還能持續變強,誰就跨過了通用智能很實在的一關。
研究
一篇論文提出 Cluster, Route, Escalate 框架,用分群、路由、逐級升級的方式做「成本感知」的大模型服務,讓簡單請求走便宜小模型、難題才升級到貴的大模型。
面對大模型服務又貴又燒算力的現實,一篇論文提出名為 Cluster, Route, Escalate(分群、路由、升級)的層級框架,主打「成本感知」的 LLM 服務。核心想法很務實:不是每個請求都值得動用最貴的旗艦模型。框架先把進來的查詢分群(cluster),辨識它們的難易與類型;接著路由(route),把簡單、常見的請求交給便宜的小模型處理;只有當小模型搞不定、信心不足時,才升級(escalate)到更強也更貴的大模型。這套「能省則省、該花才花」的串接,目標是在維持回答品質的前提下,大幅壓低整體服務成本——對任何要把 AI 大規模上線、又被推論帳單壓得喘不過氣的團隊,都是直接命中痛點的設計。它跟今天 Omen AI 顧冷卻水那條其實同一個底層焦慮:AI 燒錢燒到極致時,省成本本身就是一門生意與一條研究線。對自架 AI 服務的人,這種分級路由的思路相當實用,剛好也呼應我們站內一貫強調的「能少用貴模型就少用」。隨著越來越多團隊把 AI 推上正式生產環境,這種把成本當成一級設計目標的研究,會比單純追求跑分更新更受實務界歡迎。
歸剛點評|這篇論文簡直是替每個被推論帳單嚇到的團隊寫的:簡單問題丟便宜小模型、難題才升級到貴的旗艦,能省則省。道理不複雜,但做得好就是真金白銀。它跟顧冷卻水的 Omen AI 同一個母題——當 AI 燒錢到極限,「怎麼少花」本身就成了最值錢的本事。自架服務的人值得照這思路設計。