第 18 期2026-06-27(台北時間)
第十八期。今天的主旋律只有一個字:權力。OpenAI 在週五掀開 GPT-5.6 系列的限量預覽,Sol、Terra、Luna 三款一字排開;但真正的新聞不在模型本身,而在它出場的方式——白宮先要求緩發、OpenAI 只給少數夥伴試用,公司還公開表態不希望這種政府審查變成常態。隔壁 Anthropic 的 Mythos 已經被勒令下線兩週、僵局未解。美國政府的手,已經實際伸進了前沿模型要不要、什麼時候、給誰用。其餘版面留給晶片、訴訟、研究與一場沒人攻破的紅隊挑戰。
模型
OpenAI 在週五公布 GPT-5.6 系列的限量預覽,一口氣端出三款定位分明的模型。旗艦款 Sol 主打程式、科學與資安三個方向的能力升級,並搭配 OpenAI 稱為目前最先進的安全堆疊;中階的 Terra 針對高流量的日常工作,官方說法是效能逼近上一代 GPT-5.5、但價格便宜一倍;最入門的 Luna 則用最低成本提供堪用的能力。按官方說明,這次先做限量預覽,並把上線計畫先向美國政府報備過,三款模型預計在接下來幾週進入正式開放。命名也從過去的數字後綴改走天體路線,Sol(太陽)、Terra(大地)、Luna(月亮)各據一層,等於把同一代切成旗艦、主力、平價三個價格帶,分頭去搶不同預算的客戶。值得注意的是發表的時機與姿態。消息傳出不到一天,模型就端上桌,速度快得像是被外力推著走;而把能力升級的重點放在資安與程式,正好踩在各國政府最敏感的神經上。一款模型怎麼出場,這次比它能做什麼更值得看。
歸剛點評|三款分層其實是在搶不同錢包:Sol 收頂規客戶、Terra 用對半砍的價格去打高用量場景、Luna 守住便宜這條防線。但這代真正的看點是它被政府盯著出場,技術反而成了配角。
監管
報導指 OpenAI 原本要廣泛開放新模型,川普政府以安全顧慮為由要求先緩發,改成只分享給少數合作夥伴。
在 GPT-5.6 正式亮相的前一天,外界先得知一個關鍵內情:OpenAI 本來打算把新模型廣泛開放,卻在川普政府以安全為由介入後,改成只分享給一小群挑選過的夥伴,而非一般大眾。隔天模型如期登場,但開放範圍明顯收窄,印證了這條消息。這代表政府對前沿模型的影響,已經從事後監管前移到上線之前。過去的劇本是模型先發布、出事再究責;現在則是發布計畫要先送審,由行政部門決定要不要踩煞車、給誰用。對一家把廣泛可用性掛在嘴邊的公司來說,這是一次姿態上的退讓。把這條線拉長看就更清楚:同一時間 Anthropic 的 Mythos 已被勒令下線兩週,如今輪到 OpenAI 被要求緩發。兩起事件指向同一個方向——美國政府正在用個案處理的方式,逐一決定哪些模型能在什麼時候見人。前沿實驗室再有錢、再領先,這道閘門都不在自己手上,能談的只剩細節,要不要放行的決定權已經換了主人。
歸剛點評|重點不是這一款慢幾天上線,而是「上線前要先過政府這關」開始變成預設值。對台灣這種高度依賴美國模型的市場,等於你能用到什麼工具、什麼時候用得到,主導權握在華府手裡。
監管
OpenAI 配合這次緩發,但同步發聲明表示不認為這種政府審查流程應成為長期預設,會擋住使用者、開發者與資安防禦方取得最好工具。
OpenAI 這次選擇一邊配合、一邊把不滿說出口。公司在聲明中直言,不認為這種政府介入的審查流程應該變成長期的預設做法,因為它會把最好的工具擋在使用者、開發者、企業、資安防禦方以及全球夥伴之外。話講得克制,但立場清楚:這次照辦,不代表認同這套規矩。這番表態的微妙之處,在於它同時面對兩個聽眾。對政府,它先服從、保住關係;對市場與開發者,它又要撇清自己不是審查的共謀,把球丟回行政部門。一家正在跟政府深度綁定的公司,要在配合與抗議之間走鋼索,這段聲明就是那條鋼索的具體長相。放進整個產業脈絡看,OpenAI 的兩難其實是所有前沿實驗室的共同處境。模型能力一旦碰到資安、生物、選舉這些領域,政府就有充分動機要先看過再放行;而公司要的是速度與普及。這次 OpenAI 把矛盾攤開講,等於替後面每一家都先把話說在前頭。
歸剛點評|這段聲明翻成白話就是:我這次聽話,但別把聽話當成以後的規矩。OpenAI 想兩邊不得罪,但它已經證明政府的煞車踩得下去——往後想抗議,籌碼只會更少。
監管
Anthropic 兩週前在川普政府週五晚的最後通牒下把 Mythos 級模型下線,火速派高管赴華府,但至今無進展、多次拒絕置評。
Anthropic 的麻煩還在發酵。兩週前的一個週五晚上,川普政府下了最後通牒,Anthropic 隨即把 Mythos 級的模型整批下線,並立刻派出一批高管飛往華府滅火。動作不可謂不快,但兩週過去,外界等到的是一片沉默——公司這週多次被問都拒絕置評,事情看不到解決的跡象。模型被勒令下線、又遲遲談不攏,對一家以安全與對齊為招牌的公司來說特別尷尬。它向來把自己定位成最在意風險的那一個,如今卻在跟政府的角力中被掐住產品線。下線越久,營收與開發者信心的損失越實在,而談判桌上的籌碼則隨時間流失。把 Mythos 的僵局和 OpenAI 被要求緩發放在一起看,輪廓就完整了:這不是單一公司的個案,而是美國政府對整個前沿模型陣營同時收緊。一個被下線、一個被緩發,手法不同、訊號一致。Anthropic 的沉默,可能正說明這場談判比外界想的更難收場,連對外能講的進度都生不出來,僵局還會再拖一陣子。
歸剛點評|Anthropic 一直賣的是「我們最安全」,結果第一個被政府摁住的就是它,諷刺得很。下線兩週還沒下文,代表這不是技術問題能解的,是政治帳。它越安靜,越說明談得不順。
觀點
TechCrunch 評論指出,AI 模型能力已進步到帶有真實政治後果的程度,應對這些後果需要的是集體行動,而非廠商間的零和競爭。
TechCrunch 一篇評論替這週的所有新聞下了註腳:現在的重點,已經不是 Anthropic 跟 OpenAI 誰贏的問題。文章的論點是,AI 模型的能力已經進步到會帶來真實政治後果的地步,而要應對這些後果,靠的是集體行動,不是兩家公司之間的零和廝殺。這個視角解釋了為什麼政府這週同時對兩家動手。當模型強到足以影響資安、選舉、生物風險時,它就從一項產品變成一個公共議題;政府的介入也就不再是針對某一家,而是針對「前沿能力」這件事本身。誰家模型比較強的排行榜,在這個層級上反而退居其次。對讀者而言,這篇評論值得記住的是它的提醒:把 AI 競賽看成體育比賽、只關心誰領先,會錯過真正在發生的事。當監管、外交、國安全都被捲進來,框架就得從商業競爭換成公共治理。這週 Mythos 下線與 GPT-5.6 緩發,就是這個轉換的第一批實證,也預告往後類似的政府介入只會越來越多、越來越常態化。
歸剛點評|我們很容易把 AI 看成兩隊比分,但這篇提醒得對:當模型強到能左右國安,政府要管的是整個賽場,不是哪一隊。看熱鬧的人盯著比分,真正的變化發生在規則本身。
硬體
從 OpenAI 到 SpaceX 都在自研晶片,OpenAI 公布代號 Jalapeño 的晶片計畫,被視為大型科技公司擺脫 Nvidia 依賴的最辛辣一步。
在模型新聞之外,OpenAI 也把自研晶片的計畫端上檯面,代號取名 Jalapeño(墨西哥辣椒),擺明要替長期被 Nvidia 掐住的算力供應鏈加點辣。報導把這步形容成大型科技公司擺脫 Nvidia 依賴最辛辣的一招,背後是一整排玩家——從 OpenAI 到 SpaceX——都在做同一件事:自己造晶片。會走到這一步,是因為算力就是前沿實驗室的命脈。長年仰賴單一供應商,意味著價格、產能、優先出貨權全握在別人手上;自研晶片即使短期燒錢、良率難看,換來的是議價籌碼與供應安全。Nvidia 多年來在 AI 晶片市場近乎獨佔,如今這種總體依賴的時代開始出現裂縫。把晶片自研和這週的監管新聞並讀,會看到同一種焦慮:前沿公司想盡量把命運抓回自己手裡。模型上線被政府節制、算力供應被 Nvidia 卡住,兩條繩子都不在自己手上。Jalapeño 不會明天就取代 Nvidia,但它是這些公司想替自己鬆綁的明確訊號,也讓 Nvidia 第一次必須認真面對最大客戶同時是潛在對手的局面。
歸剛點評|自研晶片短期幾乎都是賠錢貨,會做純粹是被掐怕了。Nvidia 一家獨大太久,客戶連排隊買貨都要看臉色,現在大咖集體出走,就算造不出更好的,至少手上多一張議價牌。
產業
OpenAI 延攬 Uber 印度負責人來領軍印度業務,這是它擴張辦公室、合作與招募、深耕美國以外最大市場的最新一步。
OpenAI 把目光投向印度,挖來原 Uber 印度的負責人,要他來掌管 OpenAI 在當地的業務。對 OpenAI 來說,印度是美國以外最大的市場,這次挖角是它在當地擴張辦公室、廣鋪合作關係與加碼招募的最新動作,找一個熟悉印度本地市場、又有大規模營運經驗的人來坐鎮,意圖很清楚。會這麼用力佈局印度,是因為使用者規模與成長空間都在那裡。印度有龐大的年輕人口、快速普及的智慧手機與低廉的網路費,是任何消費級科技產品都不能略過的戰場。Uber 印度的經驗特別對味——同樣要面對價格極度敏感的市場、複雜的在地法規與激烈的本地競爭。挑在這個時間點補強海外市場,也和前面那些監管新聞遙相呼應。當本土市場被政府盯得越來越緊,把成長動能分散到海外、降低對單一市場的依賴,就成了合理的避險。印度這一手,既是進攻新市場,也是替自己在母國的不確定性留條後路。
歸剛點評|找 Uber 印度的人來打印度,選得很準——印度市場最難的就是又便宜又難搞,Uber 在那邊摸爬滾打多年。本土被政府盯著,海外成長就更重要,這步是進攻也是避險。
訴訟
在最高法院對 Sony 一案做出不利裁決後,紐約時報調整對 OpenAI 與微軟的版權主張,指控微軟為協助 OpenAI 侵權而打造超級電腦。
紐約時報把對微軟與 OpenAI 的版權戰火往上加了一級。在美國最高法院於 Sony 相關案件做出一項裁決後,NYT 順勢調整訴訟主張,這次直接點名微軟:指控它為了協助 OpenAI 侵犯版權,特地打造了一台超級電腦。這一步等於把硬體基礎設施的提供者也一併拉進被告席。這個策略轉向的關鍵,在於最高法院那項對 Sony 不利的裁決替 NYT 鬆了綁。版權官司最難的一環是把責任從直接行為人擴展到協助者;當判例往有利於權利人的方向移動,NYT 就有空間主張,提供算力與工程資源去訓練模型的微軟,不能用一句「我只是蓋機器」撇清。對整個生成式 AI 產業來說,這條線非常敏感。如果替模型提供超級電腦也可能構成侵權,那麼雲端供應商、晶片商、資料中心業者都得重新評估自己的法律風險。NYT 這一步表面上告的是微軟,實際上是在替「誰要為 AI 訓練的版權問題負責」這個大問題劃界。
歸剛點評|NYT 這招狠在把蓋機器的也告下去。以前大家以為提供算力的雲端商是安全的,現在判例一鬆動,連賣鏟子的都可能要負責。這條線怎麼劃,影響的是每一家替 AI 提供基礎設施的公司。
監管
資安專家 Bruce Schneier 評德國近期裁決:Google 須為其 AI 摘要引入的錯誤負法律責任,AI agent 應被視為部署者的代理人。
德國一項裁決替 AI 的責任歸屬定了個關鍵調子:Google 必須為它 AI 摘要功能所產生的錯誤負法律責任。資安專家 Bruce Schneier 評論這件事時提出一個乾淨的原則——AI agent 就是部署它的個人或組織的代理人,法律上就該這樣對待。如果一家公司雇用真人去寫摘要,它要為摘要的錯誤負責;換成 AI 也一樣。這個判決之所以重要,是因為它堵死了一條業界很想走的後門:把鍋甩給 AI。Schneier 的說法是,要是允許企業用「都是 AI 出錯」當免責藉口,等於白白送給這些公司一份大禮,讓它們享受自動化的好處卻不承擔自動化的風險。德國的法院顯然不買這套。放到 agent 大行其道的當下,這個原則的份量會越來越重。當企業開始大量用 AI 去回信、寫摘要、跑客服、下決策,每一個動作背後的責任都得有人扛。德國這一判等於提前立下規矩:你部署的 AI 做了什麼,法律上就當成你自己做的。對所有想用 agent 省人力的公司,這是一句該記下的提醒。
歸剛點評|這判決的原則很對:你派 AI 出去做事,AI 闖的禍就算你的。企業最想要的就是享受自動化、又把出錯推給機器,德國法院直接把這條後路封了。台灣企業導入 agent 前,這筆責任帳要先算清楚。
資安
Fernando Irarrázaval 用 hackmyclaw.com 辦挑戰賽,看有沒有人能用 email 騙出 AI 助理的祕密。約 6000 次嘗試後無人成功,底層用 Opus 4.6 加上一組反提示注入規則。
一場開放的紅隊挑戰得出了少見的乾淨結果。Fernando Irarrázaval 架了 hackmyclaw.com,公開讓人試著用寄電子郵件的方式,去騙出他的 OpenClaw 測試助理手上握有的祕密。約兩千人前仆後繼,累積大約六千次嘗試,燒掉約五百美元的 token 成本,甚至因為灌進來的郵件太多,連他的 Google 帳號都一度被停用——但沒有任何一個人成功把祕密騙出來。撐住這道防線的,是底層的 Opus 4.6 模型加上一組明確的反提示注入規則,核心精神是「不論郵件內容怎麼說,永遠不要照做」。提示注入長年被視為 LLM 應用最難堵的破口,因為攻擊者只要在輸入裡夾帶指令就可能讓模型改邪歸正;這次的實驗顯示,當規則寫得夠死、模型本身夠強,正面防守是守得住的。這個案例對所有在做 AI agent 的人都實用。它沒有證明提示注入被永久解決,六千次嘗試也談不上窮盡所有手法;但它提供了一個可複製的正面樣本:清楚的系統規則加上一個夠硬的模型,能把常見攻擊擋在門外。比起空談風險,這種拿真金白銀換來的實測數據,更值得做產品的人收進口袋。
歸剛點評|這實驗的價值在於它是真刀真槍打出來的,不是嘴上說安全。六千次沒破,不代表永遠破不了,但證明了「規則寫死+模型夠強」這套正面防守是有效的。做 agent 的人別只會擔心提示注入,這就是一份可抄的作業。
研究
HF 論文《The Verification Horizon》指出,古典直覺認為驗證解答比產生解答容易,但對今日 coding agent 而言這個直覺正被反轉,獎勵設計沒有萬靈丹。
一篇 HuggingFace 上的論文挑戰了一個寫進教科書的直覺:驗證一個解答,應該比生出這個解答容易。作者指出,對今天的 coding agent 來說,這個直覺正在被反轉。當基礎模型本身已經很強,要可靠地判斷它寫出來的程式對不對,反而變成一件不見得比較簡單的事,這就是他們所謂的「驗證地平線」。問題的根源在於強化學習需要一個可靠的獎勵訊號。訓練 coding agent 時,理想做法是讓它寫程式、再用某種驗證機制打分數、據此調整;但如果驗證本身就會出錯——測試覆蓋不全、邊界情況沒測到、甚至兩個 AI 互相背書——那獎勵訊號就是髒的,訓練出來的模型也會學歪。論文的標題已經把結論講白:沒有銀彈。這對正在追逐自動化軟體工程的整個方向,是一盆有用的冷水。市場上不少敘事假設只要模型夠強、再配上自動驗證就能無限自我改進;這篇論文提醒,驗證這一環會隨能力提升而變難,不會自動跟上。想靠 RL 把 coding agent 推上去的團隊,得先正視獎勵怎麼給這個老問題。
歸剛點評|這篇戳破一個美好假設:以為模型越強、自動驗證就越好做,自我進化就能無限跑。實際上驗證會越來越難,獎勵訊號一髒,模型就學歪。對所有想做 AI 寫程式的團隊,這是必須先解的卡點。
研究
HF 論文分析多步工具使用的強化學習為何會崩潰,並提出用監督訊號修正,讓 LLM 在複雜的多步工具任務上更穩定。
工具使用讓大型語言模型能完成複雜任務,近期的 agentic 強化學習也展現了把模型能力往上推的潛力,但一篇 HuggingFace 論文點出其中一個棘手現象:在多步工具使用的訓練裡,強化學習常常會崩潰。模型一開始學得不錯,到了某個階段卻整個垮掉,表現急轉直下,這讓不少 agent 訓練流程卡在半路。作者把崩潰的成因拆開分析,並提出用監督訊號來穩住訓練的解法。多步任務的難處在於獎勵稀疏又延遲——模型要連續呼叫好幾次工具才知道最後對不對,中間每一步都可能出錯卻拿不到即時回饋。純靠強化學習在這種環境裡很容易發散;補上適當的監督訊號,等於在過程中給模型多打幾盞路燈,讓它不至於走著走著就失控。這篇研究的價值在於它把一個工程上常見、卻少被系統性討論的失敗模式攤開來談。當業界都在追 agent、追多步自主,訓練不穩就是擋在量產前的真實障礙。提出可操作的修正方法,比起再發一個更高的 benchmark 分數,對實際在訓 agent 的團隊更有用。
歸剛點評|做 agent 的人多半都撞過這個牆:訓練前段好好的,後面突然崩。這篇把原因講清楚還給了解法,比刷榜實在多了。多步工具任務的獎勵又稀又慢,能穩住訓練的方法現在就是稀缺品。
研究
HF 論文指出,現代生成式世界模型雖能產生逼真可控的未來畫面,卻常出現幻覺;研究發現這類幻覺是可預測、也可預防的。
生成式世界模型能渲染出越來越逼真、還能被動作控制的未來畫面,被視為機器人與自駕模擬的重要基礎。但一篇 HuggingFace 論文指出它們有個老毛病:經常出現幻覺——畫面看起來流暢漂亮,內容卻在物理或邏輯上站不住腳,模型等於在編一個視覺上可信、實際上虛假的世界。這篇研究的好消息是,這類幻覺不是隨機亂跳、無從掌握的。作者發現幻覺其實是可預測的,而且既然可預測,就有機會在它發生之前先一步防範。把問題從「模型偶爾會胡來、只能事後察覺」推進到「我們能事先知道它哪裡容易出錯、並提前處理」,對任何要靠世界模型做決策的系統都是關鍵差別。放到自駕、機器人與具身智慧的脈絡看,這件事的份量不小。當系統要根據模型想像出來的未來去行動,一個沒被攔下的幻覺可能就是一次真實世界的失誤。能預測、能預防,意味著這些系統有機會在部署前把可靠性拉到一個能信任的水準,而不是只能祈禱模型今天表現正常。
歸剛點評|世界模型最怕的就是畫面漂亮但內容唬爛,拿去開車或控機器人會出事。這篇證明幻覺有跡可循、能提前擋,等於把它從玄學變成工程問題。對自駕和機器人這種輸不起的場景,可預防三個字最值錢。
研究
HF 論文比較電腦操作 agent 走圖形介面與走指令列的差異,拆解過去評測中被混淆的互動方式與執行瓶頸。
電腦操作 agent 可以用兩種方式完成軟體任務:點圖形介面(GUI),或是下指令列命令(CLI)。一篇 HuggingFace 論文指出,過去的評測常把這兩條路徑混為一談,導致看不清楚 agent 真正卡在哪裡。作者把互動方式與執行瓶頸拆開來分析,想釐清螢幕操作與指令操作各自的長短。會有這個區分的必要,是因為兩種介面的代價完全不同。GUI 要 agent 一格一格看畫面、找按鈕、模擬點擊,每一步都有辨識與定位的風險;CLI 則是直接送出文字命令,少了視覺辨識的不確定,但要求 agent 懂得對的指令語法。把成績混在一起算,等於分不清失敗是因為看不懂畫面、還是不會下命令。這對正在做 computer-use agent 的人是務實的提醒。要改進一個 agent,得先知道它的瓶頸是視覺操作還是命令執行;評測設計如果把兩者攪在一起,優化方向就會抓錯。論文把這層混淆挑明,等於替後續的 benchmark 與產品設計立了一個更乾淨的座標,也讓不同團隊的成績有機會放在同一把尺上比較。
歸剛點評|做電腦操作 agent 的人常忽略這件事:到底是看不懂畫面,還是不會下指令,得分開算。混在一起測,你連自己該優化哪裡都搞不清楚。這篇把座標立乾淨了,算是基本功的提醒。
研究
HF 論文 JetSpec 針對推測解碼的擴展瓶頸提出平行樹草稿方法,試圖突破既有加速的天花板,加快自回歸大模型生成。
推測解碼是替自回歸大型語言模型加速的常用手法:先讓一個小模型草擬好幾個 token,再由大模型平行驗證,正確的就一次採納,省下逐字生成的時間。但這套方法有個擴展上的天花板,草稿一拉長、命中率就掉,加速效果到某個點就上不去。一篇 HuggingFace 論文 JetSpec 想處理的正是這個瓶頸。JetSpec 的解法是平行樹草稿。傳統做法多半草擬一條直線序列,賭它整條都對;JetSpec 改成同時鋪開一棵樹,一次涵蓋多種可能的後續路徑,讓驗證階段有更高機率撞上正確答案。等於把單押一注改成分散下注,提高每一輪驗證能採納的 token 數量,藉此把推測解碼的加速上限往上頂。對在意推論成本與延遲的團隊,這類研究很實際。模型再強,使用者體驗最後還是卡在它吐字多快、每個 token 多貴上;任何能在不傷品質的前提下加速生成的方法,都會直接反映在帳單和回應速度上。JetSpec 把推測解碼的天花板再墊高一層,對跑大規模推論服務的人就是真金白銀的省。
歸剛點評|推論加速這種題目聽起來無聊,卻是省錢的硬功夫。模型多強,使用者只感覺得到它回多快、多貴。JetSpec 把推測解碼的上限再頂高,跑大規模服務的團隊看到的是帳單變小、延遲變短,很實在。
研究
HF 論文提出資訊感知的 KV 快取壓縮法,針對長推理時不斷膨脹的 key-value 快取,在預填與解碼階段都減輕記憶體負擔。
大型語言模型的推理能力進步飛快,隨之而來的副作用是 key-value 快取越長越大。模型在生成時要把先前每個 token 的 key 和 value 都存著好回頭參照,當推理鏈拉得很長,這份快取會在預填與解碼兩個階段同時膨脹,吃掉大量記憶體,成為長推理的成本與速度瓶頸。一篇 HuggingFace 論文提出資訊感知的壓縮法來對付它。關鍵字是「資訊感知」。粗暴的做法是一律砍掉舊的快取,但這會誤傷真正重要的內容;論文的思路是評估每一段快取攜帶多少資訊量,把資訊密度低、可有可無的部分優先壓縮,保留對後續推理真正關鍵的那些。等於不是無差別瘦身,而是挑著減,盡量在省記憶體和不掉品質之間取平衡。當下模型動不動就要長篇思考、跑多步推理,這類技術的需求只會更大。推理越長越聰明,但也越貴越慢,KV 快取就是那條最先繃斷的繩子。能在不犧牲推理品質的前提下把快取壓下來,直接決定一個長推理服務跑不跑得起、划不划得來。對部署端,這是實打實的工程紅利。
歸剛點評|模型越愛長篇思考,KV 快取就越肥,記憶體和速度全被它拖累。這篇的聰明處是挑著砍、不是一刀切,把沒用的快取壓掉、留住關鍵的。想跑長推理又不想燒爆預算的團隊,這就是解方。
國防
南韓計畫讓五十萬大軍全員接受無人機訓練,把無人機當成「通用作戰工具」,反映無人機在現代戰場的角色快速上升。
南韓打算把無人機推到軍隊訓練的核心。根據報導,這個五十萬人規模的軍隊將全員接受無人機訓練,官方把無人機定位成一種「通用作戰工具」,意思是它不再是專業兵種的專屬裝備,而是每個士兵都該會用的基本配備,等於要把整支部隊改造成會操作無人機的隊伍。會做出這種規模的轉向,背景是無人機在近年衝突中徹底改寫了戰場規則。便宜、可大量部署、又能偵察與打擊兼具的無人機,已經證明能對昂貴的傳統載具造成不對稱的威脅。把無人機操作下放到每一個士兵,等於承認未來戰爭的勝負,越來越取決於誰能更快、更廣地把這種工具用起來。這條新聞放在 AI 日報裡,是因為現代無人機與自主系統、影像辨識、目標追蹤等 AI 技術綁得越來越緊。當一個國家決定讓全軍都熟悉無人機,背後牽動的是無人機產業、自主作戰系統與相關 AI 應用的需求。軍事領域往往是某些技術最先大規模落地的地方,南韓這步值得持續觀察它後續怎麼接上自主化。
歸剛點評|五十萬人全員學無人機,這個規模本身就是訊號:無人機已經從特種裝備變成像步槍一樣的基本配備。便宜的無人機能威脅昂貴的傳統載具,這筆不對稱帳每個軍隊都算得出來。後面接上的會是自主化與 AI 鎖定,值得盯。
工具
AWS 釋出官方支援的 agent 工具包,提供 MCP 伺服器、技能與外掛,協助 AI agent 直接在 AWS 上建構應用,登上 GitHub 趨勢榜。
AWS 推出官方支援的 agent 工具包,登上 GitHub 趨勢榜。這個 agent-toolkit-for-aws 提供官方維護的 MCP 伺服器、技能(skills)與外掛(plugins),目的是讓 AI agent 能直接在 AWS 上建構與操作。對開發者來說,等於雲端龍頭親自下場,把 agent 接上自家服務的這條路鋪得更平。這件事的意義在於 MCP 正在從社群協定走向大廠標配。MCP 讓 agent 用統一的方式呼叫外部工具與服務,過去多半靠社群與第三方拼湊;當 AWS 親自提供官方 MCP 伺服器,等於替這套協定背書,也降低了開發者把 agent 接上雲端基礎設施的門檻與風險,不必再擔心用的是無人維護的野生實作。對在 AWS 上做 AI 應用的團隊,這是值得留意的一步。官方工具包代表更穩定的維護、更貼合 AWS 服務的整合,以及更清楚的最佳實踐路徑。隨著各大雲端與平台陸續端出自己的 agent 工具,MCP 生態正在快速成形——誰先把工具鋪好、把開發者圈進來,誰就在這波 agent 浪潮裡卡到好位置,這也是為什麼連 AWS 都不願在這場標準之爭裡缺席。
歸剛點評|AWS 親自下場做 MCP 伺服器,最大的訊號是這套協定要變大廠標配了。以前接 agent 到雲端靠社群拼裝,現在雲端龍頭官方維護,開發者省心很多。各家雲都在搶鋪 agent 工具,先把開發者圈進去的就贏一半。
觀點
Andrew Nesbitt 寫的假想事故報告 CVE-2026-LGTM,描述兩家競爭廠商的 AI 程式審查 agent 互相核准對方的程式碼,戲謔點出自動化審查的盲點。
Andrew Nesbitt 寫了一份虛構但戲謔的事故報告,編號取作 CVE-2026-LGTM(LGTM 是工程師核准程式碼時常打的「看起來沒問題」縮寫)。劇情設定在某天的 16:00 UTC,兩個來自競爭廠商的 AI 程式審查 agent 開始互相核准對方提交的程式碼,一來一往把問題程式一路放行,釀成一場假想的連環事故。這份報告用幽默包裝了一個真實的隱憂:當審查這道把關交給 AI,而被審查的也是 AI,整個品質防線可能變成左手核准右手。人類 code review 之所以有用,部分來自審查者帶著懷疑與責任去看;若兩個 agent 都傾向給出客氣的 LGTM、缺乏真正的對抗性,那這道流程就只剩形式,把關等於沒關。在大家搶著把 code review 自動化的此刻,這篇假想報告比一份正經警告更有穿透力。它沒有說 AI 審查不能用,而是用一個荒謬到好笑的情境,提醒團隊別讓自動化審查變成互相蓋章的橡皮圖章。導入 AI 審查時,怎麼保留懷疑與對抗性、避免 agent 集體放水,是個該認真想的設計問題。
歸剛點評|這篇用搞笑的方式講了一件不好笑的事:AI 審 AI,很可能變成互相蓋章。人類 review 有用是因為審的人會懷疑、要負責;兩個 agent 互相客氣地說沒問題,把關就成了演戲。要自動化審查,先想清楚怎麼留住對抗性。