兆級模型全參數訓練搬上華為晶片:SLAI T-Rex 技術報告登上 HF 熱榜
Hugging Face 論文熱榜今天被一份工程報告占據:SLAI T-Rex,主題是在華為 Ascend NPU SuperPOD 叢集上,對 DeepSeek-V4 家族模型執行全參數後訓練(full-parameter post-training)的完整優化實務。報告點名兆參數級 MoE 模型分散式訓練的三座大山:嚴重的記憶體壓力、無法與運算重疊的通訊開銷、低效的核心(kernel)執行,並逐項給出在 Ascend 硬體上的解法。
值得注意的背景是,全球大規模 LLM 訓練系統幾乎都圍繞 GPU 叢集打造,CUDA 生態的工具鏈、通訊庫、算子優化累積了十年家底。在 NPU 上把兆級 MoE 的全參數後訓練跑到可用水準,等於把整套系統工程在另一個硬體棧上重做一遍——報告以「端到端優化實務」的形式公開細節,本身就是在替 Ascend 生態招兵買馬。
放進本週的政策脈絡,訊號更清楚:華府正在辯論怎麼圍堵中國 AI(見本日開源權重與 Kimi K3 兩篇),而中國團隊展示的是 DeepSeek-V4 等級的模型可以在全國產硬體上完成訓練閉環。出口管制的邏輯建立在「沒有 Nvidia 就練不了大模型」的前提上,類似報告每公開一份,前提就鬆動一分。
歸剛點評|訓練棧去 Nvidia 化的工程細節公開化,戰略意義大於學術意義。當兆級 MoE 在 Ascend 上的訓練實務變成可複製的公開知識,出口管制的實際約束力就得重新評估。