十萬小時真實軌跡餵出來的機器人大腦:小米發布 Xiaomi-Robotics-1
小米發布 Xiaomi-Robotics-1,一個視覺-語言-動作(VLA)基礎模型,主打兩個能力:開箱即用——聽從多樣的語言指令,在沒見過的環境執行各類移動操作(mobile manipulation)任務;快速適配——用極少量微調資料學會新的下游任務。訓練配方分兩階段:預訓練階段灌入廣泛且可泛化的動作生成能力,後訓練階段對齊實際任務。
最搶眼的數字是資料量:超過十萬小時的真實世界軌跡。機器人領域的資料瓶頸眾所周知——語言模型可以吃網路文本,機器人模型得靠真實或模擬的操作資料,而真實軌跡的收集成本極高。十萬小時的量級說明小米把手機與家電供應鏈的製造資源轉進了機器人資料收集,路線與美國同行仰賴模擬資料形成對比。
放在本週脈絡看,機器人基礎模型的軍備賽正在加速:Nvidia 上週推出 4B 參數的邊緣世界模型 Cosmos 3 Edge(見今日開源線),小米用資料量級參戰,加上既有的 Figure、Physical Intelligence 等玩家,VLA 模型的競爭密度已經接近兩年前的 LLM。
歸剛點評:中國廠商在機器人資料上的優勢結構性很強——製造業現場就是資料農場,這點美國實驗室複製不來。台灣供應鏈的位置值得想:代工組裝機器人之外,產線本身的操作資料是不是下一個可以賣的資產?
歸剛點評|十萬小時真實軌跡的資料量級展示了中國製造業轉化為機器人資料優勢的路徑,VLA 基礎模型競爭正式白熱化。