世界動作模型 (world action model,WAM) 是一種用於機器人技術的 AI 模型,能同時學習世界可能如何變化,以及機器人可以採取哪些動作來影響這些變化。WAM 透過預測未來狀態並將其與動作相互對應,協助機器人在面對新任務或新環境時,更妥善地進行規劃與調適
WAM 採用與傳統機器人 AI 截然不同的機制。目前許多新一代通用型機器人 AI 系統都是視覺-語言-動作 (VLA) 模型,例如 NVIDIA Isaac GR00T 模型,這類模型結合視覺與語言理解能力,直接預測動作。雖然 VLA 能受益於網際網路規模的廣泛知識,但其訓練方式通常是將觀察結果與指令對應至動作,而非明確建立世界時空物理動態的模型。
世界動作模型可彌補這項不足,同時學習預測未來的世界狀態 (世界將呈現何種樣貌),以及影響世界並使其達到該狀態所需的機器人動作。影片是核心學習訊號,因為影片能提供豐富且自然可取得的資訊,呈現物理世界如何隨時間演變。WAM 透過大規模影片資料進行訓練,包括網路影片與第一人稱視角的人類活動影片,藉此建立內化的物理、運動與互動模型,並能廣泛遷移至新的任務與環境。
在實際運作中,WAM 採用單一統一的端對端模型,具體而言是一種聯合影片-動作擴散 Transformer (Joint Video-Action Diffusion Transformer,DiT),可同時預測未來的潛在視覺 token 與對應的機器人動作。這種聯合建模方式並未將世界建模與動作預測視為循序進行的階段,而是確保兩種模態深度整合,此特性稱為影片-動作對齊。透過同時預測動作與視覺 token,模型可以減少不符合物理現實的動作,或提高選擇可行動作的傾向。
系統在執行時會接收文字指令與初始觀察結果,預測預期狀態轉換的壓縮表示,並直接從中產生機器人控制指令,全程無須產生完整影像。
DreamZero
快速連結
世界動作模型非常適合用於機器人必須執行廣泛且難以預測之實體任務的應用情境,尤其是在住家、倉庫或公共空間等非結構化環境中。
世界動作模型是一項快速發展的技術,在廣泛部署之前仍有數項挑戰有待克服。
NVIDIA Isaac GR00T 等 VLA 會使用靜態影像-文字資料集進行預先訓練,並直接根據視覺與語言輸入預測動作。這類模型在語意層級具有良好的泛化能力,例如辨識物體及遵循指令,但面對訓練期間未曾見過的新型態實體動作時,往往難以應對。WAM 則透過單一統一模型,同時預測未來的影片畫面與相應的機器人動作,並從大規模影片預先訓練中習得時空物理的先驗知識。
WAM 透過多樣化的大規模影片資料學習物理動態,而非記憶特定任務的機器人示範,藉此實現零樣本泛化。WAM 的訓練目標是預測世界在各種動作與環境下如何產生視覺變化,而非僅將狀態與動作配對,因此能學習可遷移的動作先驗知識,無須額外訓練即可應用於全新的任務。
是。世界動作模型之所以能泛化至未見過的任務,是因為其核心訓練目標在於預測世界如何產生視覺變化,讓模型能廣泛理解物理運動,而不受限於機器人訓練期間見過的任務。這是 WAM 相較於 VLA 的一項根本優勢,因為 VLA 難以泛化至專家示範資料分布以外的情境。
相較於 VLA 基準模型,WAM 能帶來顯著的效能提升,因為它從多樣化且非重複的影片資料中學習物理動態,而無須仰賴大量結構化的示範資料集。因此,WAM 能提供更出色的泛化能力、更高的微調資料效率,並能更快速地部署至新的機器人硬體。
其效能會隨影片生成品質直接提升,也就是說,底層影片基礎模型的改進能立即轉化為更出色的機器人效能。