世界動作模型是什麼

世界動作模型 (world action model,WAM) 是一種用於機器人技術的 AI 模型,能同時學習世界可能如何變化,以及機器人可以採取哪些動作來影響這些變化。WAM 透過預測未來狀態並將其與動作相互對應,協助機器人在面對新任務或新環境時,更妥善地進行規劃與調適

世界動作模型如何運作?

WAM 採用與傳統機器人 AI 截然不同的機制。目前許多新一代通用型機器人 AI 系統都是視覺-語言-動作 (VLA) 模型,例如 NVIDIA Isaac GR00T 模型,這類模型結合視覺與語言理解能力,直接預測動作。雖然 VLA 能受益於網際網路規模的廣泛知識,但其訓練方式通常是將觀察結果與指令對應至動作,而非明確建立世界時空物理動態的模型。

世界動作模型可彌補這項不足,同時學習預測未來的世界狀態 (世界將呈現何種樣貌),以及影響世界並使其達到該狀態所需的機器人動作。影片是核心學習訊號,因為影片能提供豐富且自然可取得的資訊,呈現物理世界如何隨時間演變。WAM 透過大規模影片資料進行訓練,包括網路影片與第一人稱視角的人類活動影片,藉此建立內化的物理、運動與互動模型,並能廣泛遷移至新的任務與環境。

在實際運作中,WAM 採用單一統一的端對端模型,具體而言是一種聯合影片-動作擴散 Transformer (Joint Video-Action Diffusion Transformer,DiT),可同時預測未來的潛在視覺 token 與對應的機器人動作。這種聯合建模方式並未將世界建模與動作預測視為循序進行的階段,而是確保兩種模態深度整合,此特性稱為影片-動作對齊。透過同時預測動作與視覺 token,模型可以減少不符合物理現實的動作,或提高選擇可行動作的傾向。

系統在執行時會接收文字指令與初始觀察結果,預測預期狀態轉換的壓縮表示,並直接從中產生機器人控制指令,全程無須產生完整影像。

DreamZero

DreamZero:世界動作模型即為零樣本策略

瞭解 NVIDIA 世界動作模型如何透過聯合預測影片與動作,在各種不同環境中執行零樣本任務。

應用與使用案例

世界動作模型非常適合用於機器人必須執行廣泛且難以預測之實體任務的應用情境,尤其是在住家、倉庫或公共空間等非結構化環境中。

零樣本泛化

WAM 可透過在潛在空間中想像實體狀態的轉換,並執行相應的動作控制指令,協助機器人泛化至機器人訓練資料中從未出現過的任務,例如解開鞋帶或熨燙衣物。

人類到機器人遷移

由於 WAM 使用網路規模的影片進行預訓練,只需觀看短短 10 至 20 分鐘的第一人稱視角人類活動影片,就能提升未見任務的執行效能,而且無須任何動作標籤。

自適應互動

類人形態特別適合 WAM,可直接運用大量人類影片資料,將人類動作的先驗知識轉化為真實機器人的動作。

快速適應不同機器人形態

部署新機器人時,WAM 只需使用短短 30 分鐘的多樣化自由操作資料,就能適應新的硬體,同時保留可跨不同機器人形態運用的零樣本任務知識。

世界動作模型有哪些優勢?

零樣本泛化

WAM 從大規模影片資料中學習物理動態,而非記憶重複的示範。因此,WAM 無須額外訓練,即可泛化至全新的任務與環境。

降低訓練資料需求

WAM 可運用網路影片,大幅降低訓練成本。研究顯示,只需短短 30 分鐘的自由操作資料,即可實現跨機器人形態遷移,無須使用大量遙控操作資料集。

透過影片預先訓練擴展智慧能力

隨著影片基礎模型的品質與能力持續提升,WAM 也能直接受益。更準確的物理預測,可轉化為更出色的真實世界機器人效能。

可解釋性與可除錯性

由於 WAM 會先產生視覺預測再採取動作,開發人員可以檢視預測畫面,以找出問題所在。相較於黑箱式 VLA,開發人員現在能更快速地判斷問題出在世界模型還是動作處理流程。

挑戰與解決方案

世界動作模型是一項快速發展的技術,在廣泛部署之前仍有數項挑戰有待克服。

推論速度與即時控制

在推論時預測潛在視覺 token 需要大量運算資源,因此限制了系統即時因應動態環境的能力。早期 WAM 系統每個推論週期需要數秒才能完成。

解決方案

  • 減少擴散步驟
  • 非同步推論技術
  • 模型蒸餾與邊緣硬體最佳化,可實現 7 Hz 的即時閉迴路控制

物理環境基礎與 3D 準確度

使用單眼 (2D) 影片資料進行預先訓練,可能導致深度與空間理解不夠精準,即使預測結果看似正確,機器人仍可能超出或未達實體目標位置。

解決方案

  • 將深度和立體視覺感測整合至訓練與推論流程
  • 持續研究改進空間基礎理解的技術

特定機器人形態的適應

將針對某種機器人訓練的模型調整至不同機器人外形規格時,仍需要進行微調,而如何在差異極大的機器人形態之間實現無縫遷移,仍是尚待解決的挑戰。

解決方案

  • 新興的跨機器人形態遷移技術
  • 使用少量自由操作資料,針對新的機器人平台進行微調
  • 僅使用 10 至 20 分鐘影片,即可適應新的機器人形態
  • NVIDIA Isaac GR00T 2 是以 DreamZero 研究為基礎打造的新一代機器人基礎模型,採用世界動作模型架構。與領先的視覺-語言-動作模型相比,它能讓機器人在新環境中成功完成新任務的機率提高至兩倍以上。GR00T 2 預計於今年底前推出,目前在通用型機器人策略的 MolmoSpaces 與 RoboArena 排名皆位居第 1。

常見問題

NVIDIA Isaac GR00T 等 VLA 會使用靜態影像-文字資料集進行預先訓練,並直接根據視覺與語言輸入預測動作。這類模型在語意層級具有良好的泛化能力,例如辨識物體及遵循指令,但面對訓練期間未曾見過的新型態實體動作時,往往難以應對。WAM 則透過單一統一模型,同時預測未來的影片畫面與相應的機器人動作,並從大規模影片預先訓練中習得時空物理的先驗知識。

WAM 透過多樣化的大規模影片資料學習物理動態,而非記憶特定任務的機器人示範,藉此實現零樣本泛化。WAM 的訓練目標是預測世界在各種動作與環境下如何產生視覺變化,而非僅將狀態與動作配對,因此能學習可遷移的動作先驗知識,無須額外訓練即可應用於全新的任務。

是。世界動作模型之所以能泛化至未見過的任務,是因為其核心訓練目標在於預測世界如何產生視覺變化,讓模型能廣泛理解物理運動,而不受限於機器人訓練期間見過的任務。這是 WAM 相較於 VLA 的一項根本優勢,因為 VLA 難以泛化至專家示範資料分布以外的情境。

相較於 VLA 基準模型,WAM 能帶來顯著的效能提升,因為它從多樣化且非重複的影片資料中學習物理動態,而無須仰賴大量結構化的示範資料集。因此,WAM 能提供更出色的泛化能力、更高的微調資料效率,並能更快速地部署至新的機器人硬體。

其效能會隨影片生成品質直接提升,也就是說,底層影片基礎模型的改進能立即轉化為更出色的機器人效能。

後續步驟

使用 NVIDIA 機器人技術加速自動化

瞭解 NVIDIA 機器人平台如何支援新一代機器人 AI 的開發及部署,包括物理 AI 的基礎模型。

生成式物理 AI 是什麼?

瞭解能生成物理環境並對其進行推理的廣泛 AI 類別,這也是世界動作模型所建構的基礎。

利用世界基礎模型打造物理 AI

探索 NVIDIA Cosmos™ 世界基礎模型如何打造物理 AI 基礎設架構,並用於大規模訓練、模擬及部署機器人系統。