假設一台小車正在房間裡移動。攝影機看到牆、桌腳和門口,控制器現在有兩個選擇:往左轉,或繼續直走。如果系統只能辨認「這是一張房間的圖片」,它還不夠用;真正做決策時,它最好還能估計:直走之後會不會撞上桌腳,左轉之後下一秒大概會看到什麼,以及這兩種路徑哪一個比較接近目標。
World Model 可以先理解成:一個用來表徵環境,並預測環境狀態會如何隨時間與行動改變的模型。 它不一定真的重建出一張完整畫面,也不一定專門服務機器人;重點是系統內部有一個可供預測、模擬或規劃使用的「世界動態模型」。
先記一句:World Model 不是「生成一個世界」這麼簡單,而是讓 Agent 有能力在內部估計「現在是什麼狀態、做了某個 action 之後,接下來可能變成什麼狀態」。
World Model 真正在學的是「狀態怎麼變」
一個環境通常不只包含畫面。對 Agent 來說,它先收到某種 observation,也就是觀測:可能是相機影像、雷達、遊戲畫面、感測器數值,甚至是一組結構化資料。系統再從觀測中形成對目前情況的表示,這通常被叫做 state;如果這個狀態不是直接等於原始資料,而是被壓縮成模型內部的一組特徵,就常會看到 latent state 這個詞。
接著 Agent 做出一個 action。車子轉彎、機械手臂移動、遊戲角色跳躍,都算 action。World Model 的關鍵任務之一,就是根據現在的 state 和 action,預測下一個 state、下一個 observation,或其他和任務有關的訊號,例如 reward。
這個「從現在推到下一步」的部分通常可以叫做 dynamics model 或 transition model。它描述的不是單一物件的標籤,而是環境的變化規律:物體移動後會去哪裡、角色跳出去後會落在哪裡、某個控制輸入會讓系統狀態怎麼改變。
為什麼不直接在真實世界一直試?
因為真實互動通常很貴,而且有些錯誤不能無限重來。機器人撞一次牆可能真的會壞;自駕系統不能靠在道路上大量「試錯」來學危險情境;就算是遊戲,直接和環境互動也可能比在模型內部模擬慢很多。
如果 Agent 已經學到一個夠好的 World Model,它就可以先在內部模擬幾條可能路徑,再選比較合理的 action。這就是 world model 和 planning 很重要的連結。2019 年 PlaNet 的工作便是從影像學習 latent dynamics,再直接在 latent space 裡做 online planning;這種做法不需要每一個候選動作都真的先去環境裡執行。
2018 年 Ha 與 Schmidhuber 的經典 World Models 工作,也展示了類似精神:先用模型學環境的壓縮時空表示,再讓控制策略利用這個內部世界模型做決策。後續 Dreamer 等方法更進一步把「在 latent space 裡想像未來」變成學習 policy 的重要部分。
World Model 不一定要把未來「畫出來」
近年的 World Model 很容易和影片生成綁在一起,原因不難理解:如果模型能根據目前畫面與 action 生成下一幀,而且長時間保持環境的一致性,那確實很像是在模擬世界。Google DeepMind 的 Genie 2 就把 World Model 描述成能模擬虛擬世界,包括執行 jump、swim 等 action 之後的結果。
但這不能反過來變成「World Model = 影片生成模型」。一個 World Model 可以只在 latent representation 裡預測狀態,不把每一步重建成漂亮的 RGB 畫面。對規劃來說,有時模型只需要保留「哪裡能走、物體在哪裡、速度往哪裡變、哪個 action 會失敗」這些對決策有用的資訊,而不需要把牆壁紋理重畫到每一個像素。
所以判斷一個模型是不是 World Model,不能只看它會不會生成影片,而要看它是否真的學到可供推演的環境狀態與動態,以及這些預測能不能被用來模擬行動後果或支援決策。
它和 LLM 到底差在哪?
LLM 的核心訓練形式,是根據前面的 token 預測接下來的 token。從很抽象的角度看,World Model 也常做「根據目前狀態預測下一步」,所以兩者看起來有某種共同語言:都從過去推測未來。
但預測的對象和系統目的不一樣。LLM 的基本序列單位是 token;World Model 更關心環境 state、observation、action 與 transition。當然,現在也有多模態模型、VLA、生成式環境模型,讓這條邊界越來越模糊,一個大型模型甚至可能同時處理文字、影像、動作與狀態。但不能因為 LLM 會回答「球推下桌會掉下去」,就直接等同於它具有可用於控制與規劃的 World Model。
差別可以這樣抓:
LLM:主要學「這段 token 後面通常接什麼」。
World Model:主要學「這個環境在這個狀態下做了這個 action,接下來可能怎麼變」。
World Model 也會「想錯世界」
內部模擬的好處,是便宜、快,而且可以先試很多次;代價則是 Agent 可能開始利用模型的錯誤。如果 dynamics model 對某種情況沒學好,Agent 在內部規劃時可能找到一條「模型覺得超有效、真實世界根本行不通」的路。
而且誤差會累積。只預測下一步錯一點點,連續往後 rollout 很多步之後,就可能完全偏離真實環境。真實世界還有部分可觀測、隨機性、其他 Agent、感測器誤差與環境突然改變等問題,所以 World Model 的難點不只是生成未來,而是知道自己對哪些未來有把握、哪些地方其實不確定。
這也是為什麼實際系統通常不會只靠一個「腦內模擬器」一路做到底。World Model 仍要靠新的 observation 校正狀態,再重新預測;就像人走進一條沒去過的巷子,就算先猜下一個路口在哪,真的看到路牌後還是會更新判斷。
真正重要的是:能不能拿預測來做事
World Model 這個詞現在涵蓋的研究範圍很廣,從 model-based reinforcement learning、機器人控制、遊戲環境,到能生成互動世界的 foundation world model 都有人使用。但它們共同指向的問題很一致:Agent 能不能形成一個關於環境的內部模型,並利用它預測行動後果?
如果只有「看懂現在」,Agent 每走一步都得等世界真的發生後才知道結果;有了 World Model,它才有機會先在內部問:「如果我這樣做呢?」這也是 planning、長期決策和具身智能為什麼一直會碰到 World Model。
資料來源
Ha & Schmidhuber — Recurrent World Models Facilitate Policy Evolution (NeurIPS 2018)
Hafner et al. — Learning Latent Dynamics for Planning from Pixels (ICML 2019)
Google DeepMind — Genie 2: A large-scale foundation world model