什么是世界模型?AI 为什么懂语言却不懂物理
为什么 AI 视频里杯子会穿过桌子?世界模型是什么、和大模型预测下一个词有什么不同、为什么它是机器人和 AGI 绕不开的一环,一文讲清。
看 AI 生成的视频,你大概率见过这类画面:杯子穿过了桌面、人走着走着多了条腿、放下的东西下一秒凭空消失。
画质已经足够以假乱真,物理却不对。这不是渲染精度的问题,而是一个更根本的缺口——模型没有”世界是怎么运转的”这份常识。补上这块的努力,就叫世界模型(World Model)。
一句话理解:在脑子里预演接下来会发生什么
人做任何动作前,脑子里都有一次无声的预演:手一松,杯子会掉下去摔碎;球滚到桌沿,会掉。你不需要真的试一次才知道结果。
这份”能预测接下来会发生什么”的内在模拟,就是世界模型。给 AI 装上它,意味着模型不只认得画面里有什么,还知道如果发生了 A,接下来会是 B。
和大模型的根本区别:预测的东西不一样
这是最关键的一层区分:
| 大语言模型 | 世界模型 | |
|---|---|---|
| 预测什么 | 下一个词 | 下一个状态 |
| 学到的是 | 语言的规律 | 物理与因果的规律 |
| 擅长 | 说得对 | 做得对 |
大模型的核心是预测下一个词,它从海量文本里学到”重力”这个词常和”下落""9.8”一起出现——但那是关于重力的语言,不是重力本身。所以它能写出一篇标准的重力科普,却在生成视频时让物体飘起来。
一句话概括:语言模型学的是人类怎么描述世界,世界模型要学的是世界本身怎么动。
三条正在走的路
一是从视频里学。 让模型看海量真实视频,自己归纳出物体不会凭空消失、被遮挡后还在、扔出去会按抛物线走这些规律。当下的 AI 视频生成模型多少都在做这件事——扩散模型负责把画面画得像,世界模型负责让画面动得对。
二是在仿真环境里练。 游戏和物理引擎里可以无限次试错,摔坏了重来一次不花钱,而且对错能自动判定——这一点和合成数据在数学、代码上奏效的逻辑完全一样:可验证的地方,数据就能近乎无限地生产。
三是让机器人在真实世界里学。 这就是具身智能的路线:有身体、能行动、能从后果里学习。最贴近人类的学法,也最慢最贵——真实世界不能读档重来。
为什么这么难
数据太贵。 文本可以从网上扒几万亿词,但”物体交互的完整过程”没有现成的数据集。视频里能看到结果,看不到力、质量、摩擦这些隐藏变量。
误差会滚雪球。 预测下一帧还行,预测一百帧之后就会越偏越远——每一步的小误差都会被后面的预测继承和放大。这是长视频难做的核心原因。
物理规律藏在像素后面。 模型看到的是颜色的变化,要从中反推出”这是一个有质量的刚体在受重力作用”,是一次相当大的跨越。
它和 AGI 的关系
不少研究者认为,世界模型是通用人工智能绕不开的一块拼图。理由是:真正的通用智能需要能在陌生环境里做没做过的事,而这依赖于”我大概知道这么干会怎样”的预判能力——纯靠语言统计补不上这一块。
这也解释了一个常被问到的现象:为什么聊天机器人已经很强,机器人却还笨手笨脚? 因为前者只需要把话说对,后者必须把事做对,而做对事需要的正是世界模型。推理模型让 AI 在逻辑上更能”想清楚”,世界模型要解决的则是在物理上”想得对”。
对普通用户意味着什么
- AI 视频的穿模、变形会持续改善,但短期内仍需人工挑片,别指望一次生成就能直接用,各家的实际表现见 AI 视频工具横评
- 别把大模型的物理常识当真。它能讲对物理题,不代表它”理解”物理——涉及真实世界后果的判断,务必自己核实
- 机器人的进展会比聊天慢很多,这是数据和物理规律带来的结构性差距,不是投入不够
小结
世界模型要给 AI 补的,是一份”接下来会发生什么”的内在预演能力——大语言模型预测下一个词,世界模型预测下一个状态;前者学的是人类怎么描述世界,后者学的是世界本身怎么运转。
它同时是 AI 视频摆脱穿模、机器人走出实验室、以及通往 AGI 都绕不开的一环,难点在于数据昂贵、误差累积、物理规律难以从像素中归纳。理解了这条线,你就能解释那个反差:为什么 AI 能写出完美的重力科普,却让视频里的杯子穿过了桌子。