世界模型是什么

世界模型的定义

其实没有公认的定义,但是我们大概解释一下概念
AI领域目前需要解决一个问题,就是让AI真正地了解世界。在人类进行行动之前会首先在脑中模拟接下来会发生的事情,比如在准备松手之前会模拟到杯子会掉下去导致摔碎。这看起来就像,人类在脑海中构建了一个小世界,既然人类智能依赖于这样的世界,那么AI是否也需要这样的世界呢
1991年Dyna提出在学习策略的同时,也要学习model of the world,之后在强化学习和机器人中发展出了Forward Model,在自动控制和工业系统中发展出了Model Predictive Control,他们都假设智能体在行动之前能提前看见未来。
后来一篇名为《World Model》的论文正式提出了World Model的概念,在这篇论文中给出了世界模型的基本结构:世界模型=观察世界V(Vision)+预测世界M(Memory)+内部学习世界C(Controller)。
以学习打乒乓球为例,视觉模块V负责提取出对决策真正重要的部分,记忆模块进行内部模拟,建立对乒乓球运动的模拟,控制模块负责在记忆模块创建出的模拟环境中进行训练,找到最优解。下面这个demo是模型在虚拟小世界中学会了玩一款赛车游戏。
Video preview

与LLM的异同

从主要任务和目标来看
  • LLM的目标是预测下一个词或者token,比如你问杯子会从桌子上掉下来吗?LLM会回答会,因为他在训练语料中见过这个答案。
  • 世界模型预测的是下一帧/下一步/下一个状态的变化,需要理解物理/空间/规律
从训练内容上看
  • LLM的训练依赖文本/图片/视频等静态内容
  • 世界模型的训练还需要其他传感器,环境变化,反馈等
从学习方式来看
  • LLM是从静态数据中学习统计规律
  • 世界模型是学习环境动态变化的规律

为什么要转而去研究World Model?

以Yann LeCun,Richard Sutton,Fei-Fei Li为代表的一些研究这认为大预言模型是死路。现在的LLM对现实世界几乎没有建模能力,如果沿着LLM的继续堆量,最多能让LLM更会写作罢了。
Moravec悖论: 对人类而言易如反掌的感官运动技能(如行走、感知)对AI来说极其困难,而对人类很难的高阶逻辑推理(如数学、棋类)对AI来说却轻而易举。
而且现在的发展现状也说明LLM的能力已经开始出现瓶颈了,继续堆量的性价比已经不高了。AI想要突破需要和现实世界互动,去学习与适应现实世界中的混乱和复杂。
并且多模态技术,算力的增加等等使得世界模型的研究有了一定的基础,变得水到渠成。

目前的几大流派

首先我们将World Model的工作分成两个独立的层,底层是研究如何创建世界(世界生成),有了世界生成就可以让机器人在虚拟世界中不断训练尝试;顶层是研究智能体如何在世界中行动(智能体训练)。

世界生成

  • 视频生成
    • Sora,生成一个能动起来的世界,这个世界随着时间的流动演化变化。看起来模型似乎真的理解了世界的变化规律?
    • Ginie能够实时生成能够与用户进行交互的视频,虽然还是一种逐帧生成方式,但是他已经能够记住一些历史状态。
    • 视频生成的优势是结果看得见,有大量训练数据,并且模型越大似乎能力就越强
    • 虽然输出是显式的,但是对世界的理解是隐式的,我们无法直接读取和移植,他们理解出来的规律依然藏在模型的权重之中,其实也只是画出了一层皮。
  • 3D生成
    • 直接把世界建出来,不关心具体的细节,不追求非常精细,更关注世界的结构。这能让智能体理解3D的世界结构。
    • 但是缺点是训练数据少,并且很难建立。其次是数据量太大了,训练也很困难。

智能体训练

  • Google SIMA: 直接把智能体放在虚拟世界中去训练。
  • Yann LeCun的JEPA: 在忽略掉不重要的大量细节之后,直接去学习世界的抽象结构。因为我们完成一个任务只需要关注和这个任务相关的少数数据,所以这样能够避免关注太多无用的细节,节省很多算力。首先将所有的数据计算成高维的抽象表示,然后在这个高维表示上面进行规律的学习。

总结

无论是通过 Sora 般的视频生成去隐式地“画出”世界,还是像 JEPA 那样去抽象地“理解”规律,世界模型都承载着下一代 AI 的终极野心。大语言模型让我们看到了 AI 在虚拟世界中高谈阔论的潜力,但唯有世界模型,才能让 AI 真正睁开双眼,理解重力、空间与时间的流动。当 AI 能够真正预测“杯子摔碎的瞬间”,它才算真正拿到了通往通用人工智能(AGI)的入场券。
Loading...