世界模型

一句话

给 AI 装一个「脑内沙盘」——做任何事之前,先在脑子里把”如果这样做会怎样”预演一遍。

它的工作方式(一个圈)

看世界(观察)→ 脑内预演(世界模型)→ 预测结果 → 挑最优去行动 → 结果反馈回来修正模型,越用越准。

学界的定义

学术界把世界模型的功能归为两条 $TRAE_REF:

  1. 理解现在:在脑内建立对世界规律的理解(内部表征)
  2. 预测未来:预测接下来的状态变化,用来模拟和指导决策

综述最新版为 v4(2025-12-10),引用时不要只写 v3。

2026 主流代表:NVIDIA Cosmos 3(补齐)

  • 2026-05-31 发布,Mixture-of-Transformers 架构
  • 一个开源模型同时做三件事:物理推理 + 世界生成 + 动作生成
  • 训练数据规模:7.67 亿图 / 3.48 亿真实视频 / 800 万动作样本
  • 配套:Cosmos Predict 2.5 / Transfer 2.5 / Reason 2
  • 与 Genie 3、MoWorld-3D 一起,构成 2026 世界模型三强格局

和大语言模型的区别

  • 最大的区别一句话(9-14 追问):LLM 预测的是「下一个词」,世界模型预测的是「下一个状态」——LLM 学的是文字里描述的世界,世界模型学的是世界运行的规律;一个在回答「怎么说」,一个在推演「会发生什么」。推演从未发生过的情形(反事实想象)是分水岭:世界模型能在脑内模拟一遍,LLM 只能拼凑见过的文字
大语言模型世界模型
学的是什么文字里的规律(别人描述的世界)物理世界的规律(世界本身)
会什么背出抛物线公式”见过”球落地弹两下,脑内能模拟
缺什么没有真正的物理直觉语言能力弱于 LLM
例子DeepSeek、GLM-5.3机器人脑、自动驾驶、视频生成模型

一句话:LLM 读到的是「别人描述的世界」,世界模型要学的是「世界本身」。

为什么 2026 年这么火

AI 圈共识:语言已被大模型拿下,物理世界是下一座金矿——机器人、自动驾驶、AI 游戏都需要”懂物理”的 AI。

  • 世界模型已是具身智能(机器人)最热门的技术标签,各家用法还不统一(预测状态/数据生成器/规划决策/生成动作),GPT-6 也开始把手伸向机器人领域 $TRAE_REF
  • 新一代做法:机器人在真动手前先跟自己的预演过一遍——预演、验证、行动闭环,世界模型从训练辅助工具升级为实时参与决策的”思考伙伴”(星源智 ω-EVA)$TRAE_REF
  • 国内动作:2026-07-16 WAIC 前夕,国家AI应用中试基地(具身智能)联合华为、魔芯科技发布 MoWorld-3D(全栈昇腾 NPU 的交互式三维世界模型),作为即插即用公共工具开放,打通 AI 从”对话交互”到”物理交互” $TRAE_REF

典型案例:DeepMind「Genie 3」

用户读到的公众号文章讲的就是它(2026-09-12)。

  • 发布:Google DeepMind 2025-08-05 发布,自称「通用世界模型的新前沿」,是其十余年世界模拟研究的延续
  • 能力:给一句文字提示,几秒生成一个可以走进去逛的 3D 世界——实时 24 帧、720p、能保持几分钟的场景一致性(雨夜中世纪村庄、闪电照在石板路上这种)
  • 和视频生成的根本区别:视频是”死”的(放完就完);Genie 3 的世界是”活”的——你往哪走它就往哪变,还能随手改设定(可提示性),背后是模型自学的物理规律
  • 为什么 DeepMind 做它:给机器人和 AI 智能体当练功房——先在生成的世界里练一万次,再上真身(Physical AI 路线)
  • 争议:有人认为这类东西”只是高级视频生成、世界模型无意义”——分歧点就在「能不能实时交互+保持一致」

常见追问:一直用它,它会越用越强吗?(9-14 追问)

  • 不会。 模型「出厂即定格」(权重冻结):训练时学习,使用时只读。同一版本用一万次,水平纹丝不动——就像一本书被读一万遍,书的内容不会变
  • 「越用越好用」的感觉来自三种外挂,模型本身都没变:①记忆外挂——把偏好/资料存外部数据库,用时喂给它,是参考书变厚了;②微调——定期拿数据重训出新版模型替换旧版,是换脑子不是长脑子;③数据飞轮——全球用户的使用数据帮厂商训练下一代,你用得越多,下一代越强,手上这版永远定格
  • 本地部署同理:不会随使用变强。想让”它”变强只有两条路——等官方新版(换脑子),或攒数据自己微调(重造脑子,个人做不动)
  • 现实提醒:Genie 3 这类强世界模型不开放下载,能本地跑的只是研究小样
  • 学术界在研究「边用边学」(持续学习/在线学习),但因「灾难性遗忘」问题(边用边改会越改越偏),离产品还很远

追问2:世界模型会替代大语言模型吗?(9-14)

  • 替代:不会。 核心是成本账——视频/世界的模拟算力远贵于文本,语言是「最便宜的智能介质」。让世界模型写购物清单,等于开卡车去买菜。语言的生态位(搜索、写作、对话)又大又便宜,会长期存在
  • 包含/融合:已经在发生。 两边正在互相长进对方:LLM 这边——DeepSeek V4.1 Flash 原生看懂图片、GPT-6/Gemini 走全模态;世界模型这边——Genie 3 能听懂文字提示词,说明里面就嵌着语言理解
  • 终局判断(有主见版):旗舰层面会重演「智能手机收编相机」——一个全模态大模型把语言+物理世界都包进去;应用层面长期分工共存——便宜的活给便宜的小模型,贵的活给世界模型(类比用户自己的模型组合:量大的、要动脑的各配各的)
  • 对普通用户的意义:不用押注谁赢。未来的 AI 是「一个入口」,背后自动把问题路由给语言模型或世界模型——就像现在的 TraeWork 多模型组合

追问3:以后都是 MoE 模型,不再有模型划分?(9-14)

  • 用户的直觉对了一半:旗舰模型确实在往「一个模型全包」走,而且主流旗舰已经都是 MoE 架构(DeepSeek V4.1 Flash 就是);「输入决定激活哪部分参数」正是 MoE 的机制
  • MoE 说人话:一家大公司,里面分了很多「专家」(参数分组),前台有个路由器,看你问什么就把活转给最对口的几位专家,其他人这单不参与。好处:总参数可以堆得极大(知识多),每次只用一小部分(算得快、成本低)
  • 要拧准的一点:MoE 的专家是训练出来的神经元分组,不是插件市场——路由是学出来的、模糊的,不能手动插拔;「融合多模态」靠的是训练数据+架构设计,MoE 是它的好底座(不同专家天然会偏向语言/视觉/物理),但两者不是一回事
  • 两个保留:①小而专的模型不会消失(成本、延迟、手机端、隐私),未来是「巨无霸 MoE + 小专家」并存,入口负责调度;②世界模型要的「长时间一致模拟」光靠 MoE 的普通专家可能不够,大概率还要新结构(状态记忆之类)——这段路业界还没走完

追问4:世界模型的架构是 Transformer 吗?(9-14)

  • 主流是,但不全是。 Transformer 本质是个「通用骨架」——什么数据都能吃(文字、图像块、视频块)。LLM 的成功把「预测下一块」的套路搬到了视频上:把「下一个词」换成「下一块画面」

  • 三大流派:

    1. 自回归 Transformer(像 LLM 一样逐块接龙)——DeepMind Genie 系列走这条线(Genie 3 完整架构未公开,普遍推断属此类)
    2. 扩散模型(从噪点里「雕刻」画面)——Sora(扩散 Transformer)、把游戏跑在扩散模型里的那批项目
    3. 循环网络 RNN(老牌 RL 世界模型,靠内部状态滚动预测)——Dreamer 系列,不用 Transformer
  • 架构之争还没定型:LeCun 一派主张「生成像素太浪费」,JEPA 路线在抽象空间里预测(不画画面,只推演含义);Genie 3 只能维持几分钟一致性,也说明架构还没成熟

  • 和 MoE 的关系:Transformer 是骨架的样式,MoE 是骨架里的分工方式,两者可叠加——DeepSeek V4.1 Flash 就是「Transformer + MoE」

和我现有工具的关系

  • AI 视频生成(开源视频模型、ComfyUI 那套)是世界模型的近亲:让模型学”画面怎么随时间变化”,学得越像真世界,视频越不穿帮——Sora 类模型当年就被叫作”世界模拟器”
  • 未来买机器人/看自动驾驶新闻时,“世界模型”就是判断吹没吹牛的核心词

相关笔记

相关日记