关注CAIE,国内头部AI人才认证、培训体系,助你在职场升职加薪。CAIE,全称 Certifed Artifcial Intelligence Engineer(人工智能工程师),简称 CAIE(赛一) ,是人工智能领域的技能等级认证。旨在评估和培养具备
人工智能理论基础与实战能力的职业人士。
最近Robbyant团队搞了个大新闻,他们开源了一个叫做LingBot-World的世界模拟器。
这玩意可不简单,它不是那种你丢给它一句文字它就给你生成个几秒钟短视频的普通工具。
而是一个能够模拟真实物理世界动态、并且让你在这个世界里实时互动的超级AI系统。
开源地址:https://huggingface.co/collections/robbyant/lingbot-world
Github:https://github.com/Robbyant/lingbot-world
例如,只需要几句提示词就能生成一个让你随意游玩的故宫。
<iframe class="video_iframe rich_pages" data-src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_4364926317679558659" data-mpvid="wxv_4364926317679558659" data-vidtype="2" data-cover="http%3A%2F%2Fmmbiz.qpic.cn%2Fmmbiz_jpg%2FIWr1fTT4dMSxHmtibamrqvkK3RCOcibotmr53iamUOwn72vyEcIQEczaI8U3VtjIJ0AhXoJwUglkcKrH16yAoBPRg%2F0%3Fwx_fmt%3Djpeg" data-ratio="1.7333333333333334" data-w="832"></iframe><iframe class="video_iframe rich_pages" data-src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_4364910357916680197" data-mpvid="wxv_4364910357916680197" data-vidtype="2" data-cover="http%3A%2F%2Fmmbiz.qpic.cn%2Fmmbiz_jpg%2FIWr1fTT4dMSxHmtibamrqvkK3RCOcibotmQ8PfWXEgn2g4ibA4PeOUGPUykgWrbny4ibOvo0MLhErHD5ZLAC3EicgYA%2F0%3Fwx_fmt%3Djpeg" data-ratio="1.7777777777777777" data-w="1280"></iframe>游览雄伟壮丽的万里长城也没问题。
<iframe class="video_iframe rich_pages" data-src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_4364926634265673742" data-mpvid="wxv_4364926634265673742" data-vidtype="2" data-cover="http%3A%2F%2Fmmbiz.qpic.cn%2Fmmbiz_jpg%2FIWr1fTT4dMSxHmtibamrqvkK3RCOcibotmMJPBgLicom3ePj0OIy1keOgVn1CVLw7SiaqjylW9TQrfSIz9l4UGEKtA%2F0%3Fwx_fmt%3Djpeg" data-ratio="1.7333333333333334" data-w="832"></iframe>直接生成一分钟的玄幻世界也是刚刚的。
<iframe class="video_iframe rich_pages" data-src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_4366008907924242450" data-mpvid="wxv_4366008907924242450" data-vidtype="2" data-cover="http%3A%2F%2Fmmbiz.qpic.cn%2Fmmbiz_jpg%2FIWr1fTT4dMQ7gv8wdh5Mhys87zaNcDobAWf2rAk3KPzF35UrMKXzl9AuVHoVx6rNlRUlDusJPeuRNJxre91vNQ%2F0%3Fwx_fmt%3Djpeg" data-ratio="1.7777777777777777" data-w="1280"></iframe>甚至在操控性、光影、场景实时生成方面比谷歌的王牌世界模型Genie 3更好。
<iframe class="video_iframe rich_pages" data-src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_4364928267879809039" data-mpvid="wxv_4364928267879809039" data-vidtype="2" data-cover="http%3A%2F%2Fmmbiz.qpic.cn%2Fmmbiz_jpg%2FIWr1fTT4dMSxHmtibamrqvkK3RCOcibotmA8wAQxVT5gYCVB4sEK2gCroHqRdfJKaNajo28vibnrDRu91v4K71gYA%2F0%3Fwx_fmt%3Djpeg" data-ratio="3.0588235294117645" data-w="1664"></iframe>咱们先说说现在的世界模型生成到底卡在哪了。虽然大家在网上看到那些AI生成的视频越来越逼真,光影效果、纹理细节简直跟电影大片一样,但说白了,这些模型本质上还是在做梦。
它们是靠着统计概率,猜这一帧后面大概率是哪一帧,根本没有真正理解发生了什么。
所以你经常会看到视频里走着走着人物突然变形,或者手里的杯子莫名其妙消失了。这就是缺乏因果律和物体恒存性的表现。
而LingBot-World就用它的三板斧来解决这些难题。
要想教AI懂物理,首先得有好的教材,也就是数据。但是网上现成的视频大多是被动的,只有画面没有动作信号,就像看一部没有字幕和操作记录的电影,很难学懂怎么去控制里面的东西。
于是LingBot-World搞了一个极其强悍的数据引擎,简直像个不知疲倦的数据大厨。
不光去网上搜集各种高质量的普通视频,从第一人称的走路视角到第三人称的开车视角全都收录。还专门搞了个游戏数据采集平台,直接录制游戏里的画面。
数据采回来之后,不能直接扔给模型,得先好好洗一洗,这就是数据剖析环节。系统会像个严格的质检员,把那些模糊不清、时长太短的视频统统踢掉。然后它利用各种算法,把长视频切成一段段适合训练的小片段。
对于那些没有标注相机位置数据的普通视频,系统还能用AI算法把相机的姿态算出来,补全信息。这就好比给一段旧视频配上了3D空间坐标。
有了这些精心准备的数据,接下来就是最关键的训练环节了。这个过程就像教一个学生,从学会画画到学会拍电影,再到学会做游戏导演,分了三个阶段。
第一个阶段是打基础。团队直接用了一个已经练得很好的14B参数的大模型作为底座,这就好比找了个艺术造诣极高的画师来教学生。
这个阶段主要让AI学会怎么画出高逼真度、纹理细腻的画面,理解基本的时空关系,给它打下坚实的视觉基础。这时候它还不懂怎么交互,但已经能生成非常漂亮的静态视频了。
第二个阶段是注入灵魂,也就是中间训练。在这个阶段,模型开始学习世界知识和动作控制。为了处理复杂的世界,他们用了一个叫混合专家架构的技术。
简单来说就是模型里有两个专家,一个负责在大噪点时搭建宏观场景,一个负责在噪点少的时候修整细节。这样既能保证大场景不崩,又能让细节丰富。
但是,这个阶段的模型虽然聪明,计算量太大了,根本没法实时玩。所以第三个阶段就是让它变快,也就是后训练。
这一步就像是把一个深思熟虑的哲学家,训练成了一个反应神速的游戏高手。他们把模型那种需要看完整段视频才能生成的双向注意力机制,改成了因果注意力机制。
为了测试LingBot-World性能,研究团队与目前所有主流模型进行了横向对比,结果都非常优秀。
在生成时长方面,LingBot-World达到了长时程标准,远超Matrix-Game 2.0、Yume-1.5的短时程表现,与Mirage 2、Genie 3处于同一梯队。
在动态程度上,LingBot-World的表现尤为突出,实现了高动态程度的场景交互,显著优于其他开源模型,且不逊色于闭源的Mirage 2与Genie 3。
在分辨率上,它支持720p的高清输出,与HY-World 1.5、Genie 3持平,高于Matrix-Game 2.0、Yume-1.5、Mirage 2的480p。
同时,LingBot-World具备实时交互能力,且是唯一一款兼具通用领域、长时程生成、高动态程度、实时交互四大核心优势的开源模型。
定性分析的结果,进一步直观展现了LingBot-World的技术实力。在多样化场景生成测试中,LingBot-World-Base能够处理不同的物体属性与复杂空间配置,帧间过渡平滑且逻辑一致,充分体现了模型对细粒度环境动态的捕捉能力。
而实时变体LingBot-World-Fast,在单GPU节点上处理480p视频时,可实现16帧/秒的吞吐量。
想转型AI,不被时代淘汰
CAIE注册人工智能工程师认证
岗位能力 × AI工具 ×转型方向 × 场景落地 = 新AI职业价值
扫码免费领取《AI工程师入门学习指南》