大晓机器人、南洋理工大学发布统一多模态世界模型Puffin-World
创始人
2026-09-11 00:54:35

  炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!

(来源:贝壳财经)

新京报贝壳财经讯(记者罗亦丹)记者9月10日获悉,大晓机器人联合南洋理工大学S-Lab等机构发布并开源统一多模态世界模型框架Puffin-World。作为面向空间智能与具身智能的成果,Puffin-World首次在一个统一多模态框架中,将物理、几何和外观定义为三种原生的三维世界状态,并贯通重力场感知、自由视点空间仿真、三维世界生成与重建以及闭环探索,预测机器人行动后世界将处于什么状态。

针对机器人训练来说,需要的并不是一段视觉上逼真的视频,而是能够支撑感知、定位、规划和行动的环境信息:当前相机处于什么姿态,重力方向是否稳定,场景结构如何延续,机器人移动后将看到什么。图像只是世界状态的一部分,物理方向、空间几何和视觉外观共同构成机器人真正需要的训练环境。

Puffin-World可以在一个模型中统一四类过去往往需要不同系统分别完成的任务,包括:

单图理解相机物理信息。输入一张图片,模型能够结合地平线、垂直结构和场景构图进行空间推理,预测相机相对于真实物理世界的横滚角、俯仰角和垂直视场角,同时生成场景语义描述。模型不仅识别“图中有什么”,还理解“当前视角以怎样的姿态看到了它”。

自由视点空间仿真。除文字描述外,用户还可以明确指定相机方向和视场角。模型据此生成符合目标机位的画面,使文生图从内容控制进一步走向精确的空间控制。

三维世界生成与重建。模型可以从文字、单张图像或少量参考图像出发,按照指定相机轨迹生成多个新视角,并同步预测每个视角的外观和深度。不同视角随后可以汇聚为具有一致空间结构的三维世界。

闭环自校准探索。当相机姿态偏离重力方向时,模型可以先感知当前物理状态,再推理需要执行的修正动作,并生成动作执行后的目标观察,由此形成“状态感知—动作预测—结果生成—再次校准”的闭环。

Puffin-World同步开源代码、模型和Puffin-16M数据集,包括1500万组视觉—语言—相机三元组和100万条具有挑战性的旋转轨迹,并开放覆盖28个公开数据集、约4450万张图像的绝对相机位姿标注,为机器人仿真、合成数据生产与具身智能训练提供可复现、可扩展的技术底座。

编辑 岳彩周

校对 翟永军

相关内容

热门资讯

揭秘一下!wpk辅助挂多功能透... 揭秘一下!wpk辅助挂多功能透视工具,好像真的有挂(发现有挂)揭秘一下!wpk辅助挂多功能透视工具,...
最新技巧!德普之星辅助挂多功能... 您好,德普之星这款游戏可以开挂的,确实是有挂的,需要了解加去威信【136704302】很多玩家在这款...
实测必看!aapoker辅助挂... 实测必看!aapoker辅助挂多功能透视工具,一贯是有挂(有挂教程)1)aapoker免费钻石:进一...
终于清楚!智星菠萝德州辅助挂多... 终于清楚!智星菠萝德州辅助挂多功能透视工具,真是真的是有挂(有挂工具)1、智星菠萝德州模拟器是什么优...
今日头条!AAPoKer辅助挂... 今日头条!AAPoKer辅助挂多功能透视工具,果然是有挂(有挂规律)1、每一步都需要思考,不同水平的...