


成都青羊区航空配套产业集群亮相第二十一届中国国际中小企业博览会-rssaibe1addf2723fe619
发布Atlas后,李飞飞最新访谈:如何预测一个未被拍下的世界 只用 3 部固定在三脚架上的 iPhone,Atlas 就能重现《黑客帝国》式的“子弹时间”,让镜头绕着凝固的动作移动。 这是 World Labs 最新发布的世界模型 Atlas 展示的能力之一。据 DeepTech 此前报道,这是全球首个多模态世界模型。它能以像素级精度控制镜头,根据参考图生成最长 1 分钟、最高 1,440p 的视频,还可用 1 张至数十张图像重建真实空间,输出新视角画面和显式 3D 结果。 近日,World Labs 联合创始人李飞飞、Justin Johnson 和 Ben Mildenhall 做客 a16z Show,与主持人 Martin Casado 讨论 Atlas。谈话从设计选择展开,也回顾了团队由多模态世界模型 Marble 转向 Atlas 的过程。 对谈中,团队将 Atlas 的核心能力称为“新视角预测”。区别于一般视频模型沿时间轴预测下一帧,Atlas 能够根据已有画面与相机位姿等,判断镜头移动到另一个时空位置后会看到什么。 李飞飞认为,生成具有空间语境和现实依据的像素,是通往空间智能的一步。这种能力既能帮助创作者维持场景与物体的一致性,也可能把现实环境转成机器人训练所需的模拟空间。 谈及后续路线,团队计划增强模型对动态变化和场景编辑的支持,并探索与机器人行动规划的结合,使其从呈现三维世界逐步走向理解和参与其中。 对谈从 Atlas 如何生成、重建和模拟世界出发。据 World Labs 团队介绍,Atlas 在预训练阶段共同处理文本、图像、视频、相机位姿和 3D 信息,并将其编码为“空间上下文”。每张图像都关联着三维相机位姿,位置和朝向得到明确标记。 除了相机参数,Atlas 还把深度图作为原生输入。RGB 图像记录某个位置看上去是什么样,深度图则描述物体与相机之间的距离,帮助模型判断前后遮挡和空间结构。换句话说,模型处理的不只是连续画面,还包括画面背后的三维关系。 李飞飞提到,计算机视觉发展半个多世纪以来,像素生成、识别和三维重建通常分属不同研究方向。Atlas 以视点和相机位姿估计为锚点,把像素生成与像素重建放进同一个模型,使两类任务可以在一套架构中相互配合。 在她看来,空间智能最终需要支持生成、推理、编辑和交互,而理解空间的几何、结构与物理规律是实现这些任务的基础。Atlas 可以估计每一帧对应的视角和相机位姿,使生成的像素受到空间语境和几何关系约束,因而构成了这条路径上的一个阶段。 针对 Marble 与 Atlas 的差异,联合创始人 Justin Johnson 解释,为便于在移动设备和游戏引擎中渲染,上一代多模态世界模型 Marble 主要以高斯泼溅表示三维场景。但由于模型的所有结果都须先落到这一种表示上,从而限制了其他输出。 针对这一问题,Atlas 进行了一些调整,即将不同模态更早分开,把“新视角预测”放在更基础的位置。模型先根据空间上下文生成指定视角的 RGB 画面或深度信息,需要明确的三维表示时,再生成高斯泼溅场景。换句话说,高斯泼溅不再是所有任务都必须经过的终点,而成为模型可按任务调用的一种输出形式。 图|Atlas 统一生成与空间重建(来源:World Labs官网) 此外,Atlas 还试图降低三维重建对密集拍摄的依赖。Ben Mildenhall 表示,传统方法需要让每处表面至少出现在 3 至 4 个视角中,拍摄一个房间可能需要 100 至 300 张照片。Atlas 有望将数量降到约 3 张,相当于减少 50 至 100 倍。 输入数量大幅减少后,模型要面对的考验是如何补足相机从未拍到的区域。李飞飞提到,在斯坦福校园的一次演示中,模型接收的 3 至 25 张照片全部从地面拍摄,却生成了校园上空的俯瞰画面。她指出,空中视角并非来自原始素材,而是在已知空间关系约束下生成的结果。 这一案例也再次说明了两类任务为何需要相互配合。尽管密集重建可以利用大量拍摄素材还原已被镜头捕捉到的区域,但难免会遗漏桌底、麦克风下方和椅腿之间等区域,Atlas 则能够“看到”这些细节。 在谈及团队如何确认这一技术路径时,李飞飞回忆道,2026 年初夏,一个小于当前版本的模型处理 NeRF 论文中的花园桌场景后,给出了此前未曾见过的桌下视角,出现了一只足球。 正是这次对新视角预测能力的关键验证,三位创始人决定继续推进这一方向。此后,模型随着规模、训练时长和芯片数量增加而持续改善。 新视角预测已经回答了模型如何建立连贯空间,但若想让这个空间能够被创作者反复修改或用于设计,接下来的问题便是如何让它成为真实工作流程的一部分。 在前代模型 Marble 的使用中,创作者常先生成三维场景,再从不同位置截取画面,作为后续视频制作的素材。Atlas 希望把这一过程收进同一空间,让用户直接指定视角并继续生成所需镜头。这样一来,场景中的人物、道具和位置关系可以延续到下一步创作。 这种连续性也正是专业工作流所需要的,例如影视、游戏和营销项目要保留场景与布局以便修改,建筑、施工和展台制作也要把口头意见和草图落实到三维软件中。 Ben Mildenhall 表示,希望模型降低反复修改的负担,保留控制精度的同时使三维设计更接近搭积木或用铅笔勾画。 当场景可以从现实素材中被重建和修改,李飞飞又将它放入机器人研发的工作链。2026 年 7 月,World Labs 收购机器人公司 SceniX,补上了从现实环境重建、到模拟训练、再回到现实部署的技术链。 通过 Atlas 对真实场景进行重建并生成可调整的模拟环境,开发者可以在其中采集训练数据、训练机器人策略,并在部署前评估不同动作可能带来的结果。 李飞飞认为,机器人当前的主要瓶颈是数据。线缆弯曲方式、容器尺寸和颜色、物体摆放位置都可能变化,训练环境需要呈现这些差异,机器人才有机会应对部署时的不同情况。Atlas 可以将真实环境更快转入模拟,再改变其中的条件,补充难以逐一采集的训练情形。 图|Atlas 生成机器人模拟视角(来源:World Labs 官网) 不过,要训练机器人策略,模拟环境不能只停留在静态画面的复现。当机器人策略采取动作,环境还可能以意料之外的方式响应,训练就需要覆盖尽可能多的异常与失败情形。 Justin Johnson 表示,除人工编写规则的传统物理引擎外,团队还在探索“神经模拟器”,让模型从数据中学习环境面对不同动作时可能发生的变化。 此外,真实世界始终处于变化之中,模型还需要处理时间维度。针对 Atlas 动态能力,World Labs 团队表示,模型架构和预训练数据本已包含动态信息。不过,当前版本的后训练主要聚焦静态场景和空间移动,团队计划在后续版本中继续增强对时间变化的处理。 谈及未来规划,李飞飞认为,空间智能需要超越看见和解释场景,形成感知、体验与交互的闭环。她将其视为从空间生成迈向更高保真模拟、场景编辑和行动规划的方向,使模型进一步支持人和机器在空间中行动。 1.https://www.youtube.com/watch?v=qn1QDDBnTA0 2.https://www.worldlabs.ai/blog/atlas#spatial-reconstruction 3.https://www.worldlabs.ai/blog/atlas#robotics-simulation 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 界面新闻 2026-09-07 20:15:59 上观新闻 2026-09-08 09:04:25 鲁中晨报 2026-09-05 17:14:04 扬子晚报 2026-09-08 07:20:10 南方都市报 2026-09-08 10:51:28 南方都市报 2026-09-06 15:29:22 鲁中晨报 2026-09-06 15:47:03 上观新闻 2026-09-07 14:45:34 澎湃新闻 2026-09-07 22:05:05 新京报 2026-09-08 08:06:25 看看新闻Knews 2026-09-07 23:08:28 海峡导报社 2026-09-08 09:54:27 南方都市报 2026-09-07 14:44:06 第一财经资讯 2026-09-07 13:22:17 鲁中晨报 2026-09-08 07:03:22 新京报政事儿 2026-09-08 11:06:13 南方都市报 2026-09-06 11:41:02 新民晚报 2026-09-08 09:46:35 澎湃新闻 2026-09-08 10:36:13 人民资讯 2026-09-07 21:04:04 证券时报 2026-09-08 12:54:30 励职派 2026-09-08 12:56:15
北京大悦城寿司郎店内一男童在座位上小便并喊话“谁要喝”,家长竟用饮料杯接住-c7ecc31c
发布Atlas后,李飞飞最新访谈:如何预测一个未被拍下的世界 只用 3 部固定在三脚架上的 iPhone,Atlas 就能重现《黑客帝国》式的“子弹时间”,让镜头绕着凝固的动作移动。 这是 World Labs 最新发布的世界模型 Atlas 展示的能力之一。据 DeepTech 此前报道,这是全球首个多模态世界模型。它能以像素级精度控制镜头,根据参考图生成最长 1 分钟、最高 1,440p 的视频,还可用 1 张至数十张图像重建真实空间,输出新视角画面和显式 3D 结果。 近日,World Labs 联合创始人李飞飞、Justin Johnson 和 Ben Mildenhall 做客 a16z Show,与主持人 Martin Casado 讨论 Atlas。谈话从设计选择展开,也回顾了团队由多模态世界模型 Marble 转向 Atlas 的过程。 对谈中,团队将 Atlas 的核心能力称为“新视角预测”。区别于一般视频模型沿时间轴预测下一帧,Atlas 能够根据已有画面与相机位姿等,判断镜头移动到另一个时空位置后会看到什么。 李飞飞认为,生成具有空间语境和现实依据的像素,是通往空间智能的一步。这种能力既能帮助创作者维持场景与物体的一致性,也可能把现实环境转成机器人训练所需的模拟空间。 谈及后续路线,团队计划增强模型对动态变化和场景编辑的支持,并探索与机器人行动规划的结合,使其从呈现三维世界逐步走向理解和参与其中。 对谈从 Atlas 如何生成、重建和模拟世界出发。据 World Labs 团队介绍,Atlas 在预训练阶段共同处理文本、图像、视频、相机位姿和 3D 信息,并将其编码为“空间上下文”。每张图像都关联着三维相机位姿,位置和朝向得到明确标记。 除了相机参数,Atlas 还把深度图作为原生输入。RGB 图像记录某个位置看上去是什么样,深度图则描述物体与相机之间的距离,帮助模型判断前后遮挡和空间结构。换句话说,模型处理的不只是连续画面,还包括画面背后的三维关系。 李飞飞提到,计算机视觉发展半个多世纪以来,像素生成、识别和三维重建通常分属不同研究方向。Atlas 以视点和相机位姿估计为锚点,把像素生成与像素重建放进同一个模型,使两类任务可以在一套架构中相互配合。 在她看来,空间智能最终需要支持生成、推理、编辑和交互,而理解空间的几何、结构与物理规律是实现这些任务的基础。Atlas 可以估计每一帧对应的视角和相机位姿,使生成的像素受到空间语境和几何关系约束,因而构成了这条路径上的一个阶段。 针对 Marble 与 Atlas 的差异,联合创始人 Justin Johnson 解释,为便于在移动设备和游戏引擎中渲染,上一代多模态世界模型 Marble 主要以高斯泼溅表示三维场景。但由于模型的所有结果都须先落到这一种表示上,从而限制了其他输出。 针对这一问题,Atlas 进行了一些调整,即将不同模态更早分开,把“新视角预测”放在更基础的位置。模型先根据空间上下文生成指定视角的 RGB 画面或深度信息,需要明确的三维表示时,再生成高斯泼溅场景。换句话说,高斯泼溅不再是所有任务都必须经过的终点,而成为模型可按任务调用的一种输出形式。 图|Atlas 统一生成与空间重建(来源:World Labs官网) 此外,Atlas 还试图降低三维重建对密集拍摄的依赖。Ben Mildenhall 表示,传统方法需要让每处表面至少出现在 3 至 4 个视角中,拍摄一个房间可能需要 100 至 300 张照片。Atlas 有望将数量降到约 3 张,相当于减少 50 至 100 倍。 输入数量大幅减少后,模型要面对的考验是如何补足相机从未拍到的区域。李飞飞提到,在斯坦福校园的一次演示中,模型接收的 3 至 25 张照片全部从地面拍摄,却生成了校园上空的俯瞰画面。她指出,空中视角并非来自原始素材,而是在已知空间关系约束下生成的结果。 这一案例也再次说明了两类任务为何需要相互配合。尽管密集重建可以利用大量拍摄素材还原已被镜头捕捉到的区域,但难免会遗漏桌底、麦克风下方和椅腿之间等区域,Atlas 则能够“看到”这些细节。 在谈及团队如何确认这一技术路径时,李飞飞回忆道,2026 年初夏,一个小于当前版本的模型处理 NeRF 论文中的花园桌场景后,给出了此前未曾见过的桌下视角,出现了一只足球。 正是这次对新视角预测能力的关键验证,三位创始人决定继续推进这一方向。此后,模型随着规模、训练时长和芯片数量增加而持续改善。 新视角预测已经回答了模型如何建立连贯空间,但若想让这个空间能够被创作者反复修改或用于设计,接下来的问题便是如何让它成为真实工作流程的一部分。 在前代模型 Marble 的使用中,创作者常先生成三维场景,再从不同位置截取画面,作为后续视频制作的素材。Atlas 希望把这一过程收进同一空间,让用户直接指定视角并继续生成所需镜头。这样一来,场景中的人物、道具和位置关系可以延续到下一步创作。 这种连续性也正是专业工作流所需要的,例如影视、游戏和营销项目要保留场景与布局以便修改,建筑、施工和展台制作也要把口头意见和草图落实到三维软件中。 Ben Mildenhall 表示,希望模型降低反复修改的负担,保留控制精度的同时使三维设计更接近搭积木或用铅笔勾画。 当场景可以从现实素材中被重建和修改,李飞飞又将它放入机器人研发的工作链。2026 年 7 月,World Labs 收购机器人公司 SceniX,补上了从现实环境重建、到模拟训练、再回到现实部署的技术链。 通过 Atlas 对真实场景进行重建并生成可调整的模拟环境,开发者可以在其中采集训练数据、训练机器人策略,并在部署前评估不同动作可能带来的结果。 李飞飞认为,机器人当前的主要瓶颈是数据。线缆弯曲方式、容器尺寸和颜色、物体摆放位置都可能变化,训练环境需要呈现这些差异,机器人才有机会应对部署时的不同情况。Atlas 可以将真实环境更快转入模拟,再改变其中的条件,补充难以逐一采集的训练情形。 图|Atlas 生成机器人模拟视角(来源:World Labs 官网) 不过,要训练机器人策略,模拟环境不能只停留在静态画面的复现。当机器人策略采取动作,环境还可能以意料之外的方式响应,训练就需要覆盖尽可能多的异常与失败情形。 Justin Johnson 表示,除人工编写规则的传统物理引擎外,团队还在探索“神经模拟器”,让模型从数据中学习环境面对不同动作时可能发生的变化。 此外,真实世界始终处于变化之中,模型还需要处理时间维度。针对 Atlas 动态能力,World Labs 团队表示,模型架构和预训练数据本已包含动态信息。不过,当前版本的后训练主要聚焦静态场景和空间移动,团队计划在后续版本中继续增强对时间变化的处理。 谈及未来规划,李飞飞认为,空间智能需要超越看见和解释场景,形成感知、体验与交互的闭环。她将其视为从空间生成迈向更高保真模拟、场景编辑和行动规划的方向,使模型进一步支持人和机器在空间中行动。 1.https://www.youtube.com/watch?v=qn1QDDBnTA0 2.https://www.worldlabs.ai/blog/atlas#spatial-reconstruction 3.https://www.worldlabs.ai/blog/atlas#robotics-simulation 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 界面新闻 2026-09-07 20:15:59 上观新闻 2026-09-08 09:04:25 鲁中晨报 2026-09-05 17:14:04 扬子晚报 2026-09-08 07:20:10 南方都市报 2026-09-08 10:51:28 南方都市报 2026-09-06 15:29:22 鲁中晨报 2026-09-06 15:47:03 上观新闻 2026-09-07 14:45:34 澎湃新闻 2026-09-07 22:05:05 新京报 2026-09-08 08:06:25 看看新闻Knews 2026-09-07 23:08:28 海峡导报社 2026-09-08 09:54:27 南方都市报 2026-09-07 14:44:06 第一财经资讯 2026-09-07 13:22:17 鲁中晨报 2026-09-08 07:03:22 新京报政事儿 2026-09-08 11:06:13 南方都市报 2026-09-06 11:41:02 新民晚报 2026-09-08 09:46:35 澎湃新闻 2026-09-08 10:36:13 人民资讯 2026-09-07 21:04:04 证券时报 2026-09-08 12:54:30 励职派 2026-09-08 12:56:15
铜价上涨“冲击波”,AI算力引爆全球“抢铜”大战-e126112e
发布Atlas后,李飞飞最新访谈:如何预测一个未被拍下的世界 只用 3 部固定在三脚架上的 iPhone,Atlas 就能重现《黑客帝国》式的“子弹时间”,让镜头绕着凝固的动作移动。 这是 World Labs 最新发布的世界模型 Atlas 展示的能力之一。据 DeepTech 此前报道,这是全球首个多模态世界模型。它能以像素级精度控制镜头,根据参考图生成最长 1 分钟、最高 1,440p 的视频,还可用 1 张至数十张图像重建真实空间,输出新视角画面和显式 3D 结果。 近日,World Labs 联合创始人李飞飞、Justin Johnson 和 Ben Mildenhall 做客 a16z Show,与主持人 Martin Casado 讨论 Atlas。谈话从设计选择展开,也回顾了团队由多模态世界模型 Marble 转向 Atlas 的过程。 对谈中,团队将 Atlas 的核心能力称为“新视角预测”。区别于一般视频模型沿时间轴预测下一帧,Atlas 能够根据已有画面与相机位姿等,判断镜头移动到另一个时空位置后会看到什么。 李飞飞认为,生成具有空间语境和现实依据的像素,是通往空间智能的一步。这种能力既能帮助创作者维持场景与物体的一致性,也可能把现实环境转成机器人训练所需的模拟空间。 谈及后续路线,团队计划增强模型对动态变化和场景编辑的支持,并探索与机器人行动规划的结合,使其从呈现三维世界逐步走向理解和参与其中。 对谈从 Atlas 如何生成、重建和模拟世界出发。据 World Labs 团队介绍,Atlas 在预训练阶段共同处理文本、图像、视频、相机位姿和 3D 信息,并将其编码为“空间上下文”。每张图像都关联着三维相机位姿,位置和朝向得到明确标记。 除了相机参数,Atlas 还把深度图作为原生输入。RGB 图像记录某个位置看上去是什么样,深度图则描述物体与相机之间的距离,帮助模型判断前后遮挡和空间结构。换句话说,模型处理的不只是连续画面,还包括画面背后的三维关系。 李飞飞提到,计算机视觉发展半个多世纪以来,像素生成、识别和三维重建通常分属不同研究方向。Atlas 以视点和相机位姿估计为锚点,把像素生成与像素重建放进同一个模型,使两类任务可以在一套架构中相互配合。 在她看来,空间智能最终需要支持生成、推理、编辑和交互,而理解空间的几何、结构与物理规律是实现这些任务的基础。Atlas 可以估计每一帧对应的视角和相机位姿,使生成的像素受到空间语境和几何关系约束,因而构成了这条路径上的一个阶段。 针对 Marble 与 Atlas 的差异,联合创始人 Justin Johnson 解释,为便于在移动设备和游戏引擎中渲染,上一代多模态世界模型 Marble 主要以高斯泼溅表示三维场景。但由于模型的所有结果都须先落到这一种表示上,从而限制了其他输出。 针对这一问题,Atlas 进行了一些调整,即将不同模态更早分开,把“新视角预测”放在更基础的位置。模型先根据空间上下文生成指定视角的 RGB 画面或深度信息,需要明确的三维表示时,再生成高斯泼溅场景。换句话说,高斯泼溅不再是所有任务都必须经过的终点,而成为模型可按任务调用的一种输出形式。 图|Atlas 统一生成与空间重建(来源:World Labs官网) 此外,Atlas 还试图降低三维重建对密集拍摄的依赖。Ben Mildenhall 表示,传统方法需要让每处表面至少出现在 3 至 4 个视角中,拍摄一个房间可能需要 100 至 300 张照片。Atlas 有望将数量降到约 3 张,相当于减少 50 至 100 倍。 输入数量大幅减少后,模型要面对的考验是如何补足相机从未拍到的区域。李飞飞提到,在斯坦福校园的一次演示中,模型接收的 3 至 25 张照片全部从地面拍摄,却生成了校园上空的俯瞰画面。她指出,空中视角并非来自原始素材,而是在已知空间关系约束下生成的结果。 这一案例也再次说明了两类任务为何需要相互配合。尽管密集重建可以利用大量拍摄素材还原已被镜头捕捉到的区域,但难免会遗漏桌底、麦克风下方和椅腿之间等区域,Atlas 则能够“看到”这些细节。 在谈及团队如何确认这一技术路径时,李飞飞回忆道,2026 年初夏,一个小于当前版本的模型处理 NeRF 论文中的花园桌场景后,给出了此前未曾见过的桌下视角,出现了一只足球。 正是这次对新视角预测能力的关键验证,三位创始人决定继续推进这一方向。此后,模型随着规模、训练时长和芯片数量增加而持续改善。 新视角预测已经回答了模型如何建立连贯空间,但若想让这个空间能够被创作者反复修改或用于设计,接下来的问题便是如何让它成为真实工作流程的一部分。 在前代模型 Marble 的使用中,创作者常先生成三维场景,再从不同位置截取画面,作为后续视频制作的素材。Atlas 希望把这一过程收进同一空间,让用户直接指定视角并继续生成所需镜头。这样一来,场景中的人物、道具和位置关系可以延续到下一步创作。 这种连续性也正是专业工作流所需要的,例如影视、游戏和营销项目要保留场景与布局以便修改,建筑、施工和展台制作也要把口头意见和草图落实到三维软件中。 Ben Mildenhall 表示,希望模型降低反复修改的负担,保留控制精度的同时使三维设计更接近搭积木或用铅笔勾画。 当场景可以从现实素材中被重建和修改,李飞飞又将它放入机器人研发的工作链。2026 年 7 月,World Labs 收购机器人公司 SceniX,补上了从现实环境重建、到模拟训练、再回到现实部署的技术链。 通过 Atlas 对真实场景进行重建并生成可调整的模拟环境,开发者可以在其中采集训练数据、训练机器人策略,并在部署前评估不同动作可能带来的结果。 李飞飞认为,机器人当前的主要瓶颈是数据。线缆弯曲方式、容器尺寸和颜色、物体摆放位置都可能变化,训练环境需要呈现这些差异,机器人才有机会应对部署时的不同情况。Atlas 可以将真实环境更快转入模拟,再改变其中的条件,补充难以逐一采集的训练情形。 图|Atlas 生成机器人模拟视角(来源:World Labs 官网) 不过,要训练机器人策略,模拟环境不能只停留在静态画面的复现。当机器人策略采取动作,环境还可能以意料之外的方式响应,训练就需要覆盖尽可能多的异常与失败情形。 Justin Johnson 表示,除人工编写规则的传统物理引擎外,团队还在探索“神经模拟器”,让模型从数据中学习环境面对不同动作时可能发生的变化。 此外,真实世界始终处于变化之中,模型还需要处理时间维度。针对 Atlas 动态能力,World Labs 团队表示,模型架构和预训练数据本已包含动态信息。不过,当前版本的后训练主要聚焦静态场景和空间移动,团队计划在后续版本中继续增强对时间变化的处理。 谈及未来规划,李飞飞认为,空间智能需要超越看见和解释场景,形成感知、体验与交互的闭环。她将其视为从空间生成迈向更高保真模拟、场景编辑和行动规划的方向,使模型进一步支持人和机器在空间中行动。 1.https://www.youtube.com/watch?v=qn1QDDBnTA0 2.https://www.worldlabs.ai/blog/atlas#spatial-reconstruction 3.https://www.worldlabs.ai/blog/atlas#robotics-simulation 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 界面新闻 2026-09-07 20:15:59 上观新闻 2026-09-08 09:04:25 鲁中晨报 2026-09-05 17:14:04 扬子晚报 2026-09-08 07:20:10 南方都市报 2026-09-08 10:51:28 南方都市报 2026-09-06 15:29:22 鲁中晨报 2026-09-06 15:47:03 上观新闻 2026-09-07 14:45:34 澎湃新闻 2026-09-07 22:05:05 新京报 2026-09-08 08:06:25 看看新闻Knews 2026-09-07 23:08:28 海峡导报社 2026-09-08 09:54:27 南方都市报 2026-09-07 14:44:06 第一财经资讯 2026-09-07 13:22:17 鲁中晨报 2026-09-08 07:03:22 新京报政事儿 2026-09-08 11:06:13 南方都市报 2026-09-06 11:41:02 新民晚报 2026-09-08 09:46:35 澎湃新闻 2026-09-08 10:36:13 人民资讯 2026-09-07 21:04:04 证券时报 2026-09-08 12:54:30 励职派 2026-09-08 12:56:15
绝杀+纪录+换帅齐登场,意甲本轮剧情看点直接拉满-0ac7945a
发布Atlas后,李飞飞最新访谈:如何预测一个未被拍下的世界 只用 3 部固定在三脚架上的 iPhone,Atlas 就能重现《黑客帝国》式的“子弹时间”,让镜头绕着凝固的动作移动。 这是 World Labs 最新发布的世界模型 Atlas 展示的能力之一。据 DeepTech 此前报道,这是全球首个多模态世界模型。它能以像素级精度控制镜头,根据参考图生成最长 1 分钟、最高 1,440p 的视频,还可用 1 张至数十张图像重建真实空间,输出新视角画面和显式 3D 结果。 近日,World Labs 联合创始人李飞飞、Justin Johnson 和 Ben Mildenhall 做客 a16z Show,与主持人 Martin Casado 讨论 Atlas。谈话从设计选择展开,也回顾了团队由多模态世界模型 Marble 转向 Atlas 的过程。 对谈中,团队将 Atlas 的核心能力称为“新视角预测”。区别于一般视频模型沿时间轴预测下一帧,Atlas 能够根据已有画面与相机位姿等,判断镜头移动到另一个时空位置后会看到什么。 李飞飞认为,生成具有空间语境和现实依据的像素,是通往空间智能的一步。这种能力既能帮助创作者维持场景与物体的一致性,也可能把现实环境转成机器人训练所需的模拟空间。 谈及后续路线,团队计划增强模型对动态变化和场景编辑的支持,并探索与机器人行动规划的结合,使其从呈现三维世界逐步走向理解和参与其中。 对谈从 Atlas 如何生成、重建和模拟世界出发。据 World Labs 团队介绍,Atlas 在预训练阶段共同处理文本、图像、视频、相机位姿和 3D 信息,并将其编码为“空间上下文”。每张图像都关联着三维相机位姿,位置和朝向得到明确标记。 除了相机参数,Atlas 还把深度图作为原生输入。RGB 图像记录某个位置看上去是什么样,深度图则描述物体与相机之间的距离,帮助模型判断前后遮挡和空间结构。换句话说,模型处理的不只是连续画面,还包括画面背后的三维关系。 李飞飞提到,计算机视觉发展半个多世纪以来,像素生成、识别和三维重建通常分属不同研究方向。Atlas 以视点和相机位姿估计为锚点,把像素生成与像素重建放进同一个模型,使两类任务可以在一套架构中相互配合。 在她看来,空间智能最终需要支持生成、推理、编辑和交互,而理解空间的几何、结构与物理规律是实现这些任务的基础。Atlas 可以估计每一帧对应的视角和相机位姿,使生成的像素受到空间语境和几何关系约束,因而构成了这条路径上的一个阶段。 针对 Marble 与 Atlas 的差异,联合创始人 Justin Johnson 解释,为便于在移动设备和游戏引擎中渲染,上一代多模态世界模型 Marble 主要以高斯泼溅表示三维场景。但由于模型的所有结果都须先落到这一种表示上,从而限制了其他输出。 针对这一问题,Atlas 进行了一些调整,即将不同模态更早分开,把“新视角预测”放在更基础的位置。模型先根据空间上下文生成指定视角的 RGB 画面或深度信息,需要明确的三维表示时,再生成高斯泼溅场景。换句话说,高斯泼溅不再是所有任务都必须经过的终点,而成为模型可按任务调用的一种输出形式。 图|Atlas 统一生成与空间重建(来源:World Labs官网) 此外,Atlas 还试图降低三维重建对密集拍摄的依赖。Ben Mildenhall 表示,传统方法需要让每处表面至少出现在 3 至 4 个视角中,拍摄一个房间可能需要 100 至 300 张照片。Atlas 有望将数量降到约 3 张,相当于减少 50 至 100 倍。 输入数量大幅减少后,模型要面对的考验是如何补足相机从未拍到的区域。李飞飞提到,在斯坦福校园的一次演示中,模型接收的 3 至 25 张照片全部从地面拍摄,却生成了校园上空的俯瞰画面。她指出,空中视角并非来自原始素材,而是在已知空间关系约束下生成的结果。 这一案例也再次说明了两类任务为何需要相互配合。尽管密集重建可以利用大量拍摄素材还原已被镜头捕捉到的区域,但难免会遗漏桌底、麦克风下方和椅腿之间等区域,Atlas 则能够“看到”这些细节。 在谈及团队如何确认这一技术路径时,李飞飞回忆道,2026 年初夏,一个小于当前版本的模型处理 NeRF 论文中的花园桌场景后,给出了此前未曾见过的桌下视角,出现了一只足球。 正是这次对新视角预测能力的关键验证,三位创始人决定继续推进这一方向。此后,模型随着规模、训练时长和芯片数量增加而持续改善。 新视角预测已经回答了模型如何建立连贯空间,但若想让这个空间能够被创作者反复修改或用于设计,接下来的问题便是如何让它成为真实工作流程的一部分。 在前代模型 Marble 的使用中,创作者常先生成三维场景,再从不同位置截取画面,作为后续视频制作的素材。Atlas 希望把这一过程收进同一空间,让用户直接指定视角并继续生成所需镜头。这样一来,场景中的人物、道具和位置关系可以延续到下一步创作。 这种连续性也正是专业工作流所需要的,例如影视、游戏和营销项目要保留场景与布局以便修改,建筑、施工和展台制作也要把口头意见和草图落实到三维软件中。 Ben Mildenhall 表示,希望模型降低反复修改的负担,保留控制精度的同时使三维设计更接近搭积木或用铅笔勾画。 当场景可以从现实素材中被重建和修改,李飞飞又将它放入机器人研发的工作链。2026 年 7 月,World Labs 收购机器人公司 SceniX,补上了从现实环境重建、到模拟训练、再回到现实部署的技术链。 通过 Atlas 对真实场景进行重建并生成可调整的模拟环境,开发者可以在其中采集训练数据、训练机器人策略,并在部署前评估不同动作可能带来的结果。 李飞飞认为,机器人当前的主要瓶颈是数据。线缆弯曲方式、容器尺寸和颜色、物体摆放位置都可能变化,训练环境需要呈现这些差异,机器人才有机会应对部署时的不同情况。Atlas 可以将真实环境更快转入模拟,再改变其中的条件,补充难以逐一采集的训练情形。 图|Atlas 生成机器人模拟视角(来源:World Labs 官网) 不过,要训练机器人策略,模拟环境不能只停留在静态画面的复现。当机器人策略采取动作,环境还可能以意料之外的方式响应,训练就需要覆盖尽可能多的异常与失败情形。 Justin Johnson 表示,除人工编写规则的传统物理引擎外,团队还在探索“神经模拟器”,让模型从数据中学习环境面对不同动作时可能发生的变化。 此外,真实世界始终处于变化之中,模型还需要处理时间维度。针对 Atlas 动态能力,World Labs 团队表示,模型架构和预训练数据本已包含动态信息。不过,当前版本的后训练主要聚焦静态场景和空间移动,团队计划在后续版本中继续增强对时间变化的处理。 谈及未来规划,李飞飞认为,空间智能需要超越看见和解释场景,形成感知、体验与交互的闭环。她将其视为从空间生成迈向更高保真模拟、场景编辑和行动规划的方向,使模型进一步支持人和机器在空间中行动。 1.https://www.youtube.com/watch?v=qn1QDDBnTA0 2.https://www.worldlabs.ai/blog/atlas#spatial-reconstruction 3.https://www.worldlabs.ai/blog/atlas#robotics-simulation 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 界面新闻 2026-09-07 20:15:59 上观新闻 2026-09-08 09:04:25 鲁中晨报 2026-09-05 17:14:04 扬子晚报 2026-09-08 07:20:10 南方都市报 2026-09-08 10:51:28 南方都市报 2026-09-06 15:29:22 鲁中晨报 2026-09-06 15:47:03 上观新闻 2026-09-07 14:45:34 澎湃新闻 2026-09-07 22:05:05 新京报 2026-09-08 08:06:25 看看新闻Knews 2026-09-07 23:08:28 海峡导报社 2026-09-08 09:54:27 南方都市报 2026-09-07 14:44:06 第一财经资讯 2026-09-07 13:22:17 鲁中晨报 2026-09-08 07:03:22 新京报政事儿 2026-09-08 11:06:13 南方都市报 2026-09-06 11:41:02 新民晚报 2026-09-08 09:46:35 澎湃新闻 2026-09-08 10:36:13 人民资讯 2026-09-07 21:04:04 证券时报 2026-09-08 12:54:30 励职派 2026-09-08 12:56:15
转载请注明出处
本文的链接地址:http://www.teycb.com/ArTicle/details/42705368.sHtML
本文最后 发布于2026-09-09 19:21:43,已经过了0天没有更新,若内容或图片 失效,请留言反馈
推荐阅读
- 美国国债收益率走高,短端领跌,油价尾盘恢复涨势-rssai3db6b419c1638459
- 商飞C909完成RNP AR审定试飞,验证高精度导航与复杂地形运行能力-c72c1b55
- "史上改款幅度最大的宝马车型,百万D级旗舰改款近乎换代!新款宝马7系下线-b358e66e
- 乘联分会:8月新能源乘用车企总体走势较强,新能源月度批发销量破万辆厂商达19家-5323674c
- 魏牌全新蓝山申报信息曝光 方盒子造型 56座可选-50c78c0f
- 全北京人都来了!首钢园3D灯光秀,最全打卡攻略-fe043273
- 直击业绩会-f20ba790
- 黑龙江一残疾人领2.6万元低保被控诈骗,房产车位成焦点,一审未宣判-a3e20bec
- 凯发最新登录网站使用指南了解平台信息与安全访问要点
- CFA协会报告显示中国绿色金融人才需求转向质量提升-news442317ac981a698f
-

中国女篮只要发挥出自身的特点和优势 大概率拿下波多黎各晋级8强-6db4a442
"张新当选中国羽毛球协会主席:将坚决把反腐败斗争进行到底-dd2abdda"
9天前
-

知情人士称沙特阿美位于吉赞的石油设施再次遭到袭击-4c8635a3
《周末一起看电影》聚焦《欢迎来龙餐馆》幕后故事-newse3430fe3d2c64a12
4天前
-

知情人士称沙特阿美位于吉赞的石油设施再次遭到袭击-4c8635a3
"夏天上衣不要只穿黑色或白色,试试这几件彩色T恤,亮眼又减龄-33a231cd"
0天前
-

霍里:1995年我尾骨骨折还坚持上场并夺冠 现在的球员太弱了-b0b6a2e0
知情人士称沙特阿美位于吉赞的石油设施再次遭到袭击-4c8635a3
4天前
-

铜价上涨“冲击波”,AI算力引爆全球“抢铜”大战-e126112e
凯发k8国际登录厅打造便捷娱乐体验与智能服务融合的新选择
0天前
-

马斯克“好大儿”嘲讽AI、机器人-aa804458
郑钦文打哭斯瓦泰克,后者不服气,下一战对手放狠话应战!-bd9bcf68
6天前
-

索尔斯克亚:当你拥有姆巴佩时,你就知道随时都能赢下比赛-8088f55d
美网|0比5落后再翻盘已成标配剧情,郑钦文昂首杀入女单八强-cd6d0a5a
7天前
-

超强厄尔尼诺来袭,农业、化肥板块大涨!铜、传媒概念表现活跃,液冷服务器概念走弱,超3400只个股上涨|A股早盘-25bf81df
乘联分会:8月新能源乘用车企总体走势较强,新能源月度批发销量破万辆厂商达19家-5323674c
5天前
-

希拉谈加盟米兰原因:与阿莫林战术理念契合成为关键-rssai2908f19e8d5b4136
40岁演员辛芷蕾参加越野赛,尽显运动活力,网友:她笑起来真好看…-a87df267
8天前
-

买了学区房,却因房间太小孩子无法入学?山东菏泽这所学校五年后疑因卡面积再陷争议-32133bc7
美网|0比5落后再翻盘已成标配剧情,郑钦文昂首杀入女单八强-cd6d0a5a
5天前
-

男子酒后与妻子拌嘴撞电梯门后坠亡 妻子向物业等索赔超百万 法院判了-aaa4b3e6
强援报到!库明加飞抵明尼阿波利斯 眼眶发红似是熬了大夜-aee72356
9天前
-

视频丨遇到可疑场景无法辨别?快试试“国家反诈AI”App-cfde264c
车企工人钻入车底拆螺栓被压身亡,深圳坪山官方披露事故详情-42d3eab4
2天前
猴子
陈人毓 

















