〖One〗,2026年国家医保谈判在北京启动;珍视明回应滴眼液抽检不合格事件-5b731b82
,OpenAI、Google、腾讯已兵临城下,世界模型:字节跳动输不起的必答题
每经网首页
>
要闻
>
正文
每经记者|李宇彤 每经编辑|董兴生
9月7日,市场消息称,字节跳动正在基于旗下视频生成模型Seedance,开发一款实时空间视频生成模型。截至发稿,字节方面未对此做出官方回应,甚至有知情人士称,部分市场传言失实。
但比传言更值得追问的是,当世界模型成为全球科技巨头的必答题,字节跳动能缺席吗?
潮水的方向已然清晰。2025年下半年起,OpenAI、Google、Meta、NVIDIA相继入局世界模型,国内腾讯开源混元3D世界模型2.0,阿里发布HappyOyster 1.0。据《2026世界模型专题研究报告》,今年前7个月中国一级市场相关概念累计涌入资金666亿元,58家企业获得融资,占赛道公司总量(64家)的91%。
字节并非毫无准备。《每日经济新闻》记者梳理发现,字节已经发布视频生成模型Seedance 2.5、视觉空间重建模型Depth Anything 3、新一代3D生成大模型Seed3D 2.0,乃至预计将在今年第四季度登场的全新VR头显Pico Space Pro,再加上对影眸科技、生数科技、自变量机器人等相关投资,字节跳动一张“自研加投资”的世界模型拼图正在成形。
天使投资人、资深人工智能专家郭涛在接受记者采访时直言,字节的基本盘扎根于短视频算法推荐与海量图文视频内容生态,但这套能力集中于二维信息流,与实时交互、三维空间生成的世界模型存在“技术代差”。如果字节主动放弃世界模型这条赛道,被下一代交互形态边缘化的风险较高。郭涛也指出,世界模型尚处于技术路线并未完全收敛的早期阶段,对字节而言属于必须布局的前沿探索,但并非当下就要抢占的确定性入口。
当AI硬件与大模型加速迭代,直播、短剧、游戏等场景不断被重新定义,字节能否把手中散落的能力、业务拼成一张完整版图,构建出AI时代新的竞争力,显然成为业界关注焦点所在。
梳理字节已有版图,视频生成是其中最核心的一块。7月31日,字节Seed团队发布Seedance 2.5,单次原生生成时长从15秒提升至30秒,支持最多50个多模态参考素材同时输入,新增白模、绿幕参考能力。
火山引擎总裁谭待曾表示,世界模型流派很多,但视频生成是非常有效的一条,它不需要对数据做太多假设和采集,现有海量视频可以做大量无监督学习,“我们对于这条路还是非常看好的”。谭待透露,已有具身智能公司用Seedance做数据合成反哺模型。
光会生成视频不够,世界模型的前提是理解空间。字节Seed团队去年发布视觉空间重建模型Depth Anything 3,能从任意视觉输入中恢复三维几何结构。今年4月23日,Seed3D 2.0发布,在几何生成、纹理材质生成两项核心指标上均取得SOTA(当前最优)结果。
硬件入口上,字节2021年收购的Pico头显已被外界视为世界模型的重要交互终端。值得一提的是,Pico一款全新VR头显通过美国联邦通信委员会认证,预计为将于第四季度登场的Pico Space Pro。此前的8月24日,PICO-XR官方宣布将发布时间由9月2日调整至第四季度,称在最后体验验证中看到了“一个令人兴奋的全新机会”,决定多花时间对软件体验做重大升级。
投资层面同样在卡位。字节已投资影眸科技、生数科技、未来不远机器人,并领投自变量机器人10亿元A++轮融资,其中自变量是国内唯一同时获得字节、美团、阿里三家巨头投资的具身智能企业。
而被投企业也在密集推新。9月1日,影眸科技发布世界生成模型Hyper3D WorldGen,上传一张场景图片即可自动生成独立3D资产。此外,其Rodin模型上线45天即实现100万美元年经常性收入。未来不远机器人5月发布基于WAM世界动作模型的新一代机器人大脑,让机器人具备物理推演能力,目前已启动第三代大脑研发。字节通过锦秋基金在机器人赛道累计投资超10笔,这些公司的仿真环境、机器人数据与世界模型形成互补。
字节自研加投资双轮驱动的全栈布局已然成形,但这套拼图最终要拼出什么?答案或许不在某一款产品。布局世界模型,对字节而言打开的不是单一功能,而是一整套交互逻辑的升级,基于二维信息流的内容形态都将被重新定义。
与此同时,腾讯开源了混元3D世界模型2.0,阿里推出了HappyOyster,对手也已就位。
但对于能否跑出来,郭涛分析,字节的优势足够明显——海量用户交互行为数据、短视频与实景视频素材能为世界模型训练提供丰富原始数据,成熟的工程化落地能力与大规模算力调度经验有利于模型迭代与产品化验证。但字节同样具有短板:缺少机器人、虚拟现实场景的物理交互数据,物理仿真与三维底层算法积累相对薄弱,原有短视频内容生态不能直接平移复用至三维空间,人才储备与仿真工具链仍需补齐。
资本追捧与技术现实之间,横亘着一条尚难跨越的鸿沟。
在今年中关村论坛的圆桌会议上,耀途资本创始合伙人白宗义直言:“现在不谈世界模型都不好意思融资,但只要涉及这个概念,估值就直奔亿美元级别。”流形空间创始人武伟则警告:“世界模型的定义正在被无限扩大,这与当年元宇宙概念炒作如出一辙。”
概念炒作之外,技术本身的成熟度同样值得审视。
今年7月,南洋理工大学S-Lab团队提出首个以物理定律为核心的视频模型评估基准Apple-π,结果显示即使是SOTA模型的得分也只有0.473。研究指出,模型更多依赖“表层视觉模式匹配”,尚未形成“稳定的物理状态建模能力”,能生成看起来合理的画面,但并不真正理解物体为何会那样运动。
今年1月,Google DeepMind正式开放Project Genie公测,在2026年游戏开发者大会上披露的Genie 3真实能力是:初始版本只能在几秒钟内维持3D世界连贯性,升级后提升到大约一分钟。官方也承认生成的世界“可能看起来不够真实”,角色控制存在延迟。
今年6月,北京智源人工智能研究院院长王仲远在一次群访中坦言,目前4种类型的世界模型距离真正能理解、预测、交互真实物理世界的基座模型,都还有非常大的差距,行业仍处于非常早期的阶段。
对于字节的双线布局,郭涛也从商业角度进行了分析。在他看来,该布局不以短期财务回报为首要目标,更多着眼于技术生态卡位和前沿技术情报收集。投资可以降低内部试错成本,观察外部技术路线演进,但内外协同、技术成果转化落地,仍是后续需要面对的现实挑战。
时间窗口上,郭涛判断,综合产业迭代节奏,世界模型实现大规模可用大致需要三至五年。瓶颈突破不单依靠算法本身,还需要配套数据、仿真工具、硬件终端协同成熟,短期难达消费级普及。
但同时,如果字节主动放弃这条赛道,被下一代交互形态边缘化的风险较高。郭涛指出,字节当前的核心优势建立在信息流时代,AI驱动的三维实时交互将重塑内容分发逻辑,属于技术驱动的范式变迁。即便现有短视频业务基本盘稳固,若缺席世界模型相关技术积累,未来在新型交互产品的竞争中将会丧失技术主动权,流量与生态优势会被逐步削弱。
如需转载请与《每日经济新闻》报社联系。未经《每日经济新闻》报社授权,严禁转载或镜像,违者必究。
特别提醒:如果我们使用了您的图片,请作者与本站联系索取稿酬。如您不希望作品出现在本站,可联系我们要求撤下您的作品。
毕得医药:控股股东及一致行动人拟合计减持不超3.01%股份
原油系期货主力合约集体走强,SC原油涨幅扩大至5.18%
Copyright © 2026 每日经济新闻报社版权所有,未经许可不得转载使用,违者必究。
广告热线 北京: 010-57613265, 上海: 021-61283008, 广州: 020-84201861, 深圳: 0755-83520159, 成都: 028-86512112
互联网新闻信息服务许可证:51120190017
网站备案号:蜀ICP备19004508号-3
川公网安备 51019002002026号
新闻职业道德监督热线:400 889 0008 邮箱:zbb@nbd.com.cn
〖Two〗,名古屋强降雨致交通受影响 多处亚运会场馆漏雨-rssai30e2ac82dd88d117,OpenAI、Google、腾讯已兵临城下,世界模型:字节跳动输不起的必答题
每经网首页
>
要闻
>
正文
每经记者|李宇彤 每经编辑|董兴生
9月7日,市场消息称,字节跳动正在基于旗下视频生成模型Seedance,开发一款实时空间视频生成模型。截至发稿,字节方面未对此做出官方回应,甚至有知情人士称,部分市场传言失实。
但比传言更值得追问的是,当世界模型成为全球科技巨头的必答题,字节跳动能缺席吗?
潮水的方向已然清晰。2025年下半年起,OpenAI、Google、Meta、NVIDIA相继入局世界模型,国内腾讯开源混元3D世界模型2.0,阿里发布HappyOyster 1.0。据《2026世界模型专题研究报告》,今年前7个月中国一级市场相关概念累计涌入资金666亿元,58家企业获得融资,占赛道公司总量(64家)的91%。
字节并非毫无准备。《每日经济新闻》记者梳理发现,字节已经发布视频生成模型Seedance 2.5、视觉空间重建模型Depth Anything 3、新一代3D生成大模型Seed3D 2.0,乃至预计将在今年第四季度登场的全新VR头显Pico Space Pro,再加上对影眸科技、生数科技、自变量机器人等相关投资,字节跳动一张“自研加投资”的世界模型拼图正在成形。
天使投资人、资深人工智能专家郭涛在接受记者采访时直言,字节的基本盘扎根于短视频算法推荐与海量图文视频内容生态,但这套能力集中于二维信息流,与实时交互、三维空间生成的世界模型存在“技术代差”。如果字节主动放弃世界模型这条赛道,被下一代交互形态边缘化的风险较高。郭涛也指出,世界模型尚处于技术路线并未完全收敛的早期阶段,对字节而言属于必须布局的前沿探索,但并非当下就要抢占的确定性入口。
当AI硬件与大模型加速迭代,直播、短剧、游戏等场景不断被重新定义,字节能否把手中散落的能力、业务拼成一张完整版图,构建出AI时代新的竞争力,显然成为业界关注焦点所在。
梳理字节已有版图,视频生成是其中最核心的一块。7月31日,字节Seed团队发布Seedance 2.5,单次原生生成时长从15秒提升至30秒,支持最多50个多模态参考素材同时输入,新增白模、绿幕参考能力。
火山引擎总裁谭待曾表示,世界模型流派很多,但视频生成是非常有效的一条,它不需要对数据做太多假设和采集,现有海量视频可以做大量无监督学习,“我们对于这条路还是非常看好的”。谭待透露,已有具身智能公司用Seedance做数据合成反哺模型。
光会生成视频不够,世界模型的前提是理解空间。字节Seed团队去年发布视觉空间重建模型Depth Anything 3,能从任意视觉输入中恢复三维几何结构。今年4月23日,Seed3D 2.0发布,在几何生成、纹理材质生成两项核心指标上均取得SOTA(当前最优)结果。
硬件入口上,字节2021年收购的Pico头显已被外界视为世界模型的重要交互终端。值得一提的是,Pico一款全新VR头显通过美国联邦通信委员会认证,预计为将于第四季度登场的Pico Space Pro。此前的8月24日,PICO-XR官方宣布将发布时间由9月2日调整至第四季度,称在最后体验验证中看到了“一个令人兴奋的全新机会”,决定多花时间对软件体验做重大升级。
投资层面同样在卡位。字节已投资影眸科技、生数科技、未来不远机器人,并领投自变量机器人10亿元A++轮融资,其中自变量是国内唯一同时获得字节、美团、阿里三家巨头投资的具身智能企业。
而被投企业也在密集推新。9月1日,影眸科技发布世界生成模型Hyper3D WorldGen,上传一张场景图片即可自动生成独立3D资产。此外,其Rodin模型上线45天即实现100万美元年经常性收入。未来不远机器人5月发布基于WAM世界动作模型的新一代机器人大脑,让机器人具备物理推演能力,目前已启动第三代大脑研发。字节通过锦秋基金在机器人赛道累计投资超10笔,这些公司的仿真环境、机器人数据与世界模型形成互补。
字节自研加投资双轮驱动的全栈布局已然成形,但这套拼图最终要拼出什么?答案或许不在某一款产品。布局世界模型,对字节而言打开的不是单一功能,而是一整套交互逻辑的升级,基于二维信息流的内容形态都将被重新定义。
与此同时,腾讯开源了混元3D世界模型2.0,阿里推出了HappyOyster,对手也已就位。
但对于能否跑出来,郭涛分析,字节的优势足够明显——海量用户交互行为数据、短视频与实景视频素材能为世界模型训练提供丰富原始数据,成熟的工程化落地能力与大规模算力调度经验有利于模型迭代与产品化验证。但字节同样具有短板:缺少机器人、虚拟现实场景的物理交互数据,物理仿真与三维底层算法积累相对薄弱,原有短视频内容生态不能直接平移复用至三维空间,人才储备与仿真工具链仍需补齐。
资本追捧与技术现实之间,横亘着一条尚难跨越的鸿沟。
在今年中关村论坛的圆桌会议上,耀途资本创始合伙人白宗义直言:“现在不谈世界模型都不好意思融资,但只要涉及这个概念,估值就直奔亿美元级别。”流形空间创始人武伟则警告:“世界模型的定义正在被无限扩大,这与当年元宇宙概念炒作如出一辙。”
概念炒作之外,技术本身的成熟度同样值得审视。
今年7月,南洋理工大学S-Lab团队提出首个以物理定律为核心的视频模型评估基准Apple-π,结果显示即使是SOTA模型的得分也只有0.473。研究指出,模型更多依赖“表层视觉模式匹配”,尚未形成“稳定的物理状态建模能力”,能生成看起来合理的画面,但并不真正理解物体为何会那样运动。
今年1月,Google DeepMind正式开放Project Genie公测,在2026年游戏开发者大会上披露的Genie 3真实能力是:初始版本只能在几秒钟内维持3D世界连贯性,升级后提升到大约一分钟。官方也承认生成的世界“可能看起来不够真实”,角色控制存在延迟。
今年6月,北京智源人工智能研究院院长王仲远在一次群访中坦言,目前4种类型的世界模型距离真正能理解、预测、交互真实物理世界的基座模型,都还有非常大的差距,行业仍处于非常早期的阶段。
对于字节的双线布局,郭涛也从商业角度进行了分析。在他看来,该布局不以短期财务回报为首要目标,更多着眼于技术生态卡位和前沿技术情报收集。投资可以降低内部试错成本,观察外部技术路线演进,但内外协同、技术成果转化落地,仍是后续需要面对的现实挑战。
时间窗口上,郭涛判断,综合产业迭代节奏,世界模型实现大规模可用大致需要三至五年。瓶颈突破不单依靠算法本身,还需要配套数据、仿真工具、硬件终端协同成熟,短期难达消费级普及。
但同时,如果字节主动放弃这条赛道,被下一代交互形态边缘化的风险较高。郭涛指出,字节当前的核心优势建立在信息流时代,AI驱动的三维实时交互将重塑内容分发逻辑,属于技术驱动的范式变迁。即便现有短视频业务基本盘稳固,若缺席世界模型相关技术积累,未来在新型交互产品的竞争中将会丧失技术主动权,流量与生态优势会被逐步削弱。
如需转载请与《每日经济新闻》报社联系。未经《每日经济新闻》报社授权,严禁转载或镜像,违者必究。
特别提醒:如果我们使用了您的图片,请作者与本站联系索取稿酬。如您不希望作品出现在本站,可联系我们要求撤下您的作品。
毕得医药:控股股东及一致行动人拟合计减持不超3.01%股份
原油系期货主力合约集体走强,SC原油涨幅扩大至5.18%
Copyright © 2026 每日经济新闻报社版权所有,未经许可不得转载使用,违者必究。
广告热线 北京: 010-57613265, 上海: 021-61283008, 广州: 020-84201861, 深圳: 0755-83520159, 成都: 028-86512112
互联网新闻信息服务许可证:51120190017
网站备案号:蜀ICP备19004508号-3
川公网安备 51019002002026号
新闻职业道德监督热线:400 889 0008 邮箱:zbb@nbd.com.cn
〖Three〗,甘西:引进詹姆斯让球队更强 试问哪支球队不想拥有詹姆斯呢?-80f17850,OpenAI、Google、腾讯已兵临城下,世界模型:字节跳动输不起的必答题
每经网首页
>
要闻
>
正文
每经记者|李宇彤 每经编辑|董兴生
9月7日,市场消息称,字节跳动正在基于旗下视频生成模型Seedance,开发一款实时空间视频生成模型。截至发稿,字节方面未对此做出官方回应,甚至有知情人士称,部分市场传言失实。
但比传言更值得追问的是,当世界模型成为全球科技巨头的必答题,字节跳动能缺席吗?
潮水的方向已然清晰。2025年下半年起,OpenAI、Google、Meta、NVIDIA相继入局世界模型,国内腾讯开源混元3D世界模型2.0,阿里发布HappyOyster 1.0。据《2026世界模型专题研究报告》,今年前7个月中国一级市场相关概念累计涌入资金666亿元,58家企业获得融资,占赛道公司总量(64家)的91%。
字节并非毫无准备。《每日经济新闻》记者梳理发现,字节已经发布视频生成模型Seedance 2.5、视觉空间重建模型Depth Anything 3、新一代3D生成大模型Seed3D 2.0,乃至预计将在今年第四季度登场的全新VR头显Pico Space Pro,再加上对影眸科技、生数科技、自变量机器人等相关投资,字节跳动一张“自研加投资”的世界模型拼图正在成形。
天使投资人、资深人工智能专家郭涛在接受记者采访时直言,字节的基本盘扎根于短视频算法推荐与海量图文视频内容生态,但这套能力集中于二维信息流,与实时交互、三维空间生成的世界模型存在“技术代差”。如果字节主动放弃世界模型这条赛道,被下一代交互形态边缘化的风险较高。郭涛也指出,世界模型尚处于技术路线并未完全收敛的早期阶段,对字节而言属于必须布局的前沿探索,但并非当下就要抢占的确定性入口。
当AI硬件与大模型加速迭代,直播、短剧、游戏等场景不断被重新定义,字节能否把手中散落的能力、业务拼成一张完整版图,构建出AI时代新的竞争力,显然成为业界关注焦点所在。
梳理字节已有版图,视频生成是其中最核心的一块。7月31日,字节Seed团队发布Seedance 2.5,单次原生生成时长从15秒提升至30秒,支持最多50个多模态参考素材同时输入,新增白模、绿幕参考能力。
火山引擎总裁谭待曾表示,世界模型流派很多,但视频生成是非常有效的一条,它不需要对数据做太多假设和采集,现有海量视频可以做大量无监督学习,“我们对于这条路还是非常看好的”。谭待透露,已有具身智能公司用Seedance做数据合成反哺模型。
光会生成视频不够,世界模型的前提是理解空间。字节Seed团队去年发布视觉空间重建模型Depth Anything 3,能从任意视觉输入中恢复三维几何结构。今年4月23日,Seed3D 2.0发布,在几何生成、纹理材质生成两项核心指标上均取得SOTA(当前最优)结果。
硬件入口上,字节2021年收购的Pico头显已被外界视为世界模型的重要交互终端。值得一提的是,Pico一款全新VR头显通过美国联邦通信委员会认证,预计为将于第四季度登场的Pico Space Pro。此前的8月24日,PICO-XR官方宣布将发布时间由9月2日调整至第四季度,称在最后体验验证中看到了“一个令人兴奋的全新机会”,决定多花时间对软件体验做重大升级。
投资层面同样在卡位。字节已投资影眸科技、生数科技、未来不远机器人,并领投自变量机器人10亿元A++轮融资,其中自变量是国内唯一同时获得字节、美团、阿里三家巨头投资的具身智能企业。
而被投企业也在密集推新。9月1日,影眸科技发布世界生成模型Hyper3D WorldGen,上传一张场景图片即可自动生成独立3D资产。此外,其Rodin模型上线45天即实现100万美元年经常性收入。未来不远机器人5月发布基于WAM世界动作模型的新一代机器人大脑,让机器人具备物理推演能力,目前已启动第三代大脑研发。字节通过锦秋基金在机器人赛道累计投资超10笔,这些公司的仿真环境、机器人数据与世界模型形成互补。
字节自研加投资双轮驱动的全栈布局已然成形,但这套拼图最终要拼出什么?答案或许不在某一款产品。布局世界模型,对字节而言打开的不是单一功能,而是一整套交互逻辑的升级,基于二维信息流的内容形态都将被重新定义。
与此同时,腾讯开源了混元3D世界模型2.0,阿里推出了HappyOyster,对手也已就位。
但对于能否跑出来,郭涛分析,字节的优势足够明显——海量用户交互行为数据、短视频与实景视频素材能为世界模型训练提供丰富原始数据,成熟的工程化落地能力与大规模算力调度经验有利于模型迭代与产品化验证。但字节同样具有短板:缺少机器人、虚拟现实场景的物理交互数据,物理仿真与三维底层算法积累相对薄弱,原有短视频内容生态不能直接平移复用至三维空间,人才储备与仿真工具链仍需补齐。
资本追捧与技术现实之间,横亘着一条尚难跨越的鸿沟。
在今年中关村论坛的圆桌会议上,耀途资本创始合伙人白宗义直言:“现在不谈世界模型都不好意思融资,但只要涉及这个概念,估值就直奔亿美元级别。”流形空间创始人武伟则警告:“世界模型的定义正在被无限扩大,这与当年元宇宙概念炒作如出一辙。”
概念炒作之外,技术本身的成熟度同样值得审视。
今年7月,南洋理工大学S-Lab团队提出首个以物理定律为核心的视频模型评估基准Apple-π,结果显示即使是SOTA模型的得分也只有0.473。研究指出,模型更多依赖“表层视觉模式匹配”,尚未形成“稳定的物理状态建模能力”,能生成看起来合理的画面,但并不真正理解物体为何会那样运动。
今年1月,Google DeepMind正式开放Project Genie公测,在2026年游戏开发者大会上披露的Genie 3真实能力是:初始版本只能在几秒钟内维持3D世界连贯性,升级后提升到大约一分钟。官方也承认生成的世界“可能看起来不够真实”,角色控制存在延迟。
今年6月,北京智源人工智能研究院院长王仲远在一次群访中坦言,目前4种类型的世界模型距离真正能理解、预测、交互真实物理世界的基座模型,都还有非常大的差距,行业仍处于非常早期的阶段。
对于字节的双线布局,郭涛也从商业角度进行了分析。在他看来,该布局不以短期财务回报为首要目标,更多着眼于技术生态卡位和前沿技术情报收集。投资可以降低内部试错成本,观察外部技术路线演进,但内外协同、技术成果转化落地,仍是后续需要面对的现实挑战。
时间窗口上,郭涛判断,综合产业迭代节奏,世界模型实现大规模可用大致需要三至五年。瓶颈突破不单依靠算法本身,还需要配套数据、仿真工具、硬件终端协同成熟,短期难达消费级普及。
但同时,如果字节主动放弃这条赛道,被下一代交互形态边缘化的风险较高。郭涛指出,字节当前的核心优势建立在信息流时代,AI驱动的三维实时交互将重塑内容分发逻辑,属于技术驱动的范式变迁。即便现有短视频业务基本盘稳固,若缺席世界模型相关技术积累,未来在新型交互产品的竞争中将会丧失技术主动权,流量与生态优势会被逐步削弱。
如需转载请与《每日经济新闻》报社联系。未经《每日经济新闻》报社授权,严禁转载或镜像,违者必究。
特别提醒:如果我们使用了您的图片,请作者与本站联系索取稿酬。如您不希望作品出现在本站,可联系我们要求撤下您的作品。
毕得医药:控股股东及一致行动人拟合计减持不超3.01%股份
原油系期货主力合约集体走强,SC原油涨幅扩大至5.18%
Copyright © 2026 每日经济新闻报社版权所有,未经许可不得转载使用,违者必究。
广告热线 北京: 010-57613265, 上海: 021-61283008, 广州: 020-84201861, 深圳: 0755-83520159, 成都: 028-86512112
互联网新闻信息服务许可证:51120190017
网站备案号:蜀ICP备19004508号-3
川公网安备 51019002002026号
新闻职业道德监督热线:400 889 0008 邮箱:zbb@nbd.com.cn
〖Four〗,【习声回响·聆听温暖中国】呵护水清岸绿 人江和谐共生-73710fee,OpenAI、Google、腾讯已兵临城下,世界模型:字节跳动输不起的必答题
每经网首页
>
要闻
>
正文
每经记者|李宇彤 每经编辑|董兴生
9月7日,市场消息称,字节跳动正在基于旗下视频生成模型Seedance,开发一款实时空间视频生成模型。截至发稿,字节方面未对此做出官方回应,甚至有知情人士称,部分市场传言失实。
但比传言更值得追问的是,当世界模型成为全球科技巨头的必答题,字节跳动能缺席吗?
潮水的方向已然清晰。2025年下半年起,OpenAI、Google、Meta、NVIDIA相继入局世界模型,国内腾讯开源混元3D世界模型2.0,阿里发布HappyOyster 1.0。据《2026世界模型专题研究报告》,今年前7个月中国一级市场相关概念累计涌入资金666亿元,58家企业获得融资,占赛道公司总量(64家)的91%。
字节并非毫无准备。《每日经济新闻》记者梳理发现,字节已经发布视频生成模型Seedance 2.5、视觉空间重建模型Depth Anything 3、新一代3D生成大模型Seed3D 2.0,乃至预计将在今年第四季度登场的全新VR头显Pico Space Pro,再加上对影眸科技、生数科技、自变量机器人等相关投资,字节跳动一张“自研加投资”的世界模型拼图正在成形。
天使投资人、资深人工智能专家郭涛在接受记者采访时直言,字节的基本盘扎根于短视频算法推荐与海量图文视频内容生态,但这套能力集中于二维信息流,与实时交互、三维空间生成的世界模型存在“技术代差”。如果字节主动放弃世界模型这条赛道,被下一代交互形态边缘化的风险较高。郭涛也指出,世界模型尚处于技术路线并未完全收敛的早期阶段,对字节而言属于必须布局的前沿探索,但并非当下就要抢占的确定性入口。
当AI硬件与大模型加速迭代,直播、短剧、游戏等场景不断被重新定义,字节能否把手中散落的能力、业务拼成一张完整版图,构建出AI时代新的竞争力,显然成为业界关注焦点所在。
梳理字节已有版图,视频生成是其中最核心的一块。7月31日,字节Seed团队发布Seedance 2.5,单次原生生成时长从15秒提升至30秒,支持最多50个多模态参考素材同时输入,新增白模、绿幕参考能力。
火山引擎总裁谭待曾表示,世界模型流派很多,但视频生成是非常有效的一条,它不需要对数据做太多假设和采集,现有海量视频可以做大量无监督学习,“我们对于这条路还是非常看好的”。谭待透露,已有具身智能公司用Seedance做数据合成反哺模型。
光会生成视频不够,世界模型的前提是理解空间。字节Seed团队去年发布视觉空间重建模型Depth Anything 3,能从任意视觉输入中恢复三维几何结构。今年4月23日,Seed3D 2.0发布,在几何生成、纹理材质生成两项核心指标上均取得SOTA(当前最优)结果。
硬件入口上,字节2021年收购的Pico头显已被外界视为世界模型的重要交互终端。值得一提的是,Pico一款全新VR头显通过美国联邦通信委员会认证,预计为将于第四季度登场的Pico Space Pro。此前的8月24日,PICO-XR官方宣布将发布时间由9月2日调整至第四季度,称在最后体验验证中看到了“一个令人兴奋的全新机会”,决定多花时间对软件体验做重大升级。
投资层面同样在卡位。字节已投资影眸科技、生数科技、未来不远机器人,并领投自变量机器人10亿元A++轮融资,其中自变量是国内唯一同时获得字节、美团、阿里三家巨头投资的具身智能企业。
而被投企业也在密集推新。9月1日,影眸科技发布世界生成模型Hyper3D WorldGen,上传一张场景图片即可自动生成独立3D资产。此外,其Rodin模型上线45天即实现100万美元年经常性收入。未来不远机器人5月发布基于WAM世界动作模型的新一代机器人大脑,让机器人具备物理推演能力,目前已启动第三代大脑研发。字节通过锦秋基金在机器人赛道累计投资超10笔,这些公司的仿真环境、机器人数据与世界模型形成互补。
字节自研加投资双轮驱动的全栈布局已然成形,但这套拼图最终要拼出什么?答案或许不在某一款产品。布局世界模型,对字节而言打开的不是单一功能,而是一整套交互逻辑的升级,基于二维信息流的内容形态都将被重新定义。
与此同时,腾讯开源了混元3D世界模型2.0,阿里推出了HappyOyster,对手也已就位。
但对于能否跑出来,郭涛分析,字节的优势足够明显——海量用户交互行为数据、短视频与实景视频素材能为世界模型训练提供丰富原始数据,成熟的工程化落地能力与大规模算力调度经验有利于模型迭代与产品化验证。但字节同样具有短板:缺少机器人、虚拟现实场景的物理交互数据,物理仿真与三维底层算法积累相对薄弱,原有短视频内容生态不能直接平移复用至三维空间,人才储备与仿真工具链仍需补齐。
资本追捧与技术现实之间,横亘着一条尚难跨越的鸿沟。
在今年中关村论坛的圆桌会议上,耀途资本创始合伙人白宗义直言:“现在不谈世界模型都不好意思融资,但只要涉及这个概念,估值就直奔亿美元级别。”流形空间创始人武伟则警告:“世界模型的定义正在被无限扩大,这与当年元宇宙概念炒作如出一辙。”
概念炒作之外,技术本身的成熟度同样值得审视。
今年7月,南洋理工大学S-Lab团队提出首个以物理定律为核心的视频模型评估基准Apple-π,结果显示即使是SOTA模型的得分也只有0.473。研究指出,模型更多依赖“表层视觉模式匹配”,尚未形成“稳定的物理状态建模能力”,能生成看起来合理的画面,但并不真正理解物体为何会那样运动。
今年1月,Google DeepMind正式开放Project Genie公测,在2026年游戏开发者大会上披露的Genie 3真实能力是:初始版本只能在几秒钟内维持3D世界连贯性,升级后提升到大约一分钟。官方也承认生成的世界“可能看起来不够真实”,角色控制存在延迟。
今年6月,北京智源人工智能研究院院长王仲远在一次群访中坦言,目前4种类型的世界模型距离真正能理解、预测、交互真实物理世界的基座模型,都还有非常大的差距,行业仍处于非常早期的阶段。
对于字节的双线布局,郭涛也从商业角度进行了分析。在他看来,该布局不以短期财务回报为首要目标,更多着眼于技术生态卡位和前沿技术情报收集。投资可以降低内部试错成本,观察外部技术路线演进,但内外协同、技术成果转化落地,仍是后续需要面对的现实挑战。
时间窗口上,郭涛判断,综合产业迭代节奏,世界模型实现大规模可用大致需要三至五年。瓶颈突破不单依靠算法本身,还需要配套数据、仿真工具、硬件终端协同成熟,短期难达消费级普及。
但同时,如果字节主动放弃这条赛道,被下一代交互形态边缘化的风险较高。郭涛指出,字节当前的核心优势建立在信息流时代,AI驱动的三维实时交互将重塑内容分发逻辑,属于技术驱动的范式变迁。即便现有短视频业务基本盘稳固,若缺席世界模型相关技术积累,未来在新型交互产品的竞争中将会丧失技术主动权,流量与生态优势会被逐步削弱。
如需转载请与《每日经济新闻》报社联系。未经《每日经济新闻》报社授权,严禁转载或镜像,违者必究。
特别提醒:如果我们使用了您的图片,请作者与本站联系索取稿酬。如您不希望作品出现在本站,可联系我们要求撤下您的作品。
毕得医药:控股股东及一致行动人拟合计减持不超3.01%股份
原油系期货主力合约集体走强,SC原油涨幅扩大至5.18%
Copyright © 2026 每日经济新闻报社版权所有,未经许可不得转载使用,违者必究。
广告热线 北京: 010-57613265, 上海: 021-61283008, 广州: 020-84201861, 深圳: 0755-83520159, 成都: 028-86512112
互联网新闻信息服务许可证:51120190017
网站备案号:蜀ICP备19004508号-3
川公网安备 51019002002026号
新闻职业道德监督热线:400 889 0008 邮箱:zbb@nbd.com.cn
〖Five〗,不装了藏不住了,张柏芝曝出儿子近况,锋菲感情现状被摊开,再恩爱也绕不过现实-0ab374bd,OpenAI、Google、腾讯已兵临城下,世界模型:字节跳动输不起的必答题
每经网首页
>
要闻
>
正文
每经记者|李宇彤 每经编辑|董兴生
9月7日,市场消息称,字节跳动正在基于旗下视频生成模型Seedance,开发一款实时空间视频生成模型。截至发稿,字节方面未对此做出官方回应,甚至有知情人士称,部分市场传言失实。
但比传言更值得追问的是,当世界模型成为全球科技巨头的必答题,字节跳动能缺席吗?
潮水的方向已然清晰。2025年下半年起,OpenAI、Google、Meta、NVIDIA相继入局世界模型,国内腾讯开源混元3D世界模型2.0,阿里发布HappyOyster 1.0。据《2026世界模型专题研究报告》,今年前7个月中国一级市场相关概念累计涌入资金666亿元,58家企业获得融资,占赛道公司总量(64家)的91%。
字节并非毫无准备。《每日经济新闻》记者梳理发现,字节已经发布视频生成模型Seedance 2.5、视觉空间重建模型Depth Anything 3、新一代3D生成大模型Seed3D 2.0,乃至预计将在今年第四季度登场的全新VR头显Pico Space Pro,再加上对影眸科技、生数科技、自变量机器人等相关投资,字节跳动一张“自研加投资”的世界模型拼图正在成形。
天使投资人、资深人工智能专家郭涛在接受记者采访时直言,字节的基本盘扎根于短视频算法推荐与海量图文视频内容生态,但这套能力集中于二维信息流,与实时交互、三维空间生成的世界模型存在“技术代差”。如果字节主动放弃世界模型这条赛道,被下一代交互形态边缘化的风险较高。郭涛也指出,世界模型尚处于技术路线并未完全收敛的早期阶段,对字节而言属于必须布局的前沿探索,但并非当下就要抢占的确定性入口。
当AI硬件与大模型加速迭代,直播、短剧、游戏等场景不断被重新定义,字节能否把手中散落的能力、业务拼成一张完整版图,构建出AI时代新的竞争力,显然成为业界关注焦点所在。
梳理字节已有版图,视频生成是其中最核心的一块。7月31日,字节Seed团队发布Seedance 2.5,单次原生生成时长从15秒提升至30秒,支持最多50个多模态参考素材同时输入,新增白模、绿幕参考能力。
火山引擎总裁谭待曾表示,世界模型流派很多,但视频生成是非常有效的一条,它不需要对数据做太多假设和采集,现有海量视频可以做大量无监督学习,“我们对于这条路还是非常看好的”。谭待透露,已有具身智能公司用Seedance做数据合成反哺模型。
光会生成视频不够,世界模型的前提是理解空间。字节Seed团队去年发布视觉空间重建模型Depth Anything 3,能从任意视觉输入中恢复三维几何结构。今年4月23日,Seed3D 2.0发布,在几何生成、纹理材质生成两项核心指标上均取得SOTA(当前最优)结果。
硬件入口上,字节2021年收购的Pico头显已被外界视为世界模型的重要交互终端。值得一提的是,Pico一款全新VR头显通过美国联邦通信委员会认证,预计为将于第四季度登场的Pico Space Pro。此前的8月24日,PICO-XR官方宣布将发布时间由9月2日调整至第四季度,称在最后体验验证中看到了“一个令人兴奋的全新机会”,决定多花时间对软件体验做重大升级。
投资层面同样在卡位。字节已投资影眸科技、生数科技、未来不远机器人,并领投自变量机器人10亿元A++轮融资,其中自变量是国内唯一同时获得字节、美团、阿里三家巨头投资的具身智能企业。
而被投企业也在密集推新。9月1日,影眸科技发布世界生成模型Hyper3D WorldGen,上传一张场景图片即可自动生成独立3D资产。此外,其Rodin模型上线45天即实现100万美元年经常性收入。未来不远机器人5月发布基于WAM世界动作模型的新一代机器人大脑,让机器人具备物理推演能力,目前已启动第三代大脑研发。字节通过锦秋基金在机器人赛道累计投资超10笔,这些公司的仿真环境、机器人数据与世界模型形成互补。
字节自研加投资双轮驱动的全栈布局已然成形,但这套拼图最终要拼出什么?答案或许不在某一款产品。布局世界模型,对字节而言打开的不是单一功能,而是一整套交互逻辑的升级,基于二维信息流的内容形态都将被重新定义。
与此同时,腾讯开源了混元3D世界模型2.0,阿里推出了HappyOyster,对手也已就位。
但对于能否跑出来,郭涛分析,字节的优势足够明显——海量用户交互行为数据、短视频与实景视频素材能为世界模型训练提供丰富原始数据,成熟的工程化落地能力与大规模算力调度经验有利于模型迭代与产品化验证。但字节同样具有短板:缺少机器人、虚拟现实场景的物理交互数据,物理仿真与三维底层算法积累相对薄弱,原有短视频内容生态不能直接平移复用至三维空间,人才储备与仿真工具链仍需补齐。
资本追捧与技术现实之间,横亘着一条尚难跨越的鸿沟。
在今年中关村论坛的圆桌会议上,耀途资本创始合伙人白宗义直言:“现在不谈世界模型都不好意思融资,但只要涉及这个概念,估值就直奔亿美元级别。”流形空间创始人武伟则警告:“世界模型的定义正在被无限扩大,这与当年元宇宙概念炒作如出一辙。”
概念炒作之外,技术本身的成熟度同样值得审视。
今年7月,南洋理工大学S-Lab团队提出首个以物理定律为核心的视频模型评估基准Apple-π,结果显示即使是SOTA模型的得分也只有0.473。研究指出,模型更多依赖“表层视觉模式匹配”,尚未形成“稳定的物理状态建模能力”,能生成看起来合理的画面,但并不真正理解物体为何会那样运动。
今年1月,Google DeepMind正式开放Project Genie公测,在2026年游戏开发者大会上披露的Genie 3真实能力是:初始版本只能在几秒钟内维持3D世界连贯性,升级后提升到大约一分钟。官方也承认生成的世界“可能看起来不够真实”,角色控制存在延迟。
今年6月,北京智源人工智能研究院院长王仲远在一次群访中坦言,目前4种类型的世界模型距离真正能理解、预测、交互真实物理世界的基座模型,都还有非常大的差距,行业仍处于非常早期的阶段。
对于字节的双线布局,郭涛也从商业角度进行了分析。在他看来,该布局不以短期财务回报为首要目标,更多着眼于技术生态卡位和前沿技术情报收集。投资可以降低内部试错成本,观察外部技术路线演进,但内外协同、技术成果转化落地,仍是后续需要面对的现实挑战。
时间窗口上,郭涛判断,综合产业迭代节奏,世界模型实现大规模可用大致需要三至五年。瓶颈突破不单依靠算法本身,还需要配套数据、仿真工具、硬件终端协同成熟,短期难达消费级普及。
但同时,如果字节主动放弃这条赛道,被下一代交互形态边缘化的风险较高。郭涛指出,字节当前的核心优势建立在信息流时代,AI驱动的三维实时交互将重塑内容分发逻辑,属于技术驱动的范式变迁。即便现有短视频业务基本盘稳固,若缺席世界模型相关技术积累,未来在新型交互产品的竞争中将会丧失技术主动权,流量与生态优势会被逐步削弱。
如需转载请与《每日经济新闻》报社联系。未经《每日经济新闻》报社授权,严禁转载或镜像,违者必究。
特别提醒:如果我们使用了您的图片,请作者与本站联系索取稿酬。如您不希望作品出现在本站,可联系我们要求撤下您的作品。
毕得医药:控股股东及一致行动人拟合计减持不超3.01%股份
原油系期货主力合约集体走强,SC原油涨幅扩大至5.18%
Copyright © 2026 每日经济新闻报社版权所有,未经许可不得转载使用,违者必究。
广告热线 北京: 010-57613265, 上海: 021-61283008, 广州: 020-84201861, 深圳: 0755-83520159, 成都: 028-86512112
互联网新闻信息服务许可证:51120190017
网站备案号:蜀ICP备19004508号-3
川公网安备 51019002002026号
新闻职业道德监督热线:400 889 0008 邮箱:zbb@nbd.com.cn
〖Six〗,美国中期选举临近,纽森呼吁民主党:硬气起来,丢掉自以为是的姿态-50a8a6ff,OpenAI、Google、腾讯已兵临城下,世界模型:字节跳动输不起的必答题
每经网首页
>
要闻
>
正文
每经记者|李宇彤 每经编辑|董兴生
9月7日,市场消息称,字节跳动正在基于旗下视频生成模型Seedance,开发一款实时空间视频生成模型。截至发稿,字节方面未对此做出官方回应,甚至有知情人士称,部分市场传言失实。
但比传言更值得追问的是,当世界模型成为全球科技巨头的必答题,字节跳动能缺席吗?
潮水的方向已然清晰。2025年下半年起,OpenAI、Google、Meta、NVIDIA相继入局世界模型,国内腾讯开源混元3D世界模型2.0,阿里发布HappyOyster 1.0。据《2026世界模型专题研究报告》,今年前7个月中国一级市场相关概念累计涌入资金666亿元,58家企业获得融资,占赛道公司总量(64家)的91%。
字节并非毫无准备。《每日经济新闻》记者梳理发现,字节已经发布视频生成模型Seedance 2.5、视觉空间重建模型Depth Anything 3、新一代3D生成大模型Seed3D 2.0,乃至预计将在今年第四季度登场的全新VR头显Pico Space Pro,再加上对影眸科技、生数科技、自变量机器人等相关投资,字节跳动一张“自研加投资”的世界模型拼图正在成形。
天使投资人、资深人工智能专家郭涛在接受记者采访时直言,字节的基本盘扎根于短视频算法推荐与海量图文视频内容生态,但这套能力集中于二维信息流,与实时交互、三维空间生成的世界模型存在“技术代差”。如果字节主动放弃世界模型这条赛道,被下一代交互形态边缘化的风险较高。郭涛也指出,世界模型尚处于技术路线并未完全收敛的早期阶段,对字节而言属于必须布局的前沿探索,但并非当下就要抢占的确定性入口。
当AI硬件与大模型加速迭代,直播、短剧、游戏等场景不断被重新定义,字节能否把手中散落的能力、业务拼成一张完整版图,构建出AI时代新的竞争力,显然成为业界关注焦点所在。
梳理字节已有版图,视频生成是其中最核心的一块。7月31日,字节Seed团队发布Seedance 2.5,单次原生生成时长从15秒提升至30秒,支持最多50个多模态参考素材同时输入,新增白模、绿幕参考能力。
火山引擎总裁谭待曾表示,世界模型流派很多,但视频生成是非常有效的一条,它不需要对数据做太多假设和采集,现有海量视频可以做大量无监督学习,“我们对于这条路还是非常看好的”。谭待透露,已有具身智能公司用Seedance做数据合成反哺模型。
光会生成视频不够,世界模型的前提是理解空间。字节Seed团队去年发布视觉空间重建模型Depth Anything 3,能从任意视觉输入中恢复三维几何结构。今年4月23日,Seed3D 2.0发布,在几何生成、纹理材质生成两项核心指标上均取得SOTA(当前最优)结果。
硬件入口上,字节2021年收购的Pico头显已被外界视为世界模型的重要交互终端。值得一提的是,Pico一款全新VR头显通过美国联邦通信委员会认证,预计为将于第四季度登场的Pico Space Pro。此前的8月24日,PICO-XR官方宣布将发布时间由9月2日调整至第四季度,称在最后体验验证中看到了“一个令人兴奋的全新机会”,决定多花时间对软件体验做重大升级。
投资层面同样在卡位。字节已投资影眸科技、生数科技、未来不远机器人,并领投自变量机器人10亿元A++轮融资,其中自变量是国内唯一同时获得字节、美团、阿里三家巨头投资的具身智能企业。
而被投企业也在密集推新。9月1日,影眸科技发布世界生成模型Hyper3D WorldGen,上传一张场景图片即可自动生成独立3D资产。此外,其Rodin模型上线45天即实现100万美元年经常性收入。未来不远机器人5月发布基于WAM世界动作模型的新一代机器人大脑,让机器人具备物理推演能力,目前已启动第三代大脑研发。字节通过锦秋基金在机器人赛道累计投资超10笔,这些公司的仿真环境、机器人数据与世界模型形成互补。
字节自研加投资双轮驱动的全栈布局已然成形,但这套拼图最终要拼出什么?答案或许不在某一款产品。布局世界模型,对字节而言打开的不是单一功能,而是一整套交互逻辑的升级,基于二维信息流的内容形态都将被重新定义。
与此同时,腾讯开源了混元3D世界模型2.0,阿里推出了HappyOyster,对手也已就位。
但对于能否跑出来,郭涛分析,字节的优势足够明显——海量用户交互行为数据、短视频与实景视频素材能为世界模型训练提供丰富原始数据,成熟的工程化落地能力与大规模算力调度经验有利于模型迭代与产品化验证。但字节同样具有短板:缺少机器人、虚拟现实场景的物理交互数据,物理仿真与三维底层算法积累相对薄弱,原有短视频内容生态不能直接平移复用至三维空间,人才储备与仿真工具链仍需补齐。
资本追捧与技术现实之间,横亘着一条尚难跨越的鸿沟。
在今年中关村论坛的圆桌会议上,耀途资本创始合伙人白宗义直言:“现在不谈世界模型都不好意思融资,但只要涉及这个概念,估值就直奔亿美元级别。”流形空间创始人武伟则警告:“世界模型的定义正在被无限扩大,这与当年元宇宙概念炒作如出一辙。”
概念炒作之外,技术本身的成熟度同样值得审视。
今年7月,南洋理工大学S-Lab团队提出首个以物理定律为核心的视频模型评估基准Apple-π,结果显示即使是SOTA模型的得分也只有0.473。研究指出,模型更多依赖“表层视觉模式匹配”,尚未形成“稳定的物理状态建模能力”,能生成看起来合理的画面,但并不真正理解物体为何会那样运动。
今年1月,Google DeepMind正式开放Project Genie公测,在2026年游戏开发者大会上披露的Genie 3真实能力是:初始版本只能在几秒钟内维持3D世界连贯性,升级后提升到大约一分钟。官方也承认生成的世界“可能看起来不够真实”,角色控制存在延迟。
今年6月,北京智源人工智能研究院院长王仲远在一次群访中坦言,目前4种类型的世界模型距离真正能理解、预测、交互真实物理世界的基座模型,都还有非常大的差距,行业仍处于非常早期的阶段。
对于字节的双线布局,郭涛也从商业角度进行了分析。在他看来,该布局不以短期财务回报为首要目标,更多着眼于技术生态卡位和前沿技术情报收集。投资可以降低内部试错成本,观察外部技术路线演进,但内外协同、技术成果转化落地,仍是后续需要面对的现实挑战。
时间窗口上,郭涛判断,综合产业迭代节奏,世界模型实现大规模可用大致需要三至五年。瓶颈突破不单依靠算法本身,还需要配套数据、仿真工具、硬件终端协同成熟,短期难达消费级普及。
但同时,如果字节主动放弃这条赛道,被下一代交互形态边缘化的风险较高。郭涛指出,字节当前的核心优势建立在信息流时代,AI驱动的三维实时交互将重塑内容分发逻辑,属于技术驱动的范式变迁。即便现有短视频业务基本盘稳固,若缺席世界模型相关技术积累,未来在新型交互产品的竞争中将会丧失技术主动权,流量与生态优势会被逐步削弱。
如需转载请与《每日经济新闻》报社联系。未经《每日经济新闻》报社授权,严禁转载或镜像,违者必究。
特别提醒:如果我们使用了您的图片,请作者与本站联系索取稿酬。如您不希望作品出现在本站,可联系我们要求撤下您的作品。
毕得医药:控股股东及一致行动人拟合计减持不超3.01%股份
原油系期货主力合约集体走强,SC原油涨幅扩大至5.18%
Copyright © 2026 每日经济新闻报社版权所有,未经许可不得转载使用,违者必究。
广告热线 北京: 010-57613265, 上海: 021-61283008, 广州: 020-84201861, 深圳: 0755-83520159, 成都: 028-86512112
互联网新闻信息服务许可证:51120190017
网站备案号:蜀ICP备19004508号-3
川公网安备 51019002002026号
新闻职业道德监督热线:400 889 0008 邮箱:zbb@nbd.com.cn
〖Seven〗,第一部完成系列化开发的中剧,如何打破续集魔咒-740803ee,OpenAI、Google、腾讯已兵临城下,世界模型:字节跳动输不起的必答题
每经网首页
>
要闻
>
正文
每经记者|李宇彤 每经编辑|董兴生
9月7日,市场消息称,字节跳动正在基于旗下视频生成模型Seedance,开发一款实时空间视频生成模型。截至发稿,字节方面未对此做出官方回应,甚至有知情人士称,部分市场传言失实。
但比传言更值得追问的是,当世界模型成为全球科技巨头的必答题,字节跳动能缺席吗?
潮水的方向已然清晰。2025年下半年起,OpenAI、Google、Meta、NVIDIA相继入局世界模型,国内腾讯开源混元3D世界模型2.0,阿里发布HappyOyster 1.0。据《2026世界模型专题研究报告》,今年前7个月中国一级市场相关概念累计涌入资金666亿元,58家企业获得融资,占赛道公司总量(64家)的91%。
字节并非毫无准备。《每日经济新闻》记者梳理发现,字节已经发布视频生成模型Seedance 2.5、视觉空间重建模型Depth Anything 3、新一代3D生成大模型Seed3D 2.0,乃至预计将在今年第四季度登场的全新VR头显Pico Space Pro,再加上对影眸科技、生数科技、自变量机器人等相关投资,字节跳动一张“自研加投资”的世界模型拼图正在成形。
天使投资人、资深人工智能专家郭涛在接受记者采访时直言,字节的基本盘扎根于短视频算法推荐与海量图文视频内容生态,但这套能力集中于二维信息流,与实时交互、三维空间生成的世界模型存在“技术代差”。如果字节主动放弃世界模型这条赛道,被下一代交互形态边缘化的风险较高。郭涛也指出,世界模型尚处于技术路线并未完全收敛的早期阶段,对字节而言属于必须布局的前沿探索,但并非当下就要抢占的确定性入口。
当AI硬件与大模型加速迭代,直播、短剧、游戏等场景不断被重新定义,字节能否把手中散落的能力、业务拼成一张完整版图,构建出AI时代新的竞争力,显然成为业界关注焦点所在。
梳理字节已有版图,视频生成是其中最核心的一块。7月31日,字节Seed团队发布Seedance 2.5,单次原生生成时长从15秒提升至30秒,支持最多50个多模态参考素材同时输入,新增白模、绿幕参考能力。
火山引擎总裁谭待曾表示,世界模型流派很多,但视频生成是非常有效的一条,它不需要对数据做太多假设和采集,现有海量视频可以做大量无监督学习,“我们对于这条路还是非常看好的”。谭待透露,已有具身智能公司用Seedance做数据合成反哺模型。
光会生成视频不够,世界模型的前提是理解空间。字节Seed团队去年发布视觉空间重建模型Depth Anything 3,能从任意视觉输入中恢复三维几何结构。今年4月23日,Seed3D 2.0发布,在几何生成、纹理材质生成两项核心指标上均取得SOTA(当前最优)结果。
硬件入口上,字节2021年收购的Pico头显已被外界视为世界模型的重要交互终端。值得一提的是,Pico一款全新VR头显通过美国联邦通信委员会认证,预计为将于第四季度登场的Pico Space Pro。此前的8月24日,PICO-XR官方宣布将发布时间由9月2日调整至第四季度,称在最后体验验证中看到了“一个令人兴奋的全新机会”,决定多花时间对软件体验做重大升级。
投资层面同样在卡位。字节已投资影眸科技、生数科技、未来不远机器人,并领投自变量机器人10亿元A++轮融资,其中自变量是国内唯一同时获得字节、美团、阿里三家巨头投资的具身智能企业。
而被投企业也在密集推新。9月1日,影眸科技发布世界生成模型Hyper3D WorldGen,上传一张场景图片即可自动生成独立3D资产。此外,其Rodin模型上线45天即实现100万美元年经常性收入。未来不远机器人5月发布基于WAM世界动作模型的新一代机器人大脑,让机器人具备物理推演能力,目前已启动第三代大脑研发。字节通过锦秋基金在机器人赛道累计投资超10笔,这些公司的仿真环境、机器人数据与世界模型形成互补。
字节自研加投资双轮驱动的全栈布局已然成形,但这套拼图最终要拼出什么?答案或许不在某一款产品。布局世界模型,对字节而言打开的不是单一功能,而是一整套交互逻辑的升级,基于二维信息流的内容形态都将被重新定义。
与此同时,腾讯开源了混元3D世界模型2.0,阿里推出了HappyOyster,对手也已就位。
但对于能否跑出来,郭涛分析,字节的优势足够明显——海量用户交互行为数据、短视频与实景视频素材能为世界模型训练提供丰富原始数据,成熟的工程化落地能力与大规模算力调度经验有利于模型迭代与产品化验证。但字节同样具有短板:缺少机器人、虚拟现实场景的物理交互数据,物理仿真与三维底层算法积累相对薄弱,原有短视频内容生态不能直接平移复用至三维空间,人才储备与仿真工具链仍需补齐。
资本追捧与技术现实之间,横亘着一条尚难跨越的鸿沟。
在今年中关村论坛的圆桌会议上,耀途资本创始合伙人白宗义直言:“现在不谈世界模型都不好意思融资,但只要涉及这个概念,估值就直奔亿美元级别。”流形空间创始人武伟则警告:“世界模型的定义正在被无限扩大,这与当年元宇宙概念炒作如出一辙。”
概念炒作之外,技术本身的成熟度同样值得审视。
今年7月,南洋理工大学S-Lab团队提出首个以物理定律为核心的视频模型评估基准Apple-π,结果显示即使是SOTA模型的得分也只有0.473。研究指出,模型更多依赖“表层视觉模式匹配”,尚未形成“稳定的物理状态建模能力”,能生成看起来合理的画面,但并不真正理解物体为何会那样运动。
今年1月,Google DeepMind正式开放Project Genie公测,在2026年游戏开发者大会上披露的Genie 3真实能力是:初始版本只能在几秒钟内维持3D世界连贯性,升级后提升到大约一分钟。官方也承认生成的世界“可能看起来不够真实”,角色控制存在延迟。
今年6月,北京智源人工智能研究院院长王仲远在一次群访中坦言,目前4种类型的世界模型距离真正能理解、预测、交互真实物理世界的基座模型,都还有非常大的差距,行业仍处于非常早期的阶段。
对于字节的双线布局,郭涛也从商业角度进行了分析。在他看来,该布局不以短期财务回报为首要目标,更多着眼于技术生态卡位和前沿技术情报收集。投资可以降低内部试错成本,观察外部技术路线演进,但内外协同、技术成果转化落地,仍是后续需要面对的现实挑战。
时间窗口上,郭涛判断,综合产业迭代节奏,世界模型实现大规模可用大致需要三至五年。瓶颈突破不单依靠算法本身,还需要配套数据、仿真工具、硬件终端协同成熟,短期难达消费级普及。
但同时,如果字节主动放弃这条赛道,被下一代交互形态边缘化的风险较高。郭涛指出,字节当前的核心优势建立在信息流时代,AI驱动的三维实时交互将重塑内容分发逻辑,属于技术驱动的范式变迁。即便现有短视频业务基本盘稳固,若缺席世界模型相关技术积累,未来在新型交互产品的竞争中将会丧失技术主动权,流量与生态优势会被逐步削弱。
如需转载请与《每日经济新闻》报社联系。未经《每日经济新闻》报社授权,严禁转载或镜像,违者必究。
特别提醒:如果我们使用了您的图片,请作者与本站联系索取稿酬。如您不希望作品出现在本站,可联系我们要求撤下您的作品。
毕得医药:控股股东及一致行动人拟合计减持不超3.01%股份
原油系期货主力合约集体走强,SC原油涨幅扩大至5.18%
Copyright © 2026 每日经济新闻报社版权所有,未经许可不得转载使用,违者必究。
广告热线 北京: 010-57613265, 上海: 021-61283008, 广州: 020-84201861, 深圳: 0755-83520159, 成都: 028-86512112
互联网新闻信息服务许可证:51120190017
网站备案号:蜀ICP备19004508号-3
川公网安备 51019002002026号
新闻职业道德监督热线:400 889 0008 邮箱:zbb@nbd.com.cn