木村拓哉多高免费提供高清影视资源,用户可无广告享受精品视频观看体验。涵盖最新热门电影、电视剧、综艺等,让您随时随地畅享视听盛宴。
不可逾越之地,皇马在主场面对国米取得8连胜-7124fe2a
木村拓哉多高AI剪辑一分钟以上、有好几个镜头切换的长视频效果如何? 先说一个可能会让你意外的事实:现在市面上那些号称最先进的视频编辑模型,比如Seedance 2.0、Kling o3这些闭源顶流,一旦碰到超过一分钟、有多个镜头切换、还带着好几条编辑指令的长视频,表现会集体崩盘。不是效果差一点,是那种"改了半天连要改的东西都没改对"的崩盘。 这事听起来有点反直觉。毕竟这些模型在十几秒的单镜头短视频上已经很强了,加个滤镜、换个衣服颜色,毫无压力。可一旦视频变长、镜头一多,事情就完全不一样了。南开大学和腾讯的一个研究团队把这个问题系统地摆了出来,还专门造了一个新词来描述它:多指令多镜头长视频编辑,英文缩写MMLVE。 这篇论文做的事情,说白了就是回答一个问题:为什么现有的AI编辑不了长视频,以及怎么才能编辑好。 想象你有一段一分钟的视频,里面出现了三个镜头:第一个镜头是个老工匠在做手工艺品,第二个镜头是一个骷髅模型摆在桌上,第三个镜头是个士兵走过。你给AI下了三条指令:把老工匠的蓝衬衫换成红衬衫,给骷髅戴个海盗帽,把那个士兵从视频里删掉。 现在最常见的处理方式是什么?把这一分钟视频切成四段十五秒的小片段,然后把这三条指令原封不动地扔给每一段去执行。 骷髅模型可能只出现在第二段里,但AI editor拿到"给骷髅戴帽子"这条指令后,如果第一段视频根本没有骷髅,它很可能会凭空生成一个骷髅出来,然后给它戴帽子。这就是论文里说的编辑幻觉问题:本来不该出现的东西,因为指令的存在被硬凑出来了。 如果你在家里请人装修,只跟一个瓦工说"把厨房的墙刷成蓝色",结果这个瓦工听完转头把客厅、卧室、阳台的墙全刷成了蓝色,因为他没搞清楚这句话只适用于厨房这一个空间。这就是当前AI编辑模型犯的错,它们没有能力去判断一条指令只该在某个特定的镜头里生效,而是把所有指令一股脑地套用到所有片段上,结果哪里都出问题。 除了幻觉问题,还有另外两个更棘手的麻烦。一个是跨镜头一致性问题:如果老工匠这个人物在第一个镜头出现,改了衣服颜色,那么等他在后面第三个镜头再次出现时,衣服颜色还是不是红色的?现有模型往往是把每个片段独立处理,压根不知道这两个片段里其实是同一个人,于是改到第三个片段时,又把衣服颜色改回原样了,或者干脆改成了完全不同的颜色。 另一个是时空结构破坏问题:这种"一刀切"的分段方式,很可能会把原本连续的镜头强行打乱顺序,或者破坏掉背景、摄像机运动这些本来不需要改动的东西,导致画面出现闪烁、跳帧,甚至剧情顺序都乱套了。 论文把这三个问题正式定义成了三个衡量标准。第一个叫**跨镜头编辑一致性**,简称CSEC,要求被编辑的实体在不同镜头里始终保持一致的外观。第二个叫**多指令解耦**,简称MID,要求多条指令互不干扰,各归各位,不能张冠李戴。第三个叫**时空结构零破坏**,简称ZDSS,要求没被要求改动的部分,包括背景和运动轨迹,一点都不能乱动。 这三个词听起来有点绕,其实归纳起来就一句话:改该改的,别的都别碰,改完了还要前后一致。 论文起的框架名字叫MMLVE-Agent,核心思路可以用一句话概括:从"盲目切块"转向"先思考镜头再动手"。 这套系统由大语言模型和视觉语言模型协同工作,构成一个多智能体架构。 大语言模型*:擅长理解和处理文字,比如把用户那段又长又复杂的中文指令拆解成一条条独立、清晰的编辑任务。 视觉语言模型*:能同时看懂图片和文字,比如判断视频某一帧里到底出现了哪个角色、这个角色符不符合用户描述的特征。 第一阶段叫指令与视频分析。系统先用一个叫PyDetect的工具做物理镜头检测,把长视频按真实的镜头切换点切开,而不是按固定的十五秒去硬切。这个区别很关键:按真实镜头切,才能保证一个完整的场景不会被砍成两半。同时,大语言模型负责把用户的复杂指令拆解成独立的编辑任务,明确每条指令该配哪个实体、该在哪个时间段生效。视觉语言模型则会给每个镜头提取关键帧,分析场景里都发生了什么。 第二阶段是这套系统里最巧妙的设计,叫全局记忆卡。 这个设计要解决的问题是跨镜头一致性。系统先在所有镜头里,用视觉语言模型去检索出现目标实体的关键帧,挑出置信度最高的六张拼成一张参考图,再用图像生成模型合成一张这个实体"原本长什么样"的标准照。接着按照用户的编辑指令,把这张标准照编辑成"改完之后长什么样"的样子。这两张照片一左一右拼在一起,就成了所谓的全局记忆卡,相当于给后续的视频编辑器一个统一的视觉参照物。 这就好比拍电影时的连续性检查员。片场里同一个演员今天穿蓝衬衫拍了一个镜头,三天后补拍另一个镜头时,如果没有人拿着照片提醒场务"上次这里衣服是这样系的,头发是这样梳的",补拍出来的画面很可能对不上。全局记忆卡干的正是这个活,它把"这个实体改之前和改之后分别长什么样"钉死在一张参考图上,不管后面视频编辑器处理多少个镜头,都拿同一张图对齐,不会出现"改到第三个镜头衣服颜色又变了"的情况。如果没有这张卡,每个镜头就是各编各的,互相不知道对方的存在,一致性根本无从谈起。 生成这张标准照的过程本身也不是一次成型,论文引入了一个叫**正负反馈编辑**的机制,简称P-NEF。 视觉语言模型会充当一个评估者的角色,检查生成的参考图是否真的匹配关键帧。如果不匹配,它不只是告诉生成模型"这里错了",同时还会告诉它"这里是对的,继续保持"。前者叫负向提示,后者叫正向提示。 为什么要专门加这个正向提示?论文里做了个很直观的对比实验。如果只用负向反馈,就是不断地告诉模型"别这样、别那样",随着重试次数增加,避免事项越堆越多,模型的注意力会不自觉地全部扑到这些"禁止清单"上,反而忘了原本已经改对的地方,结果是越改越乱,把本来正确的细节也改坏了。 这就像老师批改作文,如果只是不停地在错的地方画红圈,学生下一次写作文时脑子里全是"这里不能这样写、那里不能那样写",反而写不出流畅的内容,因为注意力全被负面清单占据了。如果同时告诉他"这一段写得好,继续保持这个风格",他才能在改正错误的同时不丢掉原本的优点。P-NEF的正向提示就是这个"表扬"的部分,它让模型在修正问题的同时,记住哪些地方已经做对了,不要动。 第三阶段是真正执行视频编辑的环节。这里用到一个叫**检索式按需编辑**的策略:对每个镜头,视觉语言模型会做三次投票判断,这个镜头里到底有没有出现目标实体。只有拿到至少两票"有",编辑操作才会真正触发;如果票数不够,这个镜头就原样保留,不做任何改动。 这个投票机制解决的正是开头提到的幻觉问题。如果没有这道检索关卡,"给骷髅戴帽子"这条指令就会不分场合地砸向每一个镜头,逼着模型在没有骷髅的画面里硬凑一个骷髅出来。有了这道关卡,系统会先确认"这个镜头里到底有没有骷髅",没有就跳过,绝不强行执行。 对确实需要编辑的镜头,系统会用一个叫HappyHorse的视频编辑模型来执行实际改动,同时再套用一层视频级别的P-NEF反馈循环,检查两件事:编辑任务是不是真的完成了,没被要求改动的背景和运动是不是原封不动地保留下来了。改完之后,把编辑过的镜头和跳过的原始镜头重新拼接起来,就是最终的成品视频。 光有方法不够,得有靶子可以打。研究团队专门造了一个评测数据集,叫MMLVE-Bench,从一个开源的视频理解数据集UniVA-Bench里精选了25个高质量的一分钟左右多镜头长视频,每段视频配上大约五条真实且复杂的编辑指令,先由AI生成候选指令,再由人工核查修正,确保逻辑通顺、描述准确。 评测标准也没有走传统路线。像CLIP分数、PSNR这类经典的图像质量打分方式,压根没有能力去理解"这条指令是不是套用到了错误的镜头"这种语义层面的问题,所以论文干脆用视觉语言模型本身来当裁判,针对CSEC、MID、ZDSS这三个核心指标,每个又细分成五个子维度,每个子维度按0、10、20三档打分,满分一百。 | 方法 | CSEC | MID | ZDSS | 平均分 | | Seedance 2.0 | 77.58 | 78.58 | **82.25** | 79.47 | | Kling o3 | 70.00 | 72.57 | 69.13 | 70.57 | | HappyHorse 1.0 | 74.68 | 67.28 | 66.88 | 69.61 | | MMLVE-Agent(本文方法) | **84.80** | **79.04** | 81.68 | **81.84** | 有个细节很有意思。Seedance 2.0在ZDSS这一项拿了最高分,但这并不代表它做得最好,而是因为它在面对复杂场景时会采取一种保守策略,遇到难改的指令直接放弃不改,这样自然不会破坏画面结构,但代价是大量指令根本没被执行,CSEC和MID的分数因此偏低。MMLVE-Agent则是老老实实把该改的都改了,ZDSS分数略有下降,但换来的是全面且真实的编辑执行。 论文还专门找了9名有视频生成和视觉内容评估经验的专家做人工评测,每人随机分到5个案例进行盲测排序。结果MMLVE-Agent在75.6%的案例中排名第一,在93.3%的案例中排进前二,平均排名1.36,远超其他三个基线方法的2.63到3.16。和Seedance 2.0、Kling o3、HappyHorse三个方法两两对比时,胜率分别达到88.4%、80.5%和93.3%,统计检验也确认了这个差距不是偶然。 论文里还有个很生动的对比案例。同一段视频要求把一个时钟的形状改成方形、颜色改成红色,同时删掉一个坐在椅子上的年轻男子,再给骷髅模型戴上棒球帽。Seedance 2.0成功改了时钟颜色但没改形状,完全没删掉那个男子,也漏掉了给骷髅戴帽子这个操作。Kling o3更离谱,时钟形状忽变忽不变,还把那个本该被删除的男子错误地"移植"到了另一个完全不相关的镜头里。HappyHorse 1.0则是把时钟给一起删了,后面几个镜头的顺序还整个乱套了。只有MMLVE-Agent把三条指令都在各自对应的镜头里精准落地,没有波及不该动的地方。 读完这篇论文,有个细节让我一直在想:为什么这些顶级闭源模型在短视频上表现那么好,一到长视频就集体失灵?答案其实藏在论文对Seedance 2.0"保守策略"的描述里。这类模型面对复杂指令时会本能地选择少做、不做,宁可漏改也不乱改,这其实暴露了一个更深的问题:这些模型压根没有"理解视频结构"这一层能力,它们只是在按帧或者按固定时长处理画面,根本不知道镜头和镜头之间存在着叙事上的连续性。 这让我联想到早期机器翻译的困境。逐词翻译永远翻不出通顺的句子,因为语言的意义是建立在上下文和篇章结构上的,不是孤立的词能承载的。视频编辑现在正处在类似的阶段,如果模型不理解"这是一个镜头,那是另一个镜头,它们讲的是同一件事的不同片段",就永远只能在局部打转,做不出真正连贯的长视频编辑。 论文里那个正负反馈机制的设计也值得多想一层。它其实揭示了一个更普遍的现象:单纯的负反馈会让系统陷入局部震荡,不断修正一个错误的同时制造新的错误。这个现象在很多需要迭代优化的系统里都能看到,不只是AI视频编辑。 这篇论文没有回答的问题是,当视频长度继续增加,比如到十分钟、一小时,镜头数量成倍增长时,这套基于检索和投票的机制还能不能撑住。毕竟现在的测试集只是一分钟左右的视频,投票和检索的计算成本会不会随着镜头数量线性甚至更快地增长,这个问题留在了论文之外。 A:MMLVE指的是多指令多镜头长视频编辑任务,要求AI在处理一分钟以上、包含多个镜头切换的长视频时,同时执行多条不同类型的编辑指令,还要保证跨镜头一致性、指令互不干扰、不破坏原有画面结构。 Q2:MMLVE-Agent和现有视频编辑模型比有什么不同? A:现有模型比如Seedance 2.0大多采用固定时长切块的方式处理长视频,容易产生编辑幻觉和身份不一致问题。MMLVE-Agent通过物理镜头检测、全局记忆卡和正负反馈机制,先理解视频结构再针对性编辑,避免了盲目切块带来的各种问题。 Q3:全局记忆卡是怎么保证跨镜头一致性的? A:全局记忆卡是一张"改前改后"对比图,系统先从所有镜头里检索出目标实体的关键帧生成标准参考图,再按指令编辑出改后的样子,后续所有镜头的编辑都参照这张卡进行,从而保证同一实体在不同镜头里外观统一。 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 智东西 2026-09-08 18:00:16 新智元 2026-09-08 18:53:52 新智元 2026-09-08 18:55:04 钛媒体APP 2026-06-01 17:24:30 量子位 2026-08-06 20:00:27 量子位 2026-06-07 04:37:43 DeepTech深科技 2026-09-08 19:16:32 虎嗅APP 2026-09-08 19:14:12 量子位 2026-04-23 11:44:18 淡然综艺 2026-09-05 16:07:13 泠泠说史 2026-09-06 12:58:54 码上闲叙 2026-09-08 15:33:13 菠萝唠生活 2026-09-07 03:48:03 王衜晓 2026-09-08 06:19:12 弱电大林 2026-09-06 05:21:06 鹿鲨Sakana 2026-09-08 03:40:11 栗飞沉 2026-09-08 06:09:41 名岂文章著 2026-09-08 18:51:40 极目新闻 2026-09-08 09:05:24 扬子晚报 2026-09-07 22:11:30 倔强旳牵强 2026-09-06 03:48:04 白小兔手工 2026-09-08 01:27:59 新浪财经 2026-09-08 19:55:19 大小关物语 2026-09-04 05:04:51 科技视讯 2026-09-08 17:56:20 IT之家 2026-09-04 15:29:10 泡泡网 2026-09-08 11:19:20 都市快报橙柿互动 2026-09-08 13:29:54 钛媒体APP 2026-09-08 10:18:07 色影无忌 2026-09-08 19:05:48 游民星空 2026-09-08 17:30:45 蚌埠日报 2026-09-05 04:33:34 凉爽追剧 2026-09-06 22:19:06 孤城落日 2026-09-08 02:17:25 量子位 2026-06-17 18:36:08 科技视讯 2026-09-08 18:33:59 村里整活小分队 2026-09-08 00:58:53 村里整活小分队 2026-09-07 01:11:19 装甲铲史官 2026-07-31 11:45:33 江山别映剪辑 2026-09-07 11:02:21
AI剪辑一分钟以上、有好几个镜头切换的长视频效果如何? 先说一个可能会让你意外的事实:现在市面上那些号称最先进的视频编辑模型,比如Seedance 2.0、Kling o3这些闭源顶流,一旦碰到超过一分钟、有多个镜头切换、还带着好几条编辑指令的长视频,表现会集体崩盘。不是效果差一点,是那种"改了半天连要改的东西都没改对"的崩盘。 这事听起来有点反直觉。毕竟这些模型在十几秒的单镜头短视频上已经很强了,加个滤镜、换个衣服颜色,毫无压力。可一旦视频变长、镜头一多,事情就完全不一样了。南开大学和腾讯的一个研究团队把这个问题系统地摆了出来,还专门造了一个新词来描述它:多指令多镜头长视频编辑,英文缩写MMLVE。 这篇论文做的事情,说白了就是回答一个问题:为什么现有的AI编辑不了长视频,以及怎么才能编辑好。 想象你有一段一分钟的视频,里面出现了三个镜头:第一个镜头是个老工匠在做手工艺品,第二个镜头是一个骷髅模型摆在桌上,第三个镜头是个士兵走过。你给AI下了三条指令:把老工匠的蓝衬衫换成红衬衫,给骷髅戴个海盗帽,把那个士兵从视频里删掉。 现在最常见的处理方式是什么?把这一分钟视频切成四段十五秒的小片段,然后把这三条指令原封不动地扔给每一段去执行。 骷髅模型可能只出现在第二段里,但AI editor拿到"给骷髅戴帽子"这条指令后,如果第一段视频根本没有骷髅,它很可能会凭空生成一个骷髅出来,然后给它戴帽子。这就是论文里说的编辑幻觉问题:本来不该出现的东西,因为指令的存在被硬凑出来了。 如果你在家里请人装修,只跟一个瓦工说"把厨房的墙刷成蓝色",结果这个瓦工听完转头把客厅、卧室、阳台的墙全刷成了蓝色,因为他没搞清楚这句话只适用于厨房这一个空间。这就是当前AI编辑模型犯的错,它们没有能力去判断一条指令只该在某个特定的镜头里生效,而是把所有指令一股脑地套用到所有片段上,结果哪里都出问题。 除了幻觉问题,还有另外两个更棘手的麻烦。一个是跨镜头一致性问题:如果老工匠这个人物在第一个镜头出现,改了衣服颜色,那么等他在后面第三个镜头再次出现时,衣服颜色还是不是红色的?现有模型往往是把每个片段独立处理,压根不知道这两个片段里其实是同一个人,于是改到第三个片段时,又把衣服颜色改回原样了,或者干脆改成了完全不同的颜色。 另一个是时空结构破坏问题:这种"一刀切"的分段方式,很可能会把原本连续的镜头强行打乱顺序,或者破坏掉背景、摄像机运动这些本来不需要改动的东西,导致画面出现闪烁、跳帧,甚至剧情顺序都乱套了。 论文把这三个问题正式定义成了三个衡量标准。第一个叫**跨镜头编辑一致性**,简称CSEC,要求被编辑的实体在不同镜头里始终保持一致的外观。第二个叫**多指令解耦**,简称MID,要求多条指令互不干扰,各归各位,不能张冠李戴。第三个叫**时空结构零破坏**,简称ZDSS,要求没被要求改动的部分,包括背景和运动轨迹,一点都不能乱动。 这三个词听起来有点绕,其实归纳起来就一句话:改该改的,别的都别碰,改完了还要前后一致。 论文起的框架名字叫MMLVE-Agent,核心思路可以用一句话概括:从"盲目切块"转向"先思考镜头再动手"。 这套系统由大语言模型和视觉语言模型协同工作,构成一个多智能体架构。 大语言模型*:擅长理解和处理文字,比如把用户那段又长又复杂的中文指令拆解成一条条独立、清晰的编辑任务。 视觉语言模型*:能同时看懂图片和文字,比如判断视频某一帧里到底出现了哪个角色、这个角色符不符合用户描述的特征。 第一阶段叫指令与视频分析。系统先用一个叫PyDetect的工具做物理镜头检测,把长视频按真实的镜头切换点切开,而不是按固定的十五秒去硬切。这个区别很关键:按真实镜头切,才能保证一个完整的场景不会被砍成两半。同时,大语言模型负责把用户的复杂指令拆解成独立的编辑任务,明确每条指令该配哪个实体、该在哪个时间段生效。视觉语言模型则会给每个镜头提取关键帧,分析场景里都发生了什么。 第二阶段是这套系统里最巧妙的设计,叫全局记忆卡。 这个设计要解决的问题是跨镜头一致性。系统先在所有镜头里,用视觉语言模型去检索出现目标实体的关键帧,挑出置信度最高的六张拼成一张参考图,再用图像生成模型合成一张这个实体"原本长什么样"的标准照。接着按照用户的编辑指令,把这张标准照编辑成"改完之后长什么样"的样子。这两张照片一左一右拼在一起,就成了所谓的全局记忆卡,相当于给后续的视频编辑器一个统一的视觉参照物。 这就好比拍电影时的连续性检查员。片场里同一个演员今天穿蓝衬衫拍了一个镜头,三天后补拍另一个镜头时,如果没有人拿着照片提醒场务"上次这里衣服是这样系的,头发是这样梳的",补拍出来的画面很可能对不上。全局记忆卡干的正是这个活,它把"这个实体改之前和改之后分别长什么样"钉死在一张参考图上,不管后面视频编辑器处理多少个镜头,都拿同一张图对齐,不会出现"改到第三个镜头衣服颜色又变了"的情况。如果没有这张卡,每个镜头就是各编各的,互相不知道对方的存在,一致性根本无从谈起。 生成这张标准照的过程本身也不是一次成型,论文引入了一个叫**正负反馈编辑**的机制,简称P-NEF。 视觉语言模型会充当一个评估者的角色,检查生成的参考图是否真的匹配关键帧。如果不匹配,它不只是告诉生成模型"这里错了",同时还会告诉它"这里是对的,继续保持"。前者叫负向提示,后者叫正向提示。 为什么要专门加这个正向提示?论文里做了个很直观的对比实验。如果只用负向反馈,就是不断地告诉模型"别这样、别那样",随着重试次数增加,避免事项越堆越多,模型的注意力会不自觉地全部扑到这些"禁止清单"上,反而忘了原本已经改对的地方,结果是越改越乱,把本来正确的细节也改坏了。 这就像老师批改作文,如果只是不停地在错的地方画红圈,学生下一次写作文时脑子里全是"这里不能这样写、那里不能那样写",反而写不出流畅的内容,因为注意力全被负面清单占据了。如果同时告诉他"这一段写得好,继续保持这个风格",他才能在改正错误的同时不丢掉原本的优点。P-NEF的正向提示就是这个"表扬"的部分,它让模型在修正问题的同时,记住哪些地方已经做对了,不要动。 第三阶段是真正执行视频编辑的环节。这里用到一个叫**检索式按需编辑**的策略:对每个镜头,视觉语言模型会做三次投票判断,这个镜头里到底有没有出现目标实体。只有拿到至少两票"有",编辑操作才会真正触发;如果票数不够,这个镜头就原样保留,不做任何改动。 这个投票机制解决的正是开头提到的幻觉问题。如果没有这道检索关卡,"给骷髅戴帽子"这条指令就会不分场合地砸向每一个镜头,逼着模型在没有骷髅的画面里硬凑一个骷髅出来。有了这道关卡,系统会先确认"这个镜头里到底有没有骷髅",没有就跳过,绝不强行执行。 对确实需要编辑的镜头,系统会用一个叫HappyHorse的视频编辑模型来执行实际改动,同时再套用一层视频级别的P-NEF反馈循环,检查两件事:编辑任务是不是真的完成了,没被要求改动的背景和运动是不是原封不动地保留下来了。改完之后,把编辑过的镜头和跳过的原始镜头重新拼接起来,就是最终的成品视频。 光有方法不够,得有靶子可以打。研究团队专门造了一个评测数据集,叫MMLVE-Bench,从一个开源的视频理解数据集UniVA-Bench里精选了25个高质量的一分钟左右多镜头长视频,每段视频配上大约五条真实且复杂的编辑指令,先由AI生成候选指令,再由人工核查修正,确保逻辑通顺、描述准确。 评测标准也没有走传统路线。像CLIP分数、PSNR这类经典的图像质量打分方式,压根没有能力去理解"这条指令是不是套用到了错误的镜头"这种语义层面的问题,所以论文干脆用视觉语言模型本身来当裁判,针对CSEC、MID、ZDSS这三个核心指标,每个又细分成五个子维度,每个子维度按0、10、20三档打分,满分一百。 | 方法 | CSEC | MID | ZDSS | 平均分 | | Seedance 2.0 | 77.58 | 78.58 | **82.25** | 79.47 | | Kling o3 | 70.00 | 72.57 | 69.13 | 70.57 | | HappyHorse 1.0 | 74.68 | 67.28 | 66.88 | 69.61 | | MMLVE-Agent(本文方法) | **84.80** | **79.04** | 81.68 | **81.84** | 有个细节很有意思。Seedance 2.0在ZDSS这一项拿了最高分,但这并不代表它做得最好,而是因为它在面对复杂场景时会采取一种保守策略,遇到难改的指令直接放弃不改,这样自然不会破坏画面结构,但代价是大量指令根本没被执行,CSEC和MID的分数因此偏低。MMLVE-Agent则是老老实实把该改的都改了,ZDSS分数略有下降,但换来的是全面且真实的编辑执行。 论文还专门找了9名有视频生成和视觉内容评估经验的专家做人工评测,每人随机分到5个案例进行盲测排序。结果MMLVE-Agent在75.6%的案例中排名第一,在93.3%的案例中排进前二,平均排名1.36,远超其他三个基线方法的2.63到3.16。和Seedance 2.0、Kling o3、HappyHorse三个方法两两对比时,胜率分别达到88.4%、80.5%和93.3%,统计检验也确认了这个差距不是偶然。 论文里还有个很生动的对比案例。同一段视频要求把一个时钟的形状改成方形、颜色改成红色,同时删掉一个坐在椅子上的年轻男子,再给骷髅模型戴上棒球帽。Seedance 2.0成功改了时钟颜色但没改形状,完全没删掉那个男子,也漏掉了给骷髅戴帽子这个操作。Kling o3更离谱,时钟形状忽变忽不变,还把那个本该被删除的男子错误地"移植"到了另一个完全不相关的镜头里。HappyHorse 1.0则是把时钟给一起删了,后面几个镜头的顺序还整个乱套了。只有MMLVE-Agent把三条指令都在各自对应的镜头里精准落地,没有波及不该动的地方。 读完这篇论文,有个细节让我一直在想:为什么这些顶级闭源模型在短视频上表现那么好,一到长视频就集体失灵?答案其实藏在论文对Seedance 2.0"保守策略"的描述里。这类模型面对复杂指令时会本能地选择少做、不做,宁可漏改也不乱改,这其实暴露了一个更深的问题:这些模型压根没有"理解视频结构"这一层能力,它们只是在按帧或者按固定时长处理画面,根本不知道镜头和镜头之间存在着叙事上的连续性。 这让我联想到早期机器翻译的困境。逐词翻译永远翻不出通顺的句子,因为语言的意义是建立在上下文和篇章结构上的,不是孤立的词能承载的。视频编辑现在正处在类似的阶段,如果模型不理解"这是一个镜头,那是另一个镜头,它们讲的是同一件事的不同片段",就永远只能在局部打转,做不出真正连贯的长视频编辑。 论文里那个正负反馈机制的设计也值得多想一层。它其实揭示了一个更普遍的现象:单纯的负反馈会让系统陷入局部震荡,不断修正一个错误的同时制造新的错误。这个现象在很多需要迭代优化的系统里都能看到,不只是AI视频编辑。 这篇论文没有回答的问题是,当视频长度继续增加,比如到十分钟、一小时,镜头数量成倍增长时,这套基于检索和投票的机制还能不能撑住。毕竟现在的测试集只是一分钟左右的视频,投票和检索的计算成本会不会随着镜头数量线性甚至更快地增长,这个问题留在了论文之外。 A:MMLVE指的是多指令多镜头长视频编辑任务,要求AI在处理一分钟以上、包含多个镜头切换的长视频时,同时执行多条不同类型的编辑指令,还要保证跨镜头一致性、指令互不干扰、不破坏原有画面结构。 Q2:MMLVE-Agent和现有视频编辑模型比有什么不同? A:现有模型比如Seedance 2.0大多采用固定时长切块的方式处理长视频,容易产生编辑幻觉和身份不一致问题。MMLVE-Agent通过物理镜头检测、全局记忆卡和正负反馈机制,先理解视频结构再针对性编辑,避免了盲目切块带来的各种问题。 Q3:全局记忆卡是怎么保证跨镜头一致性的? A:全局记忆卡是一张"改前改后"对比图,系统先从所有镜头里检索出目标实体的关键帧生成标准参考图,再按指令编辑出改后的样子,后续所有镜头的编辑都参照这张卡进行,从而保证同一实体在不同镜头里外观统一。 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 智东西 2026-09-08 18:00:16 新智元 2026-09-08 18:53:52 新智元 2026-09-08 18:55:04 钛媒体APP 2026-06-01 17:24:30 量子位 2026-08-06 20:00:27 量子位 2026-06-07 04:37:43 DeepTech深科技 2026-09-08 19:16:32 虎嗅APP 2026-09-08 19:14:12 量子位 2026-04-23 11:44:18 淡然综艺 2026-09-05 16:07:13 泠泠说史 2026-09-06 12:58:54 码上闲叙 2026-09-08 15:33:13 菠萝唠生活 2026-09-07 03:48:03 王衜晓 2026-09-08 06:19:12 弱电大林 2026-09-06 05:21:06 鹿鲨Sakana 2026-09-08 03:40:11 栗飞沉 2026-09-08 06:09:41 名岂文章著 2026-09-08 18:51:40 极目新闻 2026-09-08 09:05:24 扬子晚报 2026-09-07 22:11:30 倔强旳牵强 2026-09-06 03:48:04 白小兔手工 2026-09-08 01:27:59 新浪财经 2026-09-08 19:55:19 大小关物语 2026-09-04 05:04:51 科技视讯 2026-09-08 17:56:20 IT之家 2026-09-04 15:29:10 泡泡网 2026-09-08 11:19:20 都市快报橙柿互动 2026-09-08 13:29:54 钛媒体APP 2026-09-08 10:18:07 色影无忌 2026-09-08 19:05:48 游民星空 2026-09-08 17:30:45 蚌埠日报 2026-09-05 04:33:34 凉爽追剧 2026-09-06 22:19:06 孤城落日 2026-09-08 02:17:25 量子位 2026-06-17 18:36:08 科技视讯 2026-09-08 18:33:59 村里整活小分队 2026-09-08 00:58:53 村里整活小分队 2026-09-07 01:11:19 装甲铲史官 2026-07-31 11:45:33 江山别映剪辑 2026-09-07 11:02:21
AI剪辑一分钟以上、有好几个镜头切换的长视频效果如何? 先说一个可能会让你意外的事实:现在市面上那些号称最先进的视频编辑模型,比如Seedance 2.0、Kling o3这些闭源顶流,一旦碰到超过一分钟、有多个镜头切换、还带着好几条编辑指令的长视频,表现会集体崩盘。不是效果差一点,是那种"改了半天连要改的东西都没改对"的崩盘。 这事听起来有点反直觉。毕竟这些模型在十几秒的单镜头短视频上已经很强了,加个滤镜、换个衣服颜色,毫无压力。可一旦视频变长、镜头一多,事情就完全不一样了。南开大学和腾讯的一个研究团队把这个问题系统地摆了出来,还专门造了一个新词来描述它:多指令多镜头长视频编辑,英文缩写MMLVE。 这篇论文做的事情,说白了就是回答一个问题:为什么现有的AI编辑不了长视频,以及怎么才能编辑好。 想象你有一段一分钟的视频,里面出现了三个镜头:第一个镜头是个老工匠在做手工艺品,第二个镜头是一个骷髅模型摆在桌上,第三个镜头是个士兵走过。你给AI下了三条指令:把老工匠的蓝衬衫换成红衬衫,给骷髅戴个海盗帽,把那个士兵从视频里删掉。 现在最常见的处理方式是什么?把这一分钟视频切成四段十五秒的小片段,然后把这三条指令原封不动地扔给每一段去执行。 骷髅模型可能只出现在第二段里,但AI editor拿到"给骷髅戴帽子"这条指令后,如果第一段视频根本没有骷髅,它很可能会凭空生成一个骷髅出来,然后给它戴帽子。这就是论文里说的编辑幻觉问题:本来不该出现的东西,因为指令的存在被硬凑出来了。 如果你在家里请人装修,只跟一个瓦工说"把厨房的墙刷成蓝色",结果这个瓦工听完转头把客厅、卧室、阳台的墙全刷成了蓝色,因为他没搞清楚这句话只适用于厨房这一个空间。这就是当前AI编辑模型犯的错,它们没有能力去判断一条指令只该在某个特定的镜头里生效,而是把所有指令一股脑地套用到所有片段上,结果哪里都出问题。 除了幻觉问题,还有另外两个更棘手的麻烦。一个是跨镜头一致性问题:如果老工匠这个人物在第一个镜头出现,改了衣服颜色,那么等他在后面第三个镜头再次出现时,衣服颜色还是不是红色的?现有模型往往是把每个片段独立处理,压根不知道这两个片段里其实是同一个人,于是改到第三个片段时,又把衣服颜色改回原样了,或者干脆改成了完全不同的颜色。 另一个是时空结构破坏问题:这种"一刀切"的分段方式,很可能会把原本连续的镜头强行打乱顺序,或者破坏掉背景、摄像机运动这些本来不需要改动的东西,导致画面出现闪烁、跳帧,甚至剧情顺序都乱套了。 论文把这三个问题正式定义成了三个衡量标准。第一个叫**跨镜头编辑一致性**,简称CSEC,要求被编辑的实体在不同镜头里始终保持一致的外观。第二个叫**多指令解耦**,简称MID,要求多条指令互不干扰,各归各位,不能张冠李戴。第三个叫**时空结构零破坏**,简称ZDSS,要求没被要求改动的部分,包括背景和运动轨迹,一点都不能乱动。 这三个词听起来有点绕,其实归纳起来就一句话:改该改的,别的都别碰,改完了还要前后一致。 论文起的框架名字叫MMLVE-Agent,核心思路可以用一句话概括:从"盲目切块"转向"先思考镜头再动手"。 这套系统由大语言模型和视觉语言模型协同工作,构成一个多智能体架构。 大语言模型*:擅长理解和处理文字,比如把用户那段又长又复杂的中文指令拆解成一条条独立、清晰的编辑任务。 视觉语言模型*:能同时看懂图片和文字,比如判断视频某一帧里到底出现了哪个角色、这个角色符不符合用户描述的特征。 第一阶段叫指令与视频分析。系统先用一个叫PyDetect的工具做物理镜头检测,把长视频按真实的镜头切换点切开,而不是按固定的十五秒去硬切。这个区别很关键:按真实镜头切,才能保证一个完整的场景不会被砍成两半。同时,大语言模型负责把用户的复杂指令拆解成独立的编辑任务,明确每条指令该配哪个实体、该在哪个时间段生效。视觉语言模型则会给每个镜头提取关键帧,分析场景里都发生了什么。 第二阶段是这套系统里最巧妙的设计,叫全局记忆卡。 这个设计要解决的问题是跨镜头一致性。系统先在所有镜头里,用视觉语言模型去检索出现目标实体的关键帧,挑出置信度最高的六张拼成一张参考图,再用图像生成模型合成一张这个实体"原本长什么样"的标准照。接着按照用户的编辑指令,把这张标准照编辑成"改完之后长什么样"的样子。这两张照片一左一右拼在一起,就成了所谓的全局记忆卡,相当于给后续的视频编辑器一个统一的视觉参照物。 这就好比拍电影时的连续性检查员。片场里同一个演员今天穿蓝衬衫拍了一个镜头,三天后补拍另一个镜头时,如果没有人拿着照片提醒场务"上次这里衣服是这样系的,头发是这样梳的",补拍出来的画面很可能对不上。全局记忆卡干的正是这个活,它把"这个实体改之前和改之后分别长什么样"钉死在一张参考图上,不管后面视频编辑器处理多少个镜头,都拿同一张图对齐,不会出现"改到第三个镜头衣服颜色又变了"的情况。如果没有这张卡,每个镜头就是各编各的,互相不知道对方的存在,一致性根本无从谈起。 生成这张标准照的过程本身也不是一次成型,论文引入了一个叫**正负反馈编辑**的机制,简称P-NEF。 视觉语言模型会充当一个评估者的角色,检查生成的参考图是否真的匹配关键帧。如果不匹配,它不只是告诉生成模型"这里错了",同时还会告诉它"这里是对的,继续保持"。前者叫负向提示,后者叫正向提示。 为什么要专门加这个正向提示?论文里做了个很直观的对比实验。如果只用负向反馈,就是不断地告诉模型"别这样、别那样",随着重试次数增加,避免事项越堆越多,模型的注意力会不自觉地全部扑到这些"禁止清单"上,反而忘了原本已经改对的地方,结果是越改越乱,把本来正确的细节也改坏了。 这就像老师批改作文,如果只是不停地在错的地方画红圈,学生下一次写作文时脑子里全是"这里不能这样写、那里不能那样写",反而写不出流畅的内容,因为注意力全被负面清单占据了。如果同时告诉他"这一段写得好,继续保持这个风格",他才能在改正错误的同时不丢掉原本的优点。P-NEF的正向提示就是这个"表扬"的部分,它让模型在修正问题的同时,记住哪些地方已经做对了,不要动。 第三阶段是真正执行视频编辑的环节。这里用到一个叫**检索式按需编辑**的策略:对每个镜头,视觉语言模型会做三次投票判断,这个镜头里到底有没有出现目标实体。只有拿到至少两票"有",编辑操作才会真正触发;如果票数不够,这个镜头就原样保留,不做任何改动。 这个投票机制解决的正是开头提到的幻觉问题。如果没有这道检索关卡,"给骷髅戴帽子"这条指令就会不分场合地砸向每一个镜头,逼着模型在没有骷髅的画面里硬凑一个骷髅出来。有了这道关卡,系统会先确认"这个镜头里到底有没有骷髅",没有就跳过,绝不强行执行。 对确实需要编辑的镜头,系统会用一个叫HappyHorse的视频编辑模型来执行实际改动,同时再套用一层视频级别的P-NEF反馈循环,检查两件事:编辑任务是不是真的完成了,没被要求改动的背景和运动是不是原封不动地保留下来了。改完之后,把编辑过的镜头和跳过的原始镜头重新拼接起来,就是最终的成品视频。 光有方法不够,得有靶子可以打。研究团队专门造了一个评测数据集,叫MMLVE-Bench,从一个开源的视频理解数据集UniVA-Bench里精选了25个高质量的一分钟左右多镜头长视频,每段视频配上大约五条真实且复杂的编辑指令,先由AI生成候选指令,再由人工核查修正,确保逻辑通顺、描述准确。 评测标准也没有走传统路线。像CLIP分数、PSNR这类经典的图像质量打分方式,压根没有能力去理解"这条指令是不是套用到了错误的镜头"这种语义层面的问题,所以论文干脆用视觉语言模型本身来当裁判,针对CSEC、MID、ZDSS这三个核心指标,每个又细分成五个子维度,每个子维度按0、10、20三档打分,满分一百。 | 方法 | CSEC | MID | ZDSS | 平均分 | | Seedance 2.0 | 77.58 | 78.58 | **82.25** | 79.47 | | Kling o3 | 70.00 | 72.57 | 69.13 | 70.57 | | HappyHorse 1.0 | 74.68 | 67.28 | 66.88 | 69.61 | | MMLVE-Agent(本文方法) | **84.80** | **79.04** | 81.68 | **81.84** | 有个细节很有意思。Seedance 2.0在ZDSS这一项拿了最高分,但这并不代表它做得最好,而是因为它在面对复杂场景时会采取一种保守策略,遇到难改的指令直接放弃不改,这样自然不会破坏画面结构,但代价是大量指令根本没被执行,CSEC和MID的分数因此偏低。MMLVE-Agent则是老老实实把该改的都改了,ZDSS分数略有下降,但换来的是全面且真实的编辑执行。 论文还专门找了9名有视频生成和视觉内容评估经验的专家做人工评测,每人随机分到5个案例进行盲测排序。结果MMLVE-Agent在75.6%的案例中排名第一,在93.3%的案例中排进前二,平均排名1.36,远超其他三个基线方法的2.63到3.16。和Seedance 2.0、Kling o3、HappyHorse三个方法两两对比时,胜率分别达到88.4%、80.5%和93.3%,统计检验也确认了这个差距不是偶然。 论文里还有个很生动的对比案例。同一段视频要求把一个时钟的形状改成方形、颜色改成红色,同时删掉一个坐在椅子上的年轻男子,再给骷髅模型戴上棒球帽。Seedance 2.0成功改了时钟颜色但没改形状,完全没删掉那个男子,也漏掉了给骷髅戴帽子这个操作。Kling o3更离谱,时钟形状忽变忽不变,还把那个本该被删除的男子错误地"移植"到了另一个完全不相关的镜头里。HappyHorse 1.0则是把时钟给一起删了,后面几个镜头的顺序还整个乱套了。只有MMLVE-Agent把三条指令都在各自对应的镜头里精准落地,没有波及不该动的地方。 读完这篇论文,有个细节让我一直在想:为什么这些顶级闭源模型在短视频上表现那么好,一到长视频就集体失灵?答案其实藏在论文对Seedance 2.0"保守策略"的描述里。这类模型面对复杂指令时会本能地选择少做、不做,宁可漏改也不乱改,这其实暴露了一个更深的问题:这些模型压根没有"理解视频结构"这一层能力,它们只是在按帧或者按固定时长处理画面,根本不知道镜头和镜头之间存在着叙事上的连续性。 这让我联想到早期机器翻译的困境。逐词翻译永远翻不出通顺的句子,因为语言的意义是建立在上下文和篇章结构上的,不是孤立的词能承载的。视频编辑现在正处在类似的阶段,如果模型不理解"这是一个镜头,那是另一个镜头,它们讲的是同一件事的不同片段",就永远只能在局部打转,做不出真正连贯的长视频编辑。 论文里那个正负反馈机制的设计也值得多想一层。它其实揭示了一个更普遍的现象:单纯的负反馈会让系统陷入局部震荡,不断修正一个错误的同时制造新的错误。这个现象在很多需要迭代优化的系统里都能看到,不只是AI视频编辑。 这篇论文没有回答的问题是,当视频长度继续增加,比如到十分钟、一小时,镜头数量成倍增长时,这套基于检索和投票的机制还能不能撑住。毕竟现在的测试集只是一分钟左右的视频,投票和检索的计算成本会不会随着镜头数量线性甚至更快地增长,这个问题留在了论文之外。 A:MMLVE指的是多指令多镜头长视频编辑任务,要求AI在处理一分钟以上、包含多个镜头切换的长视频时,同时执行多条不同类型的编辑指令,还要保证跨镜头一致性、指令互不干扰、不破坏原有画面结构。 Q2:MMLVE-Agent和现有视频编辑模型比有什么不同? A:现有模型比如Seedance 2.0大多采用固定时长切块的方式处理长视频,容易产生编辑幻觉和身份不一致问题。MMLVE-Agent通过物理镜头检测、全局记忆卡和正负反馈机制,先理解视频结构再针对性编辑,避免了盲目切块带来的各种问题。 Q3:全局记忆卡是怎么保证跨镜头一致性的? A:全局记忆卡是一张"改前改后"对比图,系统先从所有镜头里检索出目标实体的关键帧生成标准参考图,再按指令编辑出改后的样子,后续所有镜头的编辑都参照这张卡进行,从而保证同一实体在不同镜头里外观统一。 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 智东西 2026-09-08 18:00:16 新智元 2026-09-08 18:53:52 新智元 2026-09-08 18:55:04 钛媒体APP 2026-06-01 17:24:30 量子位 2026-08-06 20:00:27 量子位 2026-06-07 04:37:43 DeepTech深科技 2026-09-08 19:16:32 虎嗅APP 2026-09-08 19:14:12 量子位 2026-04-23 11:44:18 淡然综艺 2026-09-05 16:07:13 泠泠说史 2026-09-06 12:58:54 码上闲叙 2026-09-08 15:33:13 菠萝唠生活 2026-09-07 03:48:03 王衜晓 2026-09-08 06:19:12 弱电大林 2026-09-06 05:21:06 鹿鲨Sakana 2026-09-08 03:40:11 栗飞沉 2026-09-08 06:09:41 名岂文章著 2026-09-08 18:51:40 极目新闻 2026-09-08 09:05:24 扬子晚报 2026-09-07 22:11:30 倔强旳牵强 2026-09-06 03:48:04 白小兔手工 2026-09-08 01:27:59 新浪财经 2026-09-08 19:55:19 大小关物语 2026-09-04 05:04:51 科技视讯 2026-09-08 17:56:20 IT之家 2026-09-04 15:29:10 泡泡网 2026-09-08 11:19:20 都市快报橙柿互动 2026-09-08 13:29:54 钛媒体APP 2026-09-08 10:18:07 色影无忌 2026-09-08 19:05:48 游民星空 2026-09-08 17:30:45 蚌埠日报 2026-09-05 04:33:34 凉爽追剧 2026-09-06 22:19:06 孤城落日 2026-09-08 02:17:25 量子位 2026-06-17 18:36:08 科技视讯 2026-09-08 18:33:59 村里整活小分队 2026-09-08 00:58:53 村里整活小分队 2026-09-07 01:11:19 装甲铲史官 2026-07-31 11:45:33 江山别映剪辑 2026-09-07 11:02:21
马雷斯卡称哈兰德出现疲劳,欧冠首战或获轮休机会-rssaied2a4937c863728a
木村拓哉多高AI剪辑一分钟以上、有好几个镜头切换的长视频效果如何? 先说一个可能会让你意外的事实:现在市面上那些号称最先进的视频编辑模型,比如Seedance 2.0、Kling o3这些闭源顶流,一旦碰到超过一分钟、有多个镜头切换、还带着好几条编辑指令的长视频,表现会集体崩盘。不是效果差一点,是那种"改了半天连要改的东西都没改对"的崩盘。 这事听起来有点反直觉。毕竟这些模型在十几秒的单镜头短视频上已经很强了,加个滤镜、换个衣服颜色,毫无压力。可一旦视频变长、镜头一多,事情就完全不一样了。南开大学和腾讯的一个研究团队把这个问题系统地摆了出来,还专门造了一个新词来描述它:多指令多镜头长视频编辑,英文缩写MMLVE。 这篇论文做的事情,说白了就是回答一个问题:为什么现有的AI编辑不了长视频,以及怎么才能编辑好。 想象你有一段一分钟的视频,里面出现了三个镜头:第一个镜头是个老工匠在做手工艺品,第二个镜头是一个骷髅模型摆在桌上,第三个镜头是个士兵走过。你给AI下了三条指令:把老工匠的蓝衬衫换成红衬衫,给骷髅戴个海盗帽,把那个士兵从视频里删掉。 现在最常见的处理方式是什么?把这一分钟视频切成四段十五秒的小片段,然后把这三条指令原封不动地扔给每一段去执行。 骷髅模型可能只出现在第二段里,但AI editor拿到"给骷髅戴帽子"这条指令后,如果第一段视频根本没有骷髅,它很可能会凭空生成一个骷髅出来,然后给它戴帽子。这就是论文里说的编辑幻觉问题:本来不该出现的东西,因为指令的存在被硬凑出来了。 如果你在家里请人装修,只跟一个瓦工说"把厨房的墙刷成蓝色",结果这个瓦工听完转头把客厅、卧室、阳台的墙全刷成了蓝色,因为他没搞清楚这句话只适用于厨房这一个空间。这就是当前AI编辑模型犯的错,它们没有能力去判断一条指令只该在某个特定的镜头里生效,而是把所有指令一股脑地套用到所有片段上,结果哪里都出问题。 除了幻觉问题,还有另外两个更棘手的麻烦。一个是跨镜头一致性问题:如果老工匠这个人物在第一个镜头出现,改了衣服颜色,那么等他在后面第三个镜头再次出现时,衣服颜色还是不是红色的?现有模型往往是把每个片段独立处理,压根不知道这两个片段里其实是同一个人,于是改到第三个片段时,又把衣服颜色改回原样了,或者干脆改成了完全不同的颜色。 另一个是时空结构破坏问题:这种"一刀切"的分段方式,很可能会把原本连续的镜头强行打乱顺序,或者破坏掉背景、摄像机运动这些本来不需要改动的东西,导致画面出现闪烁、跳帧,甚至剧情顺序都乱套了。 论文把这三个问题正式定义成了三个衡量标准。第一个叫**跨镜头编辑一致性**,简称CSEC,要求被编辑的实体在不同镜头里始终保持一致的外观。第二个叫**多指令解耦**,简称MID,要求多条指令互不干扰,各归各位,不能张冠李戴。第三个叫**时空结构零破坏**,简称ZDSS,要求没被要求改动的部分,包括背景和运动轨迹,一点都不能乱动。 这三个词听起来有点绕,其实归纳起来就一句话:改该改的,别的都别碰,改完了还要前后一致。 论文起的框架名字叫MMLVE-Agent,核心思路可以用一句话概括:从"盲目切块"转向"先思考镜头再动手"。 这套系统由大语言模型和视觉语言模型协同工作,构成一个多智能体架构。 大语言模型*:擅长理解和处理文字,比如把用户那段又长又复杂的中文指令拆解成一条条独立、清晰的编辑任务。 视觉语言模型*:能同时看懂图片和文字,比如判断视频某一帧里到底出现了哪个角色、这个角色符不符合用户描述的特征。 第一阶段叫指令与视频分析。系统先用一个叫PyDetect的工具做物理镜头检测,把长视频按真实的镜头切换点切开,而不是按固定的十五秒去硬切。这个区别很关键:按真实镜头切,才能保证一个完整的场景不会被砍成两半。同时,大语言模型负责把用户的复杂指令拆解成独立的编辑任务,明确每条指令该配哪个实体、该在哪个时间段生效。视觉语言模型则会给每个镜头提取关键帧,分析场景里都发生了什么。 第二阶段是这套系统里最巧妙的设计,叫全局记忆卡。 这个设计要解决的问题是跨镜头一致性。系统先在所有镜头里,用视觉语言模型去检索出现目标实体的关键帧,挑出置信度最高的六张拼成一张参考图,再用图像生成模型合成一张这个实体"原本长什么样"的标准照。接着按照用户的编辑指令,把这张标准照编辑成"改完之后长什么样"的样子。这两张照片一左一右拼在一起,就成了所谓的全局记忆卡,相当于给后续的视频编辑器一个统一的视觉参照物。 这就好比拍电影时的连续性检查员。片场里同一个演员今天穿蓝衬衫拍了一个镜头,三天后补拍另一个镜头时,如果没有人拿着照片提醒场务"上次这里衣服是这样系的,头发是这样梳的",补拍出来的画面很可能对不上。全局记忆卡干的正是这个活,它把"这个实体改之前和改之后分别长什么样"钉死在一张参考图上,不管后面视频编辑器处理多少个镜头,都拿同一张图对齐,不会出现"改到第三个镜头衣服颜色又变了"的情况。如果没有这张卡,每个镜头就是各编各的,互相不知道对方的存在,一致性根本无从谈起。 生成这张标准照的过程本身也不是一次成型,论文引入了一个叫**正负反馈编辑**的机制,简称P-NEF。 视觉语言模型会充当一个评估者的角色,检查生成的参考图是否真的匹配关键帧。如果不匹配,它不只是告诉生成模型"这里错了",同时还会告诉它"这里是对的,继续保持"。前者叫负向提示,后者叫正向提示。 为什么要专门加这个正向提示?论文里做了个很直观的对比实验。如果只用负向反馈,就是不断地告诉模型"别这样、别那样",随着重试次数增加,避免事项越堆越多,模型的注意力会不自觉地全部扑到这些"禁止清单"上,反而忘了原本已经改对的地方,结果是越改越乱,把本来正确的细节也改坏了。 这就像老师批改作文,如果只是不停地在错的地方画红圈,学生下一次写作文时脑子里全是"这里不能这样写、那里不能那样写",反而写不出流畅的内容,因为注意力全被负面清单占据了。如果同时告诉他"这一段写得好,继续保持这个风格",他才能在改正错误的同时不丢掉原本的优点。P-NEF的正向提示就是这个"表扬"的部分,它让模型在修正问题的同时,记住哪些地方已经做对了,不要动。 第三阶段是真正执行视频编辑的环节。这里用到一个叫**检索式按需编辑**的策略:对每个镜头,视觉语言模型会做三次投票判断,这个镜头里到底有没有出现目标实体。只有拿到至少两票"有",编辑操作才会真正触发;如果票数不够,这个镜头就原样保留,不做任何改动。 这个投票机制解决的正是开头提到的幻觉问题。如果没有这道检索关卡,"给骷髅戴帽子"这条指令就会不分场合地砸向每一个镜头,逼着模型在没有骷髅的画面里硬凑一个骷髅出来。有了这道关卡,系统会先确认"这个镜头里到底有没有骷髅",没有就跳过,绝不强行执行。 对确实需要编辑的镜头,系统会用一个叫HappyHorse的视频编辑模型来执行实际改动,同时再套用一层视频级别的P-NEF反馈循环,检查两件事:编辑任务是不是真的完成了,没被要求改动的背景和运动是不是原封不动地保留下来了。改完之后,把编辑过的镜头和跳过的原始镜头重新拼接起来,就是最终的成品视频。 光有方法不够,得有靶子可以打。研究团队专门造了一个评测数据集,叫MMLVE-Bench,从一个开源的视频理解数据集UniVA-Bench里精选了25个高质量的一分钟左右多镜头长视频,每段视频配上大约五条真实且复杂的编辑指令,先由AI生成候选指令,再由人工核查修正,确保逻辑通顺、描述准确。 评测标准也没有走传统路线。像CLIP分数、PSNR这类经典的图像质量打分方式,压根没有能力去理解"这条指令是不是套用到了错误的镜头"这种语义层面的问题,所以论文干脆用视觉语言模型本身来当裁判,针对CSEC、MID、ZDSS这三个核心指标,每个又细分成五个子维度,每个子维度按0、10、20三档打分,满分一百。 | 方法 | CSEC | MID | ZDSS | 平均分 | | Seedance 2.0 | 77.58 | 78.58 | **82.25** | 79.47 | | Kling o3 | 70.00 | 72.57 | 69.13 | 70.57 | | HappyHorse 1.0 | 74.68 | 67.28 | 66.88 | 69.61 | | MMLVE-Agent(本文方法) | **84.80** | **79.04** | 81.68 | **81.84** | 有个细节很有意思。Seedance 2.0在ZDSS这一项拿了最高分,但这并不代表它做得最好,而是因为它在面对复杂场景时会采取一种保守策略,遇到难改的指令直接放弃不改,这样自然不会破坏画面结构,但代价是大量指令根本没被执行,CSEC和MID的分数因此偏低。MMLVE-Agent则是老老实实把该改的都改了,ZDSS分数略有下降,但换来的是全面且真实的编辑执行。 论文还专门找了9名有视频生成和视觉内容评估经验的专家做人工评测,每人随机分到5个案例进行盲测排序。结果MMLVE-Agent在75.6%的案例中排名第一,在93.3%的案例中排进前二,平均排名1.36,远超其他三个基线方法的2.63到3.16。和Seedance 2.0、Kling o3、HappyHorse三个方法两两对比时,胜率分别达到88.4%、80.5%和93.3%,统计检验也确认了这个差距不是偶然。 论文里还有个很生动的对比案例。同一段视频要求把一个时钟的形状改成方形、颜色改成红色,同时删掉一个坐在椅子上的年轻男子,再给骷髅模型戴上棒球帽。Seedance 2.0成功改了时钟颜色但没改形状,完全没删掉那个男子,也漏掉了给骷髅戴帽子这个操作。Kling o3更离谱,时钟形状忽变忽不变,还把那个本该被删除的男子错误地"移植"到了另一个完全不相关的镜头里。HappyHorse 1.0则是把时钟给一起删了,后面几个镜头的顺序还整个乱套了。只有MMLVE-Agent把三条指令都在各自对应的镜头里精准落地,没有波及不该动的地方。 读完这篇论文,有个细节让我一直在想:为什么这些顶级闭源模型在短视频上表现那么好,一到长视频就集体失灵?答案其实藏在论文对Seedance 2.0"保守策略"的描述里。这类模型面对复杂指令时会本能地选择少做、不做,宁可漏改也不乱改,这其实暴露了一个更深的问题:这些模型压根没有"理解视频结构"这一层能力,它们只是在按帧或者按固定时长处理画面,根本不知道镜头和镜头之间存在着叙事上的连续性。 这让我联想到早期机器翻译的困境。逐词翻译永远翻不出通顺的句子,因为语言的意义是建立在上下文和篇章结构上的,不是孤立的词能承载的。视频编辑现在正处在类似的阶段,如果模型不理解"这是一个镜头,那是另一个镜头,它们讲的是同一件事的不同片段",就永远只能在局部打转,做不出真正连贯的长视频编辑。 论文里那个正负反馈机制的设计也值得多想一层。它其实揭示了一个更普遍的现象:单纯的负反馈会让系统陷入局部震荡,不断修正一个错误的同时制造新的错误。这个现象在很多需要迭代优化的系统里都能看到,不只是AI视频编辑。 这篇论文没有回答的问题是,当视频长度继续增加,比如到十分钟、一小时,镜头数量成倍增长时,这套基于检索和投票的机制还能不能撑住。毕竟现在的测试集只是一分钟左右的视频,投票和检索的计算成本会不会随着镜头数量线性甚至更快地增长,这个问题留在了论文之外。 A:MMLVE指的是多指令多镜头长视频编辑任务,要求AI在处理一分钟以上、包含多个镜头切换的长视频时,同时执行多条不同类型的编辑指令,还要保证跨镜头一致性、指令互不干扰、不破坏原有画面结构。 Q2:MMLVE-Agent和现有视频编辑模型比有什么不同? A:现有模型比如Seedance 2.0大多采用固定时长切块的方式处理长视频,容易产生编辑幻觉和身份不一致问题。MMLVE-Agent通过物理镜头检测、全局记忆卡和正负反馈机制,先理解视频结构再针对性编辑,避免了盲目切块带来的各种问题。 Q3:全局记忆卡是怎么保证跨镜头一致性的? A:全局记忆卡是一张"改前改后"对比图,系统先从所有镜头里检索出目标实体的关键帧生成标准参考图,再按指令编辑出改后的样子,后续所有镜头的编辑都参照这张卡进行,从而保证同一实体在不同镜头里外观统一。 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 智东西 2026-09-08 18:00:16 新智元 2026-09-08 18:53:52 新智元 2026-09-08 18:55:04 钛媒体APP 2026-06-01 17:24:30 量子位 2026-08-06 20:00:27 量子位 2026-06-07 04:37:43 DeepTech深科技 2026-09-08 19:16:32 虎嗅APP 2026-09-08 19:14:12 量子位 2026-04-23 11:44:18 淡然综艺 2026-09-05 16:07:13 泠泠说史 2026-09-06 12:58:54 码上闲叙 2026-09-08 15:33:13 菠萝唠生活 2026-09-07 03:48:03 王衜晓 2026-09-08 06:19:12 弱电大林 2026-09-06 05:21:06 鹿鲨Sakana 2026-09-08 03:40:11 栗飞沉 2026-09-08 06:09:41 名岂文章著 2026-09-08 18:51:40 极目新闻 2026-09-08 09:05:24 扬子晚报 2026-09-07 22:11:30 倔强旳牵强 2026-09-06 03:48:04 白小兔手工 2026-09-08 01:27:59 新浪财经 2026-09-08 19:55:19 大小关物语 2026-09-04 05:04:51 科技视讯 2026-09-08 17:56:20 IT之家 2026-09-04 15:29:10 泡泡网 2026-09-08 11:19:20 都市快报橙柿互动 2026-09-08 13:29:54 钛媒体APP 2026-09-08 10:18:07 色影无忌 2026-09-08 19:05:48 游民星空 2026-09-08 17:30:45 蚌埠日报 2026-09-05 04:33:34 凉爽追剧 2026-09-06 22:19:06 孤城落日 2026-09-08 02:17:25 量子位 2026-06-17 18:36:08 科技视讯 2026-09-08 18:33:59 村里整活小分队 2026-09-08 00:58:53 村里整活小分队 2026-09-07 01:11:19 装甲铲史官 2026-07-31 11:45:33 江山别映剪辑 2026-09-07 11:02:21
AI剪辑一分钟以上、有好几个镜头切换的长视频效果如何? 先说一个可能会让你意外的事实:现在市面上那些号称最先进的视频编辑模型,比如Seedance 2.0、Kling o3这些闭源顶流,一旦碰到超过一分钟、有多个镜头切换、还带着好几条编辑指令的长视频,表现会集体崩盘。不是效果差一点,是那种"改了半天连要改的东西都没改对"的崩盘。 这事听起来有点反直觉。毕竟这些模型在十几秒的单镜头短视频上已经很强了,加个滤镜、换个衣服颜色,毫无压力。可一旦视频变长、镜头一多,事情就完全不一样了。南开大学和腾讯的一个研究团队把这个问题系统地摆了出来,还专门造了一个新词来描述它:多指令多镜头长视频编辑,英文缩写MMLVE。 这篇论文做的事情,说白了就是回答一个问题:为什么现有的AI编辑不了长视频,以及怎么才能编辑好。 想象你有一段一分钟的视频,里面出现了三个镜头:第一个镜头是个老工匠在做手工艺品,第二个镜头是一个骷髅模型摆在桌上,第三个镜头是个士兵走过。你给AI下了三条指令:把老工匠的蓝衬衫换成红衬衫,给骷髅戴个海盗帽,把那个士兵从视频里删掉。 现在最常见的处理方式是什么?把这一分钟视频切成四段十五秒的小片段,然后把这三条指令原封不动地扔给每一段去执行。 骷髅模型可能只出现在第二段里,但AI editor拿到"给骷髅戴帽子"这条指令后,如果第一段视频根本没有骷髅,它很可能会凭空生成一个骷髅出来,然后给它戴帽子。这就是论文里说的编辑幻觉问题:本来不该出现的东西,因为指令的存在被硬凑出来了。 如果你在家里请人装修,只跟一个瓦工说"把厨房的墙刷成蓝色",结果这个瓦工听完转头把客厅、卧室、阳台的墙全刷成了蓝色,因为他没搞清楚这句话只适用于厨房这一个空间。这就是当前AI编辑模型犯的错,它们没有能力去判断一条指令只该在某个特定的镜头里生效,而是把所有指令一股脑地套用到所有片段上,结果哪里都出问题。 除了幻觉问题,还有另外两个更棘手的麻烦。一个是跨镜头一致性问题:如果老工匠这个人物在第一个镜头出现,改了衣服颜色,那么等他在后面第三个镜头再次出现时,衣服颜色还是不是红色的?现有模型往往是把每个片段独立处理,压根不知道这两个片段里其实是同一个人,于是改到第三个片段时,又把衣服颜色改回原样了,或者干脆改成了完全不同的颜色。 另一个是时空结构破坏问题:这种"一刀切"的分段方式,很可能会把原本连续的镜头强行打乱顺序,或者破坏掉背景、摄像机运动这些本来不需要改动的东西,导致画面出现闪烁、跳帧,甚至剧情顺序都乱套了。 论文把这三个问题正式定义成了三个衡量标准。第一个叫**跨镜头编辑一致性**,简称CSEC,要求被编辑的实体在不同镜头里始终保持一致的外观。第二个叫**多指令解耦**,简称MID,要求多条指令互不干扰,各归各位,不能张冠李戴。第三个叫**时空结构零破坏**,简称ZDSS,要求没被要求改动的部分,包括背景和运动轨迹,一点都不能乱动。 这三个词听起来有点绕,其实归纳起来就一句话:改该改的,别的都别碰,改完了还要前后一致。 论文起的框架名字叫MMLVE-Agent,核心思路可以用一句话概括:从"盲目切块"转向"先思考镜头再动手"。 这套系统由大语言模型和视觉语言模型协同工作,构成一个多智能体架构。 大语言模型*:擅长理解和处理文字,比如把用户那段又长又复杂的中文指令拆解成一条条独立、清晰的编辑任务。 视觉语言模型*:能同时看懂图片和文字,比如判断视频某一帧里到底出现了哪个角色、这个角色符不符合用户描述的特征。 第一阶段叫指令与视频分析。系统先用一个叫PyDetect的工具做物理镜头检测,把长视频按真实的镜头切换点切开,而不是按固定的十五秒去硬切。这个区别很关键:按真实镜头切,才能保证一个完整的场景不会被砍成两半。同时,大语言模型负责把用户的复杂指令拆解成独立的编辑任务,明确每条指令该配哪个实体、该在哪个时间段生效。视觉语言模型则会给每个镜头提取关键帧,分析场景里都发生了什么。 第二阶段是这套系统里最巧妙的设计,叫全局记忆卡。 这个设计要解决的问题是跨镜头一致性。系统先在所有镜头里,用视觉语言模型去检索出现目标实体的关键帧,挑出置信度最高的六张拼成一张参考图,再用图像生成模型合成一张这个实体"原本长什么样"的标准照。接着按照用户的编辑指令,把这张标准照编辑成"改完之后长什么样"的样子。这两张照片一左一右拼在一起,就成了所谓的全局记忆卡,相当于给后续的视频编辑器一个统一的视觉参照物。 这就好比拍电影时的连续性检查员。片场里同一个演员今天穿蓝衬衫拍了一个镜头,三天后补拍另一个镜头时,如果没有人拿着照片提醒场务"上次这里衣服是这样系的,头发是这样梳的",补拍出来的画面很可能对不上。全局记忆卡干的正是这个活,它把"这个实体改之前和改之后分别长什么样"钉死在一张参考图上,不管后面视频编辑器处理多少个镜头,都拿同一张图对齐,不会出现"改到第三个镜头衣服颜色又变了"的情况。如果没有这张卡,每个镜头就是各编各的,互相不知道对方的存在,一致性根本无从谈起。 生成这张标准照的过程本身也不是一次成型,论文引入了一个叫**正负反馈编辑**的机制,简称P-NEF。 视觉语言模型会充当一个评估者的角色,检查生成的参考图是否真的匹配关键帧。如果不匹配,它不只是告诉生成模型"这里错了",同时还会告诉它"这里是对的,继续保持"。前者叫负向提示,后者叫正向提示。 为什么要专门加这个正向提示?论文里做了个很直观的对比实验。如果只用负向反馈,就是不断地告诉模型"别这样、别那样",随着重试次数增加,避免事项越堆越多,模型的注意力会不自觉地全部扑到这些"禁止清单"上,反而忘了原本已经改对的地方,结果是越改越乱,把本来正确的细节也改坏了。 这就像老师批改作文,如果只是不停地在错的地方画红圈,学生下一次写作文时脑子里全是"这里不能这样写、那里不能那样写",反而写不出流畅的内容,因为注意力全被负面清单占据了。如果同时告诉他"这一段写得好,继续保持这个风格",他才能在改正错误的同时不丢掉原本的优点。P-NEF的正向提示就是这个"表扬"的部分,它让模型在修正问题的同时,记住哪些地方已经做对了,不要动。 第三阶段是真正执行视频编辑的环节。这里用到一个叫**检索式按需编辑**的策略:对每个镜头,视觉语言模型会做三次投票判断,这个镜头里到底有没有出现目标实体。只有拿到至少两票"有",编辑操作才会真正触发;如果票数不够,这个镜头就原样保留,不做任何改动。 这个投票机制解决的正是开头提到的幻觉问题。如果没有这道检索关卡,"给骷髅戴帽子"这条指令就会不分场合地砸向每一个镜头,逼着模型在没有骷髅的画面里硬凑一个骷髅出来。有了这道关卡,系统会先确认"这个镜头里到底有没有骷髅",没有就跳过,绝不强行执行。 对确实需要编辑的镜头,系统会用一个叫HappyHorse的视频编辑模型来执行实际改动,同时再套用一层视频级别的P-NEF反馈循环,检查两件事:编辑任务是不是真的完成了,没被要求改动的背景和运动是不是原封不动地保留下来了。改完之后,把编辑过的镜头和跳过的原始镜头重新拼接起来,就是最终的成品视频。 光有方法不够,得有靶子可以打。研究团队专门造了一个评测数据集,叫MMLVE-Bench,从一个开源的视频理解数据集UniVA-Bench里精选了25个高质量的一分钟左右多镜头长视频,每段视频配上大约五条真实且复杂的编辑指令,先由AI生成候选指令,再由人工核查修正,确保逻辑通顺、描述准确。 评测标准也没有走传统路线。像CLIP分数、PSNR这类经典的图像质量打分方式,压根没有能力去理解"这条指令是不是套用到了错误的镜头"这种语义层面的问题,所以论文干脆用视觉语言模型本身来当裁判,针对CSEC、MID、ZDSS这三个核心指标,每个又细分成五个子维度,每个子维度按0、10、20三档打分,满分一百。 | 方法 | CSEC | MID | ZDSS | 平均分 | | Seedance 2.0 | 77.58 | 78.58 | **82.25** | 79.47 | | Kling o3 | 70.00 | 72.57 | 69.13 | 70.57 | | HappyHorse 1.0 | 74.68 | 67.28 | 66.88 | 69.61 | | MMLVE-Agent(本文方法) | **84.80** | **79.04** | 81.68 | **81.84** | 有个细节很有意思。Seedance 2.0在ZDSS这一项拿了最高分,但这并不代表它做得最好,而是因为它在面对复杂场景时会采取一种保守策略,遇到难改的指令直接放弃不改,这样自然不会破坏画面结构,但代价是大量指令根本没被执行,CSEC和MID的分数因此偏低。MMLVE-Agent则是老老实实把该改的都改了,ZDSS分数略有下降,但换来的是全面且真实的编辑执行。 论文还专门找了9名有视频生成和视觉内容评估经验的专家做人工评测,每人随机分到5个案例进行盲测排序。结果MMLVE-Agent在75.6%的案例中排名第一,在93.3%的案例中排进前二,平均排名1.36,远超其他三个基线方法的2.63到3.16。和Seedance 2.0、Kling o3、HappyHorse三个方法两两对比时,胜率分别达到88.4%、80.5%和93.3%,统计检验也确认了这个差距不是偶然。 论文里还有个很生动的对比案例。同一段视频要求把一个时钟的形状改成方形、颜色改成红色,同时删掉一个坐在椅子上的年轻男子,再给骷髅模型戴上棒球帽。Seedance 2.0成功改了时钟颜色但没改形状,完全没删掉那个男子,也漏掉了给骷髅戴帽子这个操作。Kling o3更离谱,时钟形状忽变忽不变,还把那个本该被删除的男子错误地"移植"到了另一个完全不相关的镜头里。HappyHorse 1.0则是把时钟给一起删了,后面几个镜头的顺序还整个乱套了。只有MMLVE-Agent把三条指令都在各自对应的镜头里精准落地,没有波及不该动的地方。 读完这篇论文,有个细节让我一直在想:为什么这些顶级闭源模型在短视频上表现那么好,一到长视频就集体失灵?答案其实藏在论文对Seedance 2.0"保守策略"的描述里。这类模型面对复杂指令时会本能地选择少做、不做,宁可漏改也不乱改,这其实暴露了一个更深的问题:这些模型压根没有"理解视频结构"这一层能力,它们只是在按帧或者按固定时长处理画面,根本不知道镜头和镜头之间存在着叙事上的连续性。 这让我联想到早期机器翻译的困境。逐词翻译永远翻不出通顺的句子,因为语言的意义是建立在上下文和篇章结构上的,不是孤立的词能承载的。视频编辑现在正处在类似的阶段,如果模型不理解"这是一个镜头,那是另一个镜头,它们讲的是同一件事的不同片段",就永远只能在局部打转,做不出真正连贯的长视频编辑。 论文里那个正负反馈机制的设计也值得多想一层。它其实揭示了一个更普遍的现象:单纯的负反馈会让系统陷入局部震荡,不断修正一个错误的同时制造新的错误。这个现象在很多需要迭代优化的系统里都能看到,不只是AI视频编辑。 这篇论文没有回答的问题是,当视频长度继续增加,比如到十分钟、一小时,镜头数量成倍增长时,这套基于检索和投票的机制还能不能撑住。毕竟现在的测试集只是一分钟左右的视频,投票和检索的计算成本会不会随着镜头数量线性甚至更快地增长,这个问题留在了论文之外。 A:MMLVE指的是多指令多镜头长视频编辑任务,要求AI在处理一分钟以上、包含多个镜头切换的长视频时,同时执行多条不同类型的编辑指令,还要保证跨镜头一致性、指令互不干扰、不破坏原有画面结构。 Q2:MMLVE-Agent和现有视频编辑模型比有什么不同? A:现有模型比如Seedance 2.0大多采用固定时长切块的方式处理长视频,容易产生编辑幻觉和身份不一致问题。MMLVE-Agent通过物理镜头检测、全局记忆卡和正负反馈机制,先理解视频结构再针对性编辑,避免了盲目切块带来的各种问题。 Q3:全局记忆卡是怎么保证跨镜头一致性的? A:全局记忆卡是一张"改前改后"对比图,系统先从所有镜头里检索出目标实体的关键帧生成标准参考图,再按指令编辑出改后的样子,后续所有镜头的编辑都参照这张卡进行,从而保证同一实体在不同镜头里外观统一。 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 智东西 2026-09-08 18:00:16 新智元 2026-09-08 18:53:52 新智元 2026-09-08 18:55:04 钛媒体APP 2026-06-01 17:24:30 量子位 2026-08-06 20:00:27 量子位 2026-06-07 04:37:43 DeepTech深科技 2026-09-08 19:16:32 虎嗅APP 2026-09-08 19:14:12 量子位 2026-04-23 11:44:18 淡然综艺 2026-09-05 16:07:13 泠泠说史 2026-09-06 12:58:54 码上闲叙 2026-09-08 15:33:13 菠萝唠生活 2026-09-07 03:48:03 王衜晓 2026-09-08 06:19:12 弱电大林 2026-09-06 05:21:06 鹿鲨Sakana 2026-09-08 03:40:11 栗飞沉 2026-09-08 06:09:41 名岂文章著 2026-09-08 18:51:40 极目新闻 2026-09-08 09:05:24 扬子晚报 2026-09-07 22:11:30 倔强旳牵强 2026-09-06 03:48:04 白小兔手工 2026-09-08 01:27:59 新浪财经 2026-09-08 19:55:19 大小关物语 2026-09-04 05:04:51 科技视讯 2026-09-08 17:56:20 IT之家 2026-09-04 15:29:10 泡泡网 2026-09-08 11:19:20 都市快报橙柿互动 2026-09-08 13:29:54 钛媒体APP 2026-09-08 10:18:07 色影无忌 2026-09-08 19:05:48 游民星空 2026-09-08 17:30:45 蚌埠日报 2026-09-05 04:33:34 凉爽追剧 2026-09-06 22:19:06 孤城落日 2026-09-08 02:17:25 量子位 2026-06-17 18:36:08 科技视讯 2026-09-08 18:33:59 村里整活小分队 2026-09-08 00:58:53 村里整活小分队 2026-09-07 01:11:19 装甲铲史官 2026-07-31 11:45:33 江山别映剪辑 2026-09-07 11:02:21
AI剪辑一分钟以上、有好几个镜头切换的长视频效果如何? 先说一个可能会让你意外的事实:现在市面上那些号称最先进的视频编辑模型,比如Seedance 2.0、Kling o3这些闭源顶流,一旦碰到超过一分钟、有多个镜头切换、还带着好几条编辑指令的长视频,表现会集体崩盘。不是效果差一点,是那种"改了半天连要改的东西都没改对"的崩盘。 这事听起来有点反直觉。毕竟这些模型在十几秒的单镜头短视频上已经很强了,加个滤镜、换个衣服颜色,毫无压力。可一旦视频变长、镜头一多,事情就完全不一样了。南开大学和腾讯的一个研究团队把这个问题系统地摆了出来,还专门造了一个新词来描述它:多指令多镜头长视频编辑,英文缩写MMLVE。 这篇论文做的事情,说白了就是回答一个问题:为什么现有的AI编辑不了长视频,以及怎么才能编辑好。 想象你有一段一分钟的视频,里面出现了三个镜头:第一个镜头是个老工匠在做手工艺品,第二个镜头是一个骷髅模型摆在桌上,第三个镜头是个士兵走过。你给AI下了三条指令:把老工匠的蓝衬衫换成红衬衫,给骷髅戴个海盗帽,把那个士兵从视频里删掉。 现在最常见的处理方式是什么?把这一分钟视频切成四段十五秒的小片段,然后把这三条指令原封不动地扔给每一段去执行。 骷髅模型可能只出现在第二段里,但AI editor拿到"给骷髅戴帽子"这条指令后,如果第一段视频根本没有骷髅,它很可能会凭空生成一个骷髅出来,然后给它戴帽子。这就是论文里说的编辑幻觉问题:本来不该出现的东西,因为指令的存在被硬凑出来了。 如果你在家里请人装修,只跟一个瓦工说"把厨房的墙刷成蓝色",结果这个瓦工听完转头把客厅、卧室、阳台的墙全刷成了蓝色,因为他没搞清楚这句话只适用于厨房这一个空间。这就是当前AI编辑模型犯的错,它们没有能力去判断一条指令只该在某个特定的镜头里生效,而是把所有指令一股脑地套用到所有片段上,结果哪里都出问题。 除了幻觉问题,还有另外两个更棘手的麻烦。一个是跨镜头一致性问题:如果老工匠这个人物在第一个镜头出现,改了衣服颜色,那么等他在后面第三个镜头再次出现时,衣服颜色还是不是红色的?现有模型往往是把每个片段独立处理,压根不知道这两个片段里其实是同一个人,于是改到第三个片段时,又把衣服颜色改回原样了,或者干脆改成了完全不同的颜色。 另一个是时空结构破坏问题:这种"一刀切"的分段方式,很可能会把原本连续的镜头强行打乱顺序,或者破坏掉背景、摄像机运动这些本来不需要改动的东西,导致画面出现闪烁、跳帧,甚至剧情顺序都乱套了。 论文把这三个问题正式定义成了三个衡量标准。第一个叫**跨镜头编辑一致性**,简称CSEC,要求被编辑的实体在不同镜头里始终保持一致的外观。第二个叫**多指令解耦**,简称MID,要求多条指令互不干扰,各归各位,不能张冠李戴。第三个叫**时空结构零破坏**,简称ZDSS,要求没被要求改动的部分,包括背景和运动轨迹,一点都不能乱动。 这三个词听起来有点绕,其实归纳起来就一句话:改该改的,别的都别碰,改完了还要前后一致。 论文起的框架名字叫MMLVE-Agent,核心思路可以用一句话概括:从"盲目切块"转向"先思考镜头再动手"。 这套系统由大语言模型和视觉语言模型协同工作,构成一个多智能体架构。 大语言模型*:擅长理解和处理文字,比如把用户那段又长又复杂的中文指令拆解成一条条独立、清晰的编辑任务。 视觉语言模型*:能同时看懂图片和文字,比如判断视频某一帧里到底出现了哪个角色、这个角色符不符合用户描述的特征。 第一阶段叫指令与视频分析。系统先用一个叫PyDetect的工具做物理镜头检测,把长视频按真实的镜头切换点切开,而不是按固定的十五秒去硬切。这个区别很关键:按真实镜头切,才能保证一个完整的场景不会被砍成两半。同时,大语言模型负责把用户的复杂指令拆解成独立的编辑任务,明确每条指令该配哪个实体、该在哪个时间段生效。视觉语言模型则会给每个镜头提取关键帧,分析场景里都发生了什么。 第二阶段是这套系统里最巧妙的设计,叫全局记忆卡。 这个设计要解决的问题是跨镜头一致性。系统先在所有镜头里,用视觉语言模型去检索出现目标实体的关键帧,挑出置信度最高的六张拼成一张参考图,再用图像生成模型合成一张这个实体"原本长什么样"的标准照。接着按照用户的编辑指令,把这张标准照编辑成"改完之后长什么样"的样子。这两张照片一左一右拼在一起,就成了所谓的全局记忆卡,相当于给后续的视频编辑器一个统一的视觉参照物。 这就好比拍电影时的连续性检查员。片场里同一个演员今天穿蓝衬衫拍了一个镜头,三天后补拍另一个镜头时,如果没有人拿着照片提醒场务"上次这里衣服是这样系的,头发是这样梳的",补拍出来的画面很可能对不上。全局记忆卡干的正是这个活,它把"这个实体改之前和改之后分别长什么样"钉死在一张参考图上,不管后面视频编辑器处理多少个镜头,都拿同一张图对齐,不会出现"改到第三个镜头衣服颜色又变了"的情况。如果没有这张卡,每个镜头就是各编各的,互相不知道对方的存在,一致性根本无从谈起。 生成这张标准照的过程本身也不是一次成型,论文引入了一个叫**正负反馈编辑**的机制,简称P-NEF。 视觉语言模型会充当一个评估者的角色,检查生成的参考图是否真的匹配关键帧。如果不匹配,它不只是告诉生成模型"这里错了",同时还会告诉它"这里是对的,继续保持"。前者叫负向提示,后者叫正向提示。 为什么要专门加这个正向提示?论文里做了个很直观的对比实验。如果只用负向反馈,就是不断地告诉模型"别这样、别那样",随着重试次数增加,避免事项越堆越多,模型的注意力会不自觉地全部扑到这些"禁止清单"上,反而忘了原本已经改对的地方,结果是越改越乱,把本来正确的细节也改坏了。 这就像老师批改作文,如果只是不停地在错的地方画红圈,学生下一次写作文时脑子里全是"这里不能这样写、那里不能那样写",反而写不出流畅的内容,因为注意力全被负面清单占据了。如果同时告诉他"这一段写得好,继续保持这个风格",他才能在改正错误的同时不丢掉原本的优点。P-NEF的正向提示就是这个"表扬"的部分,它让模型在修正问题的同时,记住哪些地方已经做对了,不要动。 第三阶段是真正执行视频编辑的环节。这里用到一个叫**检索式按需编辑**的策略:对每个镜头,视觉语言模型会做三次投票判断,这个镜头里到底有没有出现目标实体。只有拿到至少两票"有",编辑操作才会真正触发;如果票数不够,这个镜头就原样保留,不做任何改动。 这个投票机制解决的正是开头提到的幻觉问题。如果没有这道检索关卡,"给骷髅戴帽子"这条指令就会不分场合地砸向每一个镜头,逼着模型在没有骷髅的画面里硬凑一个骷髅出来。有了这道关卡,系统会先确认"这个镜头里到底有没有骷髅",没有就跳过,绝不强行执行。 对确实需要编辑的镜头,系统会用一个叫HappyHorse的视频编辑模型来执行实际改动,同时再套用一层视频级别的P-NEF反馈循环,检查两件事:编辑任务是不是真的完成了,没被要求改动的背景和运动是不是原封不动地保留下来了。改完之后,把编辑过的镜头和跳过的原始镜头重新拼接起来,就是最终的成品视频。 光有方法不够,得有靶子可以打。研究团队专门造了一个评测数据集,叫MMLVE-Bench,从一个开源的视频理解数据集UniVA-Bench里精选了25个高质量的一分钟左右多镜头长视频,每段视频配上大约五条真实且复杂的编辑指令,先由AI生成候选指令,再由人工核查修正,确保逻辑通顺、描述准确。 评测标准也没有走传统路线。像CLIP分数、PSNR这类经典的图像质量打分方式,压根没有能力去理解"这条指令是不是套用到了错误的镜头"这种语义层面的问题,所以论文干脆用视觉语言模型本身来当裁判,针对CSEC、MID、ZDSS这三个核心指标,每个又细分成五个子维度,每个子维度按0、10、20三档打分,满分一百。 | 方法 | CSEC | MID | ZDSS | 平均分 | | Seedance 2.0 | 77.58 | 78.58 | **82.25** | 79.47 | | Kling o3 | 70.00 | 72.57 | 69.13 | 70.57 | | HappyHorse 1.0 | 74.68 | 67.28 | 66.88 | 69.61 | | MMLVE-Agent(本文方法) | **84.80** | **79.04** | 81.68 | **81.84** | 有个细节很有意思。Seedance 2.0在ZDSS这一项拿了最高分,但这并不代表它做得最好,而是因为它在面对复杂场景时会采取一种保守策略,遇到难改的指令直接放弃不改,这样自然不会破坏画面结构,但代价是大量指令根本没被执行,CSEC和MID的分数因此偏低。MMLVE-Agent则是老老实实把该改的都改了,ZDSS分数略有下降,但换来的是全面且真实的编辑执行。 论文还专门找了9名有视频生成和视觉内容评估经验的专家做人工评测,每人随机分到5个案例进行盲测排序。结果MMLVE-Agent在75.6%的案例中排名第一,在93.3%的案例中排进前二,平均排名1.36,远超其他三个基线方法的2.63到3.16。和Seedance 2.0、Kling o3、HappyHorse三个方法两两对比时,胜率分别达到88.4%、80.5%和93.3%,统计检验也确认了这个差距不是偶然。 论文里还有个很生动的对比案例。同一段视频要求把一个时钟的形状改成方形、颜色改成红色,同时删掉一个坐在椅子上的年轻男子,再给骷髅模型戴上棒球帽。Seedance 2.0成功改了时钟颜色但没改形状,完全没删掉那个男子,也漏掉了给骷髅戴帽子这个操作。Kling o3更离谱,时钟形状忽变忽不变,还把那个本该被删除的男子错误地"移植"到了另一个完全不相关的镜头里。HappyHorse 1.0则是把时钟给一起删了,后面几个镜头的顺序还整个乱套了。只有MMLVE-Agent把三条指令都在各自对应的镜头里精准落地,没有波及不该动的地方。 读完这篇论文,有个细节让我一直在想:为什么这些顶级闭源模型在短视频上表现那么好,一到长视频就集体失灵?答案其实藏在论文对Seedance 2.0"保守策略"的描述里。这类模型面对复杂指令时会本能地选择少做、不做,宁可漏改也不乱改,这其实暴露了一个更深的问题:这些模型压根没有"理解视频结构"这一层能力,它们只是在按帧或者按固定时长处理画面,根本不知道镜头和镜头之间存在着叙事上的连续性。 这让我联想到早期机器翻译的困境。逐词翻译永远翻不出通顺的句子,因为语言的意义是建立在上下文和篇章结构上的,不是孤立的词能承载的。视频编辑现在正处在类似的阶段,如果模型不理解"这是一个镜头,那是另一个镜头,它们讲的是同一件事的不同片段",就永远只能在局部打转,做不出真正连贯的长视频编辑。 论文里那个正负反馈机制的设计也值得多想一层。它其实揭示了一个更普遍的现象:单纯的负反馈会让系统陷入局部震荡,不断修正一个错误的同时制造新的错误。这个现象在很多需要迭代优化的系统里都能看到,不只是AI视频编辑。 这篇论文没有回答的问题是,当视频长度继续增加,比如到十分钟、一小时,镜头数量成倍增长时,这套基于检索和投票的机制还能不能撑住。毕竟现在的测试集只是一分钟左右的视频,投票和检索的计算成本会不会随着镜头数量线性甚至更快地增长,这个问题留在了论文之外。 A:MMLVE指的是多指令多镜头长视频编辑任务,要求AI在处理一分钟以上、包含多个镜头切换的长视频时,同时执行多条不同类型的编辑指令,还要保证跨镜头一致性、指令互不干扰、不破坏原有画面结构。 Q2:MMLVE-Agent和现有视频编辑模型比有什么不同? A:现有模型比如Seedance 2.0大多采用固定时长切块的方式处理长视频,容易产生编辑幻觉和身份不一致问题。MMLVE-Agent通过物理镜头检测、全局记忆卡和正负反馈机制,先理解视频结构再针对性编辑,避免了盲目切块带来的各种问题。 Q3:全局记忆卡是怎么保证跨镜头一致性的? A:全局记忆卡是一张"改前改后"对比图,系统先从所有镜头里检索出目标实体的关键帧生成标准参考图,再按指令编辑出改后的样子,后续所有镜头的编辑都参照这张卡进行,从而保证同一实体在不同镜头里外观统一。 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 智东西 2026-09-08 18:00:16 新智元 2026-09-08 18:53:52 新智元 2026-09-08 18:55:04 钛媒体APP 2026-06-01 17:24:30 量子位 2026-08-06 20:00:27 量子位 2026-06-07 04:37:43 DeepTech深科技 2026-09-08 19:16:32 虎嗅APP 2026-09-08 19:14:12 量子位 2026-04-23 11:44:18 淡然综艺 2026-09-05 16:07:13 泠泠说史 2026-09-06 12:58:54 码上闲叙 2026-09-08 15:33:13 菠萝唠生活 2026-09-07 03:48:03 王衜晓 2026-09-08 06:19:12 弱电大林 2026-09-06 05:21:06 鹿鲨Sakana 2026-09-08 03:40:11 栗飞沉 2026-09-08 06:09:41 名岂文章著 2026-09-08 18:51:40 极目新闻 2026-09-08 09:05:24 扬子晚报 2026-09-07 22:11:30 倔强旳牵强 2026-09-06 03:48:04 白小兔手工 2026-09-08 01:27:59 新浪财经 2026-09-08 19:55:19 大小关物语 2026-09-04 05:04:51 科技视讯 2026-09-08 17:56:20 IT之家 2026-09-04 15:29:10 泡泡网 2026-09-08 11:19:20 都市快报橙柿互动 2026-09-08 13:29:54 钛媒体APP 2026-09-08 10:18:07 色影无忌 2026-09-08 19:05:48 游民星空 2026-09-08 17:30:45 蚌埠日报 2026-09-05 04:33:34 凉爽追剧 2026-09-06 22:19:06 孤城落日 2026-09-08 02:17:25 量子位 2026-06-17 18:36:08 科技视讯 2026-09-08 18:33:59 村里整活小分队 2026-09-08 00:58:53 村里整活小分队 2026-09-07 01:11:19 装甲铲史官 2026-07-31 11:45:33 江山别映剪辑 2026-09-07 11:02:21
内娱第五大名著,又翻红了-7da68b11
木村拓哉多高AI剪辑一分钟以上、有好几个镜头切换的长视频效果如何? 先说一个可能会让你意外的事实:现在市面上那些号称最先进的视频编辑模型,比如Seedance 2.0、Kling o3这些闭源顶流,一旦碰到超过一分钟、有多个镜头切换、还带着好几条编辑指令的长视频,表现会集体崩盘。不是效果差一点,是那种"改了半天连要改的东西都没改对"的崩盘。 这事听起来有点反直觉。毕竟这些模型在十几秒的单镜头短视频上已经很强了,加个滤镜、换个衣服颜色,毫无压力。可一旦视频变长、镜头一多,事情就完全不一样了。南开大学和腾讯的一个研究团队把这个问题系统地摆了出来,还专门造了一个新词来描述它:多指令多镜头长视频编辑,英文缩写MMLVE。 这篇论文做的事情,说白了就是回答一个问题:为什么现有的AI编辑不了长视频,以及怎么才能编辑好。 想象你有一段一分钟的视频,里面出现了三个镜头:第一个镜头是个老工匠在做手工艺品,第二个镜头是一个骷髅模型摆在桌上,第三个镜头是个士兵走过。你给AI下了三条指令:把老工匠的蓝衬衫换成红衬衫,给骷髅戴个海盗帽,把那个士兵从视频里删掉。 现在最常见的处理方式是什么?把这一分钟视频切成四段十五秒的小片段,然后把这三条指令原封不动地扔给每一段去执行。 骷髅模型可能只出现在第二段里,但AI editor拿到"给骷髅戴帽子"这条指令后,如果第一段视频根本没有骷髅,它很可能会凭空生成一个骷髅出来,然后给它戴帽子。这就是论文里说的编辑幻觉问题:本来不该出现的东西,因为指令的存在被硬凑出来了。 如果你在家里请人装修,只跟一个瓦工说"把厨房的墙刷成蓝色",结果这个瓦工听完转头把客厅、卧室、阳台的墙全刷成了蓝色,因为他没搞清楚这句话只适用于厨房这一个空间。这就是当前AI编辑模型犯的错,它们没有能力去判断一条指令只该在某个特定的镜头里生效,而是把所有指令一股脑地套用到所有片段上,结果哪里都出问题。 除了幻觉问题,还有另外两个更棘手的麻烦。一个是跨镜头一致性问题:如果老工匠这个人物在第一个镜头出现,改了衣服颜色,那么等他在后面第三个镜头再次出现时,衣服颜色还是不是红色的?现有模型往往是把每个片段独立处理,压根不知道这两个片段里其实是同一个人,于是改到第三个片段时,又把衣服颜色改回原样了,或者干脆改成了完全不同的颜色。 另一个是时空结构破坏问题:这种"一刀切"的分段方式,很可能会把原本连续的镜头强行打乱顺序,或者破坏掉背景、摄像机运动这些本来不需要改动的东西,导致画面出现闪烁、跳帧,甚至剧情顺序都乱套了。 论文把这三个问题正式定义成了三个衡量标准。第一个叫**跨镜头编辑一致性**,简称CSEC,要求被编辑的实体在不同镜头里始终保持一致的外观。第二个叫**多指令解耦**,简称MID,要求多条指令互不干扰,各归各位,不能张冠李戴。第三个叫**时空结构零破坏**,简称ZDSS,要求没被要求改动的部分,包括背景和运动轨迹,一点都不能乱动。 这三个词听起来有点绕,其实归纳起来就一句话:改该改的,别的都别碰,改完了还要前后一致。 论文起的框架名字叫MMLVE-Agent,核心思路可以用一句话概括:从"盲目切块"转向"先思考镜头再动手"。 这套系统由大语言模型和视觉语言模型协同工作,构成一个多智能体架构。 大语言模型*:擅长理解和处理文字,比如把用户那段又长又复杂的中文指令拆解成一条条独立、清晰的编辑任务。 视觉语言模型*:能同时看懂图片和文字,比如判断视频某一帧里到底出现了哪个角色、这个角色符不符合用户描述的特征。 第一阶段叫指令与视频分析。系统先用一个叫PyDetect的工具做物理镜头检测,把长视频按真实的镜头切换点切开,而不是按固定的十五秒去硬切。这个区别很关键:按真实镜头切,才能保证一个完整的场景不会被砍成两半。同时,大语言模型负责把用户的复杂指令拆解成独立的编辑任务,明确每条指令该配哪个实体、该在哪个时间段生效。视觉语言模型则会给每个镜头提取关键帧,分析场景里都发生了什么。 第二阶段是这套系统里最巧妙的设计,叫全局记忆卡。 这个设计要解决的问题是跨镜头一致性。系统先在所有镜头里,用视觉语言模型去检索出现目标实体的关键帧,挑出置信度最高的六张拼成一张参考图,再用图像生成模型合成一张这个实体"原本长什么样"的标准照。接着按照用户的编辑指令,把这张标准照编辑成"改完之后长什么样"的样子。这两张照片一左一右拼在一起,就成了所谓的全局记忆卡,相当于给后续的视频编辑器一个统一的视觉参照物。 这就好比拍电影时的连续性检查员。片场里同一个演员今天穿蓝衬衫拍了一个镜头,三天后补拍另一个镜头时,如果没有人拿着照片提醒场务"上次这里衣服是这样系的,头发是这样梳的",补拍出来的画面很可能对不上。全局记忆卡干的正是这个活,它把"这个实体改之前和改之后分别长什么样"钉死在一张参考图上,不管后面视频编辑器处理多少个镜头,都拿同一张图对齐,不会出现"改到第三个镜头衣服颜色又变了"的情况。如果没有这张卡,每个镜头就是各编各的,互相不知道对方的存在,一致性根本无从谈起。 生成这张标准照的过程本身也不是一次成型,论文引入了一个叫**正负反馈编辑**的机制,简称P-NEF。 视觉语言模型会充当一个评估者的角色,检查生成的参考图是否真的匹配关键帧。如果不匹配,它不只是告诉生成模型"这里错了",同时还会告诉它"这里是对的,继续保持"。前者叫负向提示,后者叫正向提示。 为什么要专门加这个正向提示?论文里做了个很直观的对比实验。如果只用负向反馈,就是不断地告诉模型"别这样、别那样",随着重试次数增加,避免事项越堆越多,模型的注意力会不自觉地全部扑到这些"禁止清单"上,反而忘了原本已经改对的地方,结果是越改越乱,把本来正确的细节也改坏了。 这就像老师批改作文,如果只是不停地在错的地方画红圈,学生下一次写作文时脑子里全是"这里不能这样写、那里不能那样写",反而写不出流畅的内容,因为注意力全被负面清单占据了。如果同时告诉他"这一段写得好,继续保持这个风格",他才能在改正错误的同时不丢掉原本的优点。P-NEF的正向提示就是这个"表扬"的部分,它让模型在修正问题的同时,记住哪些地方已经做对了,不要动。 第三阶段是真正执行视频编辑的环节。这里用到一个叫**检索式按需编辑**的策略:对每个镜头,视觉语言模型会做三次投票判断,这个镜头里到底有没有出现目标实体。只有拿到至少两票"有",编辑操作才会真正触发;如果票数不够,这个镜头就原样保留,不做任何改动。 这个投票机制解决的正是开头提到的幻觉问题。如果没有这道检索关卡,"给骷髅戴帽子"这条指令就会不分场合地砸向每一个镜头,逼着模型在没有骷髅的画面里硬凑一个骷髅出来。有了这道关卡,系统会先确认"这个镜头里到底有没有骷髅",没有就跳过,绝不强行执行。 对确实需要编辑的镜头,系统会用一个叫HappyHorse的视频编辑模型来执行实际改动,同时再套用一层视频级别的P-NEF反馈循环,检查两件事:编辑任务是不是真的完成了,没被要求改动的背景和运动是不是原封不动地保留下来了。改完之后,把编辑过的镜头和跳过的原始镜头重新拼接起来,就是最终的成品视频。 光有方法不够,得有靶子可以打。研究团队专门造了一个评测数据集,叫MMLVE-Bench,从一个开源的视频理解数据集UniVA-Bench里精选了25个高质量的一分钟左右多镜头长视频,每段视频配上大约五条真实且复杂的编辑指令,先由AI生成候选指令,再由人工核查修正,确保逻辑通顺、描述准确。 评测标准也没有走传统路线。像CLIP分数、PSNR这类经典的图像质量打分方式,压根没有能力去理解"这条指令是不是套用到了错误的镜头"这种语义层面的问题,所以论文干脆用视觉语言模型本身来当裁判,针对CSEC、MID、ZDSS这三个核心指标,每个又细分成五个子维度,每个子维度按0、10、20三档打分,满分一百。 | 方法 | CSEC | MID | ZDSS | 平均分 | | Seedance 2.0 | 77.58 | 78.58 | **82.25** | 79.47 | | Kling o3 | 70.00 | 72.57 | 69.13 | 70.57 | | HappyHorse 1.0 | 74.68 | 67.28 | 66.88 | 69.61 | | MMLVE-Agent(本文方法) | **84.80** | **79.04** | 81.68 | **81.84** | 有个细节很有意思。Seedance 2.0在ZDSS这一项拿了最高分,但这并不代表它做得最好,而是因为它在面对复杂场景时会采取一种保守策略,遇到难改的指令直接放弃不改,这样自然不会破坏画面结构,但代价是大量指令根本没被执行,CSEC和MID的分数因此偏低。MMLVE-Agent则是老老实实把该改的都改了,ZDSS分数略有下降,但换来的是全面且真实的编辑执行。 论文还专门找了9名有视频生成和视觉内容评估经验的专家做人工评测,每人随机分到5个案例进行盲测排序。结果MMLVE-Agent在75.6%的案例中排名第一,在93.3%的案例中排进前二,平均排名1.36,远超其他三个基线方法的2.63到3.16。和Seedance 2.0、Kling o3、HappyHorse三个方法两两对比时,胜率分别达到88.4%、80.5%和93.3%,统计检验也确认了这个差距不是偶然。 论文里还有个很生动的对比案例。同一段视频要求把一个时钟的形状改成方形、颜色改成红色,同时删掉一个坐在椅子上的年轻男子,再给骷髅模型戴上棒球帽。Seedance 2.0成功改了时钟颜色但没改形状,完全没删掉那个男子,也漏掉了给骷髅戴帽子这个操作。Kling o3更离谱,时钟形状忽变忽不变,还把那个本该被删除的男子错误地"移植"到了另一个完全不相关的镜头里。HappyHorse 1.0则是把时钟给一起删了,后面几个镜头的顺序还整个乱套了。只有MMLVE-Agent把三条指令都在各自对应的镜头里精准落地,没有波及不该动的地方。 读完这篇论文,有个细节让我一直在想:为什么这些顶级闭源模型在短视频上表现那么好,一到长视频就集体失灵?答案其实藏在论文对Seedance 2.0"保守策略"的描述里。这类模型面对复杂指令时会本能地选择少做、不做,宁可漏改也不乱改,这其实暴露了一个更深的问题:这些模型压根没有"理解视频结构"这一层能力,它们只是在按帧或者按固定时长处理画面,根本不知道镜头和镜头之间存在着叙事上的连续性。 这让我联想到早期机器翻译的困境。逐词翻译永远翻不出通顺的句子,因为语言的意义是建立在上下文和篇章结构上的,不是孤立的词能承载的。视频编辑现在正处在类似的阶段,如果模型不理解"这是一个镜头,那是另一个镜头,它们讲的是同一件事的不同片段",就永远只能在局部打转,做不出真正连贯的长视频编辑。 论文里那个正负反馈机制的设计也值得多想一层。它其实揭示了一个更普遍的现象:单纯的负反馈会让系统陷入局部震荡,不断修正一个错误的同时制造新的错误。这个现象在很多需要迭代优化的系统里都能看到,不只是AI视频编辑。 这篇论文没有回答的问题是,当视频长度继续增加,比如到十分钟、一小时,镜头数量成倍增长时,这套基于检索和投票的机制还能不能撑住。毕竟现在的测试集只是一分钟左右的视频,投票和检索的计算成本会不会随着镜头数量线性甚至更快地增长,这个问题留在了论文之外。 A:MMLVE指的是多指令多镜头长视频编辑任务,要求AI在处理一分钟以上、包含多个镜头切换的长视频时,同时执行多条不同类型的编辑指令,还要保证跨镜头一致性、指令互不干扰、不破坏原有画面结构。 Q2:MMLVE-Agent和现有视频编辑模型比有什么不同? A:现有模型比如Seedance 2.0大多采用固定时长切块的方式处理长视频,容易产生编辑幻觉和身份不一致问题。MMLVE-Agent通过物理镜头检测、全局记忆卡和正负反馈机制,先理解视频结构再针对性编辑,避免了盲目切块带来的各种问题。 Q3:全局记忆卡是怎么保证跨镜头一致性的? A:全局记忆卡是一张"改前改后"对比图,系统先从所有镜头里检索出目标实体的关键帧生成标准参考图,再按指令编辑出改后的样子,后续所有镜头的编辑都参照这张卡进行,从而保证同一实体在不同镜头里外观统一。 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 智东西 2026-09-08 18:00:16 新智元 2026-09-08 18:53:52 新智元 2026-09-08 18:55:04 钛媒体APP 2026-06-01 17:24:30 量子位 2026-08-06 20:00:27 量子位 2026-06-07 04:37:43 DeepTech深科技 2026-09-08 19:16:32 虎嗅APP 2026-09-08 19:14:12 量子位 2026-04-23 11:44:18 淡然综艺 2026-09-05 16:07:13 泠泠说史 2026-09-06 12:58:54 码上闲叙 2026-09-08 15:33:13 菠萝唠生活 2026-09-07 03:48:03 王衜晓 2026-09-08 06:19:12 弱电大林 2026-09-06 05:21:06 鹿鲨Sakana 2026-09-08 03:40:11 栗飞沉 2026-09-08 06:09:41 名岂文章著 2026-09-08 18:51:40 极目新闻 2026-09-08 09:05:24 扬子晚报 2026-09-07 22:11:30 倔强旳牵强 2026-09-06 03:48:04 白小兔手工 2026-09-08 01:27:59 新浪财经 2026-09-08 19:55:19 大小关物语 2026-09-04 05:04:51 科技视讯 2026-09-08 17:56:20 IT之家 2026-09-04 15:29:10 泡泡网 2026-09-08 11:19:20 都市快报橙柿互动 2026-09-08 13:29:54 钛媒体APP 2026-09-08 10:18:07 色影无忌 2026-09-08 19:05:48 游民星空 2026-09-08 17:30:45 蚌埠日报 2026-09-05 04:33:34 凉爽追剧 2026-09-06 22:19:06 孤城落日 2026-09-08 02:17:25 量子位 2026-06-17 18:36:08 科技视讯 2026-09-08 18:33:59 村里整活小分队 2026-09-08 00:58:53 村里整活小分队 2026-09-07 01:11:19 装甲铲史官 2026-07-31 11:45:33 江山别映剪辑 2026-09-07 11:02:21
AI剪辑一分钟以上、有好几个镜头切换的长视频效果如何? 先说一个可能会让你意外的事实:现在市面上那些号称最先进的视频编辑模型,比如Seedance 2.0、Kling o3这些闭源顶流,一旦碰到超过一分钟、有多个镜头切换、还带着好几条编辑指令的长视频,表现会集体崩盘。不是效果差一点,是那种"改了半天连要改的东西都没改对"的崩盘。 这事听起来有点反直觉。毕竟这些模型在十几秒的单镜头短视频上已经很强了,加个滤镜、换个衣服颜色,毫无压力。可一旦视频变长、镜头一多,事情就完全不一样了。南开大学和腾讯的一个研究团队把这个问题系统地摆了出来,还专门造了一个新词来描述它:多指令多镜头长视频编辑,英文缩写MMLVE。 这篇论文做的事情,说白了就是回答一个问题:为什么现有的AI编辑不了长视频,以及怎么才能编辑好。 想象你有一段一分钟的视频,里面出现了三个镜头:第一个镜头是个老工匠在做手工艺品,第二个镜头是一个骷髅模型摆在桌上,第三个镜头是个士兵走过。你给AI下了三条指令:把老工匠的蓝衬衫换成红衬衫,给骷髅戴个海盗帽,把那个士兵从视频里删掉。 现在最常见的处理方式是什么?把这一分钟视频切成四段十五秒的小片段,然后把这三条指令原封不动地扔给每一段去执行。 骷髅模型可能只出现在第二段里,但AI editor拿到"给骷髅戴帽子"这条指令后,如果第一段视频根本没有骷髅,它很可能会凭空生成一个骷髅出来,然后给它戴帽子。这就是论文里说的编辑幻觉问题:本来不该出现的东西,因为指令的存在被硬凑出来了。 如果你在家里请人装修,只跟一个瓦工说"把厨房的墙刷成蓝色",结果这个瓦工听完转头把客厅、卧室、阳台的墙全刷成了蓝色,因为他没搞清楚这句话只适用于厨房这一个空间。这就是当前AI编辑模型犯的错,它们没有能力去判断一条指令只该在某个特定的镜头里生效,而是把所有指令一股脑地套用到所有片段上,结果哪里都出问题。 除了幻觉问题,还有另外两个更棘手的麻烦。一个是跨镜头一致性问题:如果老工匠这个人物在第一个镜头出现,改了衣服颜色,那么等他在后面第三个镜头再次出现时,衣服颜色还是不是红色的?现有模型往往是把每个片段独立处理,压根不知道这两个片段里其实是同一个人,于是改到第三个片段时,又把衣服颜色改回原样了,或者干脆改成了完全不同的颜色。 另一个是时空结构破坏问题:这种"一刀切"的分段方式,很可能会把原本连续的镜头强行打乱顺序,或者破坏掉背景、摄像机运动这些本来不需要改动的东西,导致画面出现闪烁、跳帧,甚至剧情顺序都乱套了。 论文把这三个问题正式定义成了三个衡量标准。第一个叫**跨镜头编辑一致性**,简称CSEC,要求被编辑的实体在不同镜头里始终保持一致的外观。第二个叫**多指令解耦**,简称MID,要求多条指令互不干扰,各归各位,不能张冠李戴。第三个叫**时空结构零破坏**,简称ZDSS,要求没被要求改动的部分,包括背景和运动轨迹,一点都不能乱动。 这三个词听起来有点绕,其实归纳起来就一句话:改该改的,别的都别碰,改完了还要前后一致。 论文起的框架名字叫MMLVE-Agent,核心思路可以用一句话概括:从"盲目切块"转向"先思考镜头再动手"。 这套系统由大语言模型和视觉语言模型协同工作,构成一个多智能体架构。 大语言模型*:擅长理解和处理文字,比如把用户那段又长又复杂的中文指令拆解成一条条独立、清晰的编辑任务。 视觉语言模型*:能同时看懂图片和文字,比如判断视频某一帧里到底出现了哪个角色、这个角色符不符合用户描述的特征。 第一阶段叫指令与视频分析。系统先用一个叫PyDetect的工具做物理镜头检测,把长视频按真实的镜头切换点切开,而不是按固定的十五秒去硬切。这个区别很关键:按真实镜头切,才能保证一个完整的场景不会被砍成两半。同时,大语言模型负责把用户的复杂指令拆解成独立的编辑任务,明确每条指令该配哪个实体、该在哪个时间段生效。视觉语言模型则会给每个镜头提取关键帧,分析场景里都发生了什么。 第二阶段是这套系统里最巧妙的设计,叫全局记忆卡。 这个设计要解决的问题是跨镜头一致性。系统先在所有镜头里,用视觉语言模型去检索出现目标实体的关键帧,挑出置信度最高的六张拼成一张参考图,再用图像生成模型合成一张这个实体"原本长什么样"的标准照。接着按照用户的编辑指令,把这张标准照编辑成"改完之后长什么样"的样子。这两张照片一左一右拼在一起,就成了所谓的全局记忆卡,相当于给后续的视频编辑器一个统一的视觉参照物。 这就好比拍电影时的连续性检查员。片场里同一个演员今天穿蓝衬衫拍了一个镜头,三天后补拍另一个镜头时,如果没有人拿着照片提醒场务"上次这里衣服是这样系的,头发是这样梳的",补拍出来的画面很可能对不上。全局记忆卡干的正是这个活,它把"这个实体改之前和改之后分别长什么样"钉死在一张参考图上,不管后面视频编辑器处理多少个镜头,都拿同一张图对齐,不会出现"改到第三个镜头衣服颜色又变了"的情况。如果没有这张卡,每个镜头就是各编各的,互相不知道对方的存在,一致性根本无从谈起。 生成这张标准照的过程本身也不是一次成型,论文引入了一个叫**正负反馈编辑**的机制,简称P-NEF。 视觉语言模型会充当一个评估者的角色,检查生成的参考图是否真的匹配关键帧。如果不匹配,它不只是告诉生成模型"这里错了",同时还会告诉它"这里是对的,继续保持"。前者叫负向提示,后者叫正向提示。 为什么要专门加这个正向提示?论文里做了个很直观的对比实验。如果只用负向反馈,就是不断地告诉模型"别这样、别那样",随着重试次数增加,避免事项越堆越多,模型的注意力会不自觉地全部扑到这些"禁止清单"上,反而忘了原本已经改对的地方,结果是越改越乱,把本来正确的细节也改坏了。 这就像老师批改作文,如果只是不停地在错的地方画红圈,学生下一次写作文时脑子里全是"这里不能这样写、那里不能那样写",反而写不出流畅的内容,因为注意力全被负面清单占据了。如果同时告诉他"这一段写得好,继续保持这个风格",他才能在改正错误的同时不丢掉原本的优点。P-NEF的正向提示就是这个"表扬"的部分,它让模型在修正问题的同时,记住哪些地方已经做对了,不要动。 第三阶段是真正执行视频编辑的环节。这里用到一个叫**检索式按需编辑**的策略:对每个镜头,视觉语言模型会做三次投票判断,这个镜头里到底有没有出现目标实体。只有拿到至少两票"有",编辑操作才会真正触发;如果票数不够,这个镜头就原样保留,不做任何改动。 这个投票机制解决的正是开头提到的幻觉问题。如果没有这道检索关卡,"给骷髅戴帽子"这条指令就会不分场合地砸向每一个镜头,逼着模型在没有骷髅的画面里硬凑一个骷髅出来。有了这道关卡,系统会先确认"这个镜头里到底有没有骷髅",没有就跳过,绝不强行执行。 对确实需要编辑的镜头,系统会用一个叫HappyHorse的视频编辑模型来执行实际改动,同时再套用一层视频级别的P-NEF反馈循环,检查两件事:编辑任务是不是真的完成了,没被要求改动的背景和运动是不是原封不动地保留下来了。改完之后,把编辑过的镜头和跳过的原始镜头重新拼接起来,就是最终的成品视频。 光有方法不够,得有靶子可以打。研究团队专门造了一个评测数据集,叫MMLVE-Bench,从一个开源的视频理解数据集UniVA-Bench里精选了25个高质量的一分钟左右多镜头长视频,每段视频配上大约五条真实且复杂的编辑指令,先由AI生成候选指令,再由人工核查修正,确保逻辑通顺、描述准确。 评测标准也没有走传统路线。像CLIP分数、PSNR这类经典的图像质量打分方式,压根没有能力去理解"这条指令是不是套用到了错误的镜头"这种语义层面的问题,所以论文干脆用视觉语言模型本身来当裁判,针对CSEC、MID、ZDSS这三个核心指标,每个又细分成五个子维度,每个子维度按0、10、20三档打分,满分一百。 | 方法 | CSEC | MID | ZDSS | 平均分 | | Seedance 2.0 | 77.58 | 78.58 | **82.25** | 79.47 | | Kling o3 | 70.00 | 72.57 | 69.13 | 70.57 | | HappyHorse 1.0 | 74.68 | 67.28 | 66.88 | 69.61 | | MMLVE-Agent(本文方法) | **84.80** | **79.04** | 81.68 | **81.84** | 有个细节很有意思。Seedance 2.0在ZDSS这一项拿了最高分,但这并不代表它做得最好,而是因为它在面对复杂场景时会采取一种保守策略,遇到难改的指令直接放弃不改,这样自然不会破坏画面结构,但代价是大量指令根本没被执行,CSEC和MID的分数因此偏低。MMLVE-Agent则是老老实实把该改的都改了,ZDSS分数略有下降,但换来的是全面且真实的编辑执行。 论文还专门找了9名有视频生成和视觉内容评估经验的专家做人工评测,每人随机分到5个案例进行盲测排序。结果MMLVE-Agent在75.6%的案例中排名第一,在93.3%的案例中排进前二,平均排名1.36,远超其他三个基线方法的2.63到3.16。和Seedance 2.0、Kling o3、HappyHorse三个方法两两对比时,胜率分别达到88.4%、80.5%和93.3%,统计检验也确认了这个差距不是偶然。 论文里还有个很生动的对比案例。同一段视频要求把一个时钟的形状改成方形、颜色改成红色,同时删掉一个坐在椅子上的年轻男子,再给骷髅模型戴上棒球帽。Seedance 2.0成功改了时钟颜色但没改形状,完全没删掉那个男子,也漏掉了给骷髅戴帽子这个操作。Kling o3更离谱,时钟形状忽变忽不变,还把那个本该被删除的男子错误地"移植"到了另一个完全不相关的镜头里。HappyHorse 1.0则是把时钟给一起删了,后面几个镜头的顺序还整个乱套了。只有MMLVE-Agent把三条指令都在各自对应的镜头里精准落地,没有波及不该动的地方。 读完这篇论文,有个细节让我一直在想:为什么这些顶级闭源模型在短视频上表现那么好,一到长视频就集体失灵?答案其实藏在论文对Seedance 2.0"保守策略"的描述里。这类模型面对复杂指令时会本能地选择少做、不做,宁可漏改也不乱改,这其实暴露了一个更深的问题:这些模型压根没有"理解视频结构"这一层能力,它们只是在按帧或者按固定时长处理画面,根本不知道镜头和镜头之间存在着叙事上的连续性。 这让我联想到早期机器翻译的困境。逐词翻译永远翻不出通顺的句子,因为语言的意义是建立在上下文和篇章结构上的,不是孤立的词能承载的。视频编辑现在正处在类似的阶段,如果模型不理解"这是一个镜头,那是另一个镜头,它们讲的是同一件事的不同片段",就永远只能在局部打转,做不出真正连贯的长视频编辑。 论文里那个正负反馈机制的设计也值得多想一层。它其实揭示了一个更普遍的现象:单纯的负反馈会让系统陷入局部震荡,不断修正一个错误的同时制造新的错误。这个现象在很多需要迭代优化的系统里都能看到,不只是AI视频编辑。 这篇论文没有回答的问题是,当视频长度继续增加,比如到十分钟、一小时,镜头数量成倍增长时,这套基于检索和投票的机制还能不能撑住。毕竟现在的测试集只是一分钟左右的视频,投票和检索的计算成本会不会随着镜头数量线性甚至更快地增长,这个问题留在了论文之外。 A:MMLVE指的是多指令多镜头长视频编辑任务,要求AI在处理一分钟以上、包含多个镜头切换的长视频时,同时执行多条不同类型的编辑指令,还要保证跨镜头一致性、指令互不干扰、不破坏原有画面结构。 Q2:MMLVE-Agent和现有视频编辑模型比有什么不同? A:现有模型比如Seedance 2.0大多采用固定时长切块的方式处理长视频,容易产生编辑幻觉和身份不一致问题。MMLVE-Agent通过物理镜头检测、全局记忆卡和正负反馈机制,先理解视频结构再针对性编辑,避免了盲目切块带来的各种问题。 Q3:全局记忆卡是怎么保证跨镜头一致性的? A:全局记忆卡是一张"改前改后"对比图,系统先从所有镜头里检索出目标实体的关键帧生成标准参考图,再按指令编辑出改后的样子,后续所有镜头的编辑都参照这张卡进行,从而保证同一实体在不同镜头里外观统一。 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 智东西 2026-09-08 18:00:16 新智元 2026-09-08 18:53:52 新智元 2026-09-08 18:55:04 钛媒体APP 2026-06-01 17:24:30 量子位 2026-08-06 20:00:27 量子位 2026-06-07 04:37:43 DeepTech深科技 2026-09-08 19:16:32 虎嗅APP 2026-09-08 19:14:12 量子位 2026-04-23 11:44:18 淡然综艺 2026-09-05 16:07:13 泠泠说史 2026-09-06 12:58:54 码上闲叙 2026-09-08 15:33:13 菠萝唠生活 2026-09-07 03:48:03 王衜晓 2026-09-08 06:19:12 弱电大林 2026-09-06 05:21:06 鹿鲨Sakana 2026-09-08 03:40:11 栗飞沉 2026-09-08 06:09:41 名岂文章著 2026-09-08 18:51:40 极目新闻 2026-09-08 09:05:24 扬子晚报 2026-09-07 22:11:30 倔强旳牵强 2026-09-06 03:48:04 白小兔手工 2026-09-08 01:27:59 新浪财经 2026-09-08 19:55:19 大小关物语 2026-09-04 05:04:51 科技视讯 2026-09-08 17:56:20 IT之家 2026-09-04 15:29:10 泡泡网 2026-09-08 11:19:20 都市快报橙柿互动 2026-09-08 13:29:54 钛媒体APP 2026-09-08 10:18:07 色影无忌 2026-09-08 19:05:48 游民星空 2026-09-08 17:30:45 蚌埠日报 2026-09-05 04:33:34 凉爽追剧 2026-09-06 22:19:06 孤城落日 2026-09-08 02:17:25 量子位 2026-06-17 18:36:08 科技视讯 2026-09-08 18:33:59 村里整活小分队 2026-09-08 00:58:53 村里整活小分队 2026-09-07 01:11:19 装甲铲史官 2026-07-31 11:45:33 江山别映剪辑 2026-09-07 11:02:21
AI剪辑一分钟以上、有好几个镜头切换的长视频效果如何? 先说一个可能会让你意外的事实:现在市面上那些号称最先进的视频编辑模型,比如Seedance 2.0、Kling o3这些闭源顶流,一旦碰到超过一分钟、有多个镜头切换、还带着好几条编辑指令的长视频,表现会集体崩盘。不是效果差一点,是那种"改了半天连要改的东西都没改对"的崩盘。 这事听起来有点反直觉。毕竟这些模型在十几秒的单镜头短视频上已经很强了,加个滤镜、换个衣服颜色,毫无压力。可一旦视频变长、镜头一多,事情就完全不一样了。南开大学和腾讯的一个研究团队把这个问题系统地摆了出来,还专门造了一个新词来描述它:多指令多镜头长视频编辑,英文缩写MMLVE。 这篇论文做的事情,说白了就是回答一个问题:为什么现有的AI编辑不了长视频,以及怎么才能编辑好。 想象你有一段一分钟的视频,里面出现了三个镜头:第一个镜头是个老工匠在做手工艺品,第二个镜头是一个骷髅模型摆在桌上,第三个镜头是个士兵走过。你给AI下了三条指令:把老工匠的蓝衬衫换成红衬衫,给骷髅戴个海盗帽,把那个士兵从视频里删掉。 现在最常见的处理方式是什么?把这一分钟视频切成四段十五秒的小片段,然后把这三条指令原封不动地扔给每一段去执行。 骷髅模型可能只出现在第二段里,但AI editor拿到"给骷髅戴帽子"这条指令后,如果第一段视频根本没有骷髅,它很可能会凭空生成一个骷髅出来,然后给它戴帽子。这就是论文里说的编辑幻觉问题:本来不该出现的东西,因为指令的存在被硬凑出来了。 如果你在家里请人装修,只跟一个瓦工说"把厨房的墙刷成蓝色",结果这个瓦工听完转头把客厅、卧室、阳台的墙全刷成了蓝色,因为他没搞清楚这句话只适用于厨房这一个空间。这就是当前AI编辑模型犯的错,它们没有能力去判断一条指令只该在某个特定的镜头里生效,而是把所有指令一股脑地套用到所有片段上,结果哪里都出问题。 除了幻觉问题,还有另外两个更棘手的麻烦。一个是跨镜头一致性问题:如果老工匠这个人物在第一个镜头出现,改了衣服颜色,那么等他在后面第三个镜头再次出现时,衣服颜色还是不是红色的?现有模型往往是把每个片段独立处理,压根不知道这两个片段里其实是同一个人,于是改到第三个片段时,又把衣服颜色改回原样了,或者干脆改成了完全不同的颜色。 另一个是时空结构破坏问题:这种"一刀切"的分段方式,很可能会把原本连续的镜头强行打乱顺序,或者破坏掉背景、摄像机运动这些本来不需要改动的东西,导致画面出现闪烁、跳帧,甚至剧情顺序都乱套了。 论文把这三个问题正式定义成了三个衡量标准。第一个叫**跨镜头编辑一致性**,简称CSEC,要求被编辑的实体在不同镜头里始终保持一致的外观。第二个叫**多指令解耦**,简称MID,要求多条指令互不干扰,各归各位,不能张冠李戴。第三个叫**时空结构零破坏**,简称ZDSS,要求没被要求改动的部分,包括背景和运动轨迹,一点都不能乱动。 这三个词听起来有点绕,其实归纳起来就一句话:改该改的,别的都别碰,改完了还要前后一致。 论文起的框架名字叫MMLVE-Agent,核心思路可以用一句话概括:从"盲目切块"转向"先思考镜头再动手"。 这套系统由大语言模型和视觉语言模型协同工作,构成一个多智能体架构。 大语言模型*:擅长理解和处理文字,比如把用户那段又长又复杂的中文指令拆解成一条条独立、清晰的编辑任务。 视觉语言模型*:能同时看懂图片和文字,比如判断视频某一帧里到底出现了哪个角色、这个角色符不符合用户描述的特征。 第一阶段叫指令与视频分析。系统先用一个叫PyDetect的工具做物理镜头检测,把长视频按真实的镜头切换点切开,而不是按固定的十五秒去硬切。这个区别很关键:按真实镜头切,才能保证一个完整的场景不会被砍成两半。同时,大语言模型负责把用户的复杂指令拆解成独立的编辑任务,明确每条指令该配哪个实体、该在哪个时间段生效。视觉语言模型则会给每个镜头提取关键帧,分析场景里都发生了什么。 第二阶段是这套系统里最巧妙的设计,叫全局记忆卡。 这个设计要解决的问题是跨镜头一致性。系统先在所有镜头里,用视觉语言模型去检索出现目标实体的关键帧,挑出置信度最高的六张拼成一张参考图,再用图像生成模型合成一张这个实体"原本长什么样"的标准照。接着按照用户的编辑指令,把这张标准照编辑成"改完之后长什么样"的样子。这两张照片一左一右拼在一起,就成了所谓的全局记忆卡,相当于给后续的视频编辑器一个统一的视觉参照物。 这就好比拍电影时的连续性检查员。片场里同一个演员今天穿蓝衬衫拍了一个镜头,三天后补拍另一个镜头时,如果没有人拿着照片提醒场务"上次这里衣服是这样系的,头发是这样梳的",补拍出来的画面很可能对不上。全局记忆卡干的正是这个活,它把"这个实体改之前和改之后分别长什么样"钉死在一张参考图上,不管后面视频编辑器处理多少个镜头,都拿同一张图对齐,不会出现"改到第三个镜头衣服颜色又变了"的情况。如果没有这张卡,每个镜头就是各编各的,互相不知道对方的存在,一致性根本无从谈起。 生成这张标准照的过程本身也不是一次成型,论文引入了一个叫**正负反馈编辑**的机制,简称P-NEF。 视觉语言模型会充当一个评估者的角色,检查生成的参考图是否真的匹配关键帧。如果不匹配,它不只是告诉生成模型"这里错了",同时还会告诉它"这里是对的,继续保持"。前者叫负向提示,后者叫正向提示。 为什么要专门加这个正向提示?论文里做了个很直观的对比实验。如果只用负向反馈,就是不断地告诉模型"别这样、别那样",随着重试次数增加,避免事项越堆越多,模型的注意力会不自觉地全部扑到这些"禁止清单"上,反而忘了原本已经改对的地方,结果是越改越乱,把本来正确的细节也改坏了。 这就像老师批改作文,如果只是不停地在错的地方画红圈,学生下一次写作文时脑子里全是"这里不能这样写、那里不能那样写",反而写不出流畅的内容,因为注意力全被负面清单占据了。如果同时告诉他"这一段写得好,继续保持这个风格",他才能在改正错误的同时不丢掉原本的优点。P-NEF的正向提示就是这个"表扬"的部分,它让模型在修正问题的同时,记住哪些地方已经做对了,不要动。 第三阶段是真正执行视频编辑的环节。这里用到一个叫**检索式按需编辑**的策略:对每个镜头,视觉语言模型会做三次投票判断,这个镜头里到底有没有出现目标实体。只有拿到至少两票"有",编辑操作才会真正触发;如果票数不够,这个镜头就原样保留,不做任何改动。 这个投票机制解决的正是开头提到的幻觉问题。如果没有这道检索关卡,"给骷髅戴帽子"这条指令就会不分场合地砸向每一个镜头,逼着模型在没有骷髅的画面里硬凑一个骷髅出来。有了这道关卡,系统会先确认"这个镜头里到底有没有骷髅",没有就跳过,绝不强行执行。 对确实需要编辑的镜头,系统会用一个叫HappyHorse的视频编辑模型来执行实际改动,同时再套用一层视频级别的P-NEF反馈循环,检查两件事:编辑任务是不是真的完成了,没被要求改动的背景和运动是不是原封不动地保留下来了。改完之后,把编辑过的镜头和跳过的原始镜头重新拼接起来,就是最终的成品视频。 光有方法不够,得有靶子可以打。研究团队专门造了一个评测数据集,叫MMLVE-Bench,从一个开源的视频理解数据集UniVA-Bench里精选了25个高质量的一分钟左右多镜头长视频,每段视频配上大约五条真实且复杂的编辑指令,先由AI生成候选指令,再由人工核查修正,确保逻辑通顺、描述准确。 评测标准也没有走传统路线。像CLIP分数、PSNR这类经典的图像质量打分方式,压根没有能力去理解"这条指令是不是套用到了错误的镜头"这种语义层面的问题,所以论文干脆用视觉语言模型本身来当裁判,针对CSEC、MID、ZDSS这三个核心指标,每个又细分成五个子维度,每个子维度按0、10、20三档打分,满分一百。 | 方法 | CSEC | MID | ZDSS | 平均分 | | Seedance 2.0 | 77.58 | 78.58 | **82.25** | 79.47 | | Kling o3 | 70.00 | 72.57 | 69.13 | 70.57 | | HappyHorse 1.0 | 74.68 | 67.28 | 66.88 | 69.61 | | MMLVE-Agent(本文方法) | **84.80** | **79.04** | 81.68 | **81.84** | 有个细节很有意思。Seedance 2.0在ZDSS这一项拿了最高分,但这并不代表它做得最好,而是因为它在面对复杂场景时会采取一种保守策略,遇到难改的指令直接放弃不改,这样自然不会破坏画面结构,但代价是大量指令根本没被执行,CSEC和MID的分数因此偏低。MMLVE-Agent则是老老实实把该改的都改了,ZDSS分数略有下降,但换来的是全面且真实的编辑执行。 论文还专门找了9名有视频生成和视觉内容评估经验的专家做人工评测,每人随机分到5个案例进行盲测排序。结果MMLVE-Agent在75.6%的案例中排名第一,在93.3%的案例中排进前二,平均排名1.36,远超其他三个基线方法的2.63到3.16。和Seedance 2.0、Kling o3、HappyHorse三个方法两两对比时,胜率分别达到88.4%、80.5%和93.3%,统计检验也确认了这个差距不是偶然。 论文里还有个很生动的对比案例。同一段视频要求把一个时钟的形状改成方形、颜色改成红色,同时删掉一个坐在椅子上的年轻男子,再给骷髅模型戴上棒球帽。Seedance 2.0成功改了时钟颜色但没改形状,完全没删掉那个男子,也漏掉了给骷髅戴帽子这个操作。Kling o3更离谱,时钟形状忽变忽不变,还把那个本该被删除的男子错误地"移植"到了另一个完全不相关的镜头里。HappyHorse 1.0则是把时钟给一起删了,后面几个镜头的顺序还整个乱套了。只有MMLVE-Agent把三条指令都在各自对应的镜头里精准落地,没有波及不该动的地方。 读完这篇论文,有个细节让我一直在想:为什么这些顶级闭源模型在短视频上表现那么好,一到长视频就集体失灵?答案其实藏在论文对Seedance 2.0"保守策略"的描述里。这类模型面对复杂指令时会本能地选择少做、不做,宁可漏改也不乱改,这其实暴露了一个更深的问题:这些模型压根没有"理解视频结构"这一层能力,它们只是在按帧或者按固定时长处理画面,根本不知道镜头和镜头之间存在着叙事上的连续性。 这让我联想到早期机器翻译的困境。逐词翻译永远翻不出通顺的句子,因为语言的意义是建立在上下文和篇章结构上的,不是孤立的词能承载的。视频编辑现在正处在类似的阶段,如果模型不理解"这是一个镜头,那是另一个镜头,它们讲的是同一件事的不同片段",就永远只能在局部打转,做不出真正连贯的长视频编辑。 论文里那个正负反馈机制的设计也值得多想一层。它其实揭示了一个更普遍的现象:单纯的负反馈会让系统陷入局部震荡,不断修正一个错误的同时制造新的错误。这个现象在很多需要迭代优化的系统里都能看到,不只是AI视频编辑。 这篇论文没有回答的问题是,当视频长度继续增加,比如到十分钟、一小时,镜头数量成倍增长时,这套基于检索和投票的机制还能不能撑住。毕竟现在的测试集只是一分钟左右的视频,投票和检索的计算成本会不会随着镜头数量线性甚至更快地增长,这个问题留在了论文之外。 A:MMLVE指的是多指令多镜头长视频编辑任务,要求AI在处理一分钟以上、包含多个镜头切换的长视频时,同时执行多条不同类型的编辑指令,还要保证跨镜头一致性、指令互不干扰、不破坏原有画面结构。 Q2:MMLVE-Agent和现有视频编辑模型比有什么不同? A:现有模型比如Seedance 2.0大多采用固定时长切块的方式处理长视频,容易产生编辑幻觉和身份不一致问题。MMLVE-Agent通过物理镜头检测、全局记忆卡和正负反馈机制,先理解视频结构再针对性编辑,避免了盲目切块带来的各种问题。 Q3:全局记忆卡是怎么保证跨镜头一致性的? A:全局记忆卡是一张"改前改后"对比图,系统先从所有镜头里检索出目标实体的关键帧生成标准参考图,再按指令编辑出改后的样子,后续所有镜头的编辑都参照这张卡进行,从而保证同一实体在不同镜头里外观统一。 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 智东西 2026-09-08 18:00:16 新智元 2026-09-08 18:53:52 新智元 2026-09-08 18:55:04 钛媒体APP 2026-06-01 17:24:30 量子位 2026-08-06 20:00:27 量子位 2026-06-07 04:37:43 DeepTech深科技 2026-09-08 19:16:32 虎嗅APP 2026-09-08 19:14:12 量子位 2026-04-23 11:44:18 淡然综艺 2026-09-05 16:07:13 泠泠说史 2026-09-06 12:58:54 码上闲叙 2026-09-08 15:33:13 菠萝唠生活 2026-09-07 03:48:03 王衜晓 2026-09-08 06:19:12 弱电大林 2026-09-06 05:21:06 鹿鲨Sakana 2026-09-08 03:40:11 栗飞沉 2026-09-08 06:09:41 名岂文章著 2026-09-08 18:51:40 极目新闻 2026-09-08 09:05:24 扬子晚报 2026-09-07 22:11:30 倔强旳牵强 2026-09-06 03:48:04 白小兔手工 2026-09-08 01:27:59 新浪财经 2026-09-08 19:55:19 大小关物语 2026-09-04 05:04:51 科技视讯 2026-09-08 17:56:20 IT之家 2026-09-04 15:29:10 泡泡网 2026-09-08 11:19:20 都市快报橙柿互动 2026-09-08 13:29:54 钛媒体APP 2026-09-08 10:18:07 色影无忌 2026-09-08 19:05:48 游民星空 2026-09-08 17:30:45 蚌埠日报 2026-09-05 04:33:34 凉爽追剧 2026-09-06 22:19:06 孤城落日 2026-09-08 02:17:25 量子位 2026-06-17 18:36:08 科技视讯 2026-09-08 18:33:59 村里整活小分队 2026-09-08 00:58:53 村里整活小分队 2026-09-07 01:11:19 装甲铲史官 2026-07-31 11:45:33 江山别映剪辑 2026-09-07 11:02:21
协鑫能科:子公司拟出资1亿元认购基金份额-68420ae1
木村拓哉多高AI剪辑一分钟以上、有好几个镜头切换的长视频效果如何? 先说一个可能会让你意外的事实:现在市面上那些号称最先进的视频编辑模型,比如Seedance 2.0、Kling o3这些闭源顶流,一旦碰到超过一分钟、有多个镜头切换、还带着好几条编辑指令的长视频,表现会集体崩盘。不是效果差一点,是那种"改了半天连要改的东西都没改对"的崩盘。 这事听起来有点反直觉。毕竟这些模型在十几秒的单镜头短视频上已经很强了,加个滤镜、换个衣服颜色,毫无压力。可一旦视频变长、镜头一多,事情就完全不一样了。南开大学和腾讯的一个研究团队把这个问题系统地摆了出来,还专门造了一个新词来描述它:多指令多镜头长视频编辑,英文缩写MMLVE。 这篇论文做的事情,说白了就是回答一个问题:为什么现有的AI编辑不了长视频,以及怎么才能编辑好。 想象你有一段一分钟的视频,里面出现了三个镜头:第一个镜头是个老工匠在做手工艺品,第二个镜头是一个骷髅模型摆在桌上,第三个镜头是个士兵走过。你给AI下了三条指令:把老工匠的蓝衬衫换成红衬衫,给骷髅戴个海盗帽,把那个士兵从视频里删掉。 现在最常见的处理方式是什么?把这一分钟视频切成四段十五秒的小片段,然后把这三条指令原封不动地扔给每一段去执行。 骷髅模型可能只出现在第二段里,但AI editor拿到"给骷髅戴帽子"这条指令后,如果第一段视频根本没有骷髅,它很可能会凭空生成一个骷髅出来,然后给它戴帽子。这就是论文里说的编辑幻觉问题:本来不该出现的东西,因为指令的存在被硬凑出来了。 如果你在家里请人装修,只跟一个瓦工说"把厨房的墙刷成蓝色",结果这个瓦工听完转头把客厅、卧室、阳台的墙全刷成了蓝色,因为他没搞清楚这句话只适用于厨房这一个空间。这就是当前AI编辑模型犯的错,它们没有能力去判断一条指令只该在某个特定的镜头里生效,而是把所有指令一股脑地套用到所有片段上,结果哪里都出问题。 除了幻觉问题,还有另外两个更棘手的麻烦。一个是跨镜头一致性问题:如果老工匠这个人物在第一个镜头出现,改了衣服颜色,那么等他在后面第三个镜头再次出现时,衣服颜色还是不是红色的?现有模型往往是把每个片段独立处理,压根不知道这两个片段里其实是同一个人,于是改到第三个片段时,又把衣服颜色改回原样了,或者干脆改成了完全不同的颜色。 另一个是时空结构破坏问题:这种"一刀切"的分段方式,很可能会把原本连续的镜头强行打乱顺序,或者破坏掉背景、摄像机运动这些本来不需要改动的东西,导致画面出现闪烁、跳帧,甚至剧情顺序都乱套了。 论文把这三个问题正式定义成了三个衡量标准。第一个叫**跨镜头编辑一致性**,简称CSEC,要求被编辑的实体在不同镜头里始终保持一致的外观。第二个叫**多指令解耦**,简称MID,要求多条指令互不干扰,各归各位,不能张冠李戴。第三个叫**时空结构零破坏**,简称ZDSS,要求没被要求改动的部分,包括背景和运动轨迹,一点都不能乱动。 这三个词听起来有点绕,其实归纳起来就一句话:改该改的,别的都别碰,改完了还要前后一致。 论文起的框架名字叫MMLVE-Agent,核心思路可以用一句话概括:从"盲目切块"转向"先思考镜头再动手"。 这套系统由大语言模型和视觉语言模型协同工作,构成一个多智能体架构。 大语言模型*:擅长理解和处理文字,比如把用户那段又长又复杂的中文指令拆解成一条条独立、清晰的编辑任务。 视觉语言模型*:能同时看懂图片和文字,比如判断视频某一帧里到底出现了哪个角色、这个角色符不符合用户描述的特征。 第一阶段叫指令与视频分析。系统先用一个叫PyDetect的工具做物理镜头检测,把长视频按真实的镜头切换点切开,而不是按固定的十五秒去硬切。这个区别很关键:按真实镜头切,才能保证一个完整的场景不会被砍成两半。同时,大语言模型负责把用户的复杂指令拆解成独立的编辑任务,明确每条指令该配哪个实体、该在哪个时间段生效。视觉语言模型则会给每个镜头提取关键帧,分析场景里都发生了什么。 第二阶段是这套系统里最巧妙的设计,叫全局记忆卡。 这个设计要解决的问题是跨镜头一致性。系统先在所有镜头里,用视觉语言模型去检索出现目标实体的关键帧,挑出置信度最高的六张拼成一张参考图,再用图像生成模型合成一张这个实体"原本长什么样"的标准照。接着按照用户的编辑指令,把这张标准照编辑成"改完之后长什么样"的样子。这两张照片一左一右拼在一起,就成了所谓的全局记忆卡,相当于给后续的视频编辑器一个统一的视觉参照物。 这就好比拍电影时的连续性检查员。片场里同一个演员今天穿蓝衬衫拍了一个镜头,三天后补拍另一个镜头时,如果没有人拿着照片提醒场务"上次这里衣服是这样系的,头发是这样梳的",补拍出来的画面很可能对不上。全局记忆卡干的正是这个活,它把"这个实体改之前和改之后分别长什么样"钉死在一张参考图上,不管后面视频编辑器处理多少个镜头,都拿同一张图对齐,不会出现"改到第三个镜头衣服颜色又变了"的情况。如果没有这张卡,每个镜头就是各编各的,互相不知道对方的存在,一致性根本无从谈起。 生成这张标准照的过程本身也不是一次成型,论文引入了一个叫**正负反馈编辑**的机制,简称P-NEF。 视觉语言模型会充当一个评估者的角色,检查生成的参考图是否真的匹配关键帧。如果不匹配,它不只是告诉生成模型"这里错了",同时还会告诉它"这里是对的,继续保持"。前者叫负向提示,后者叫正向提示。 为什么要专门加这个正向提示?论文里做了个很直观的对比实验。如果只用负向反馈,就是不断地告诉模型"别这样、别那样",随着重试次数增加,避免事项越堆越多,模型的注意力会不自觉地全部扑到这些"禁止清单"上,反而忘了原本已经改对的地方,结果是越改越乱,把本来正确的细节也改坏了。 这就像老师批改作文,如果只是不停地在错的地方画红圈,学生下一次写作文时脑子里全是"这里不能这样写、那里不能那样写",反而写不出流畅的内容,因为注意力全被负面清单占据了。如果同时告诉他"这一段写得好,继续保持这个风格",他才能在改正错误的同时不丢掉原本的优点。P-NEF的正向提示就是这个"表扬"的部分,它让模型在修正问题的同时,记住哪些地方已经做对了,不要动。 第三阶段是真正执行视频编辑的环节。这里用到一个叫**检索式按需编辑**的策略:对每个镜头,视觉语言模型会做三次投票判断,这个镜头里到底有没有出现目标实体。只有拿到至少两票"有",编辑操作才会真正触发;如果票数不够,这个镜头就原样保留,不做任何改动。 这个投票机制解决的正是开头提到的幻觉问题。如果没有这道检索关卡,"给骷髅戴帽子"这条指令就会不分场合地砸向每一个镜头,逼着模型在没有骷髅的画面里硬凑一个骷髅出来。有了这道关卡,系统会先确认"这个镜头里到底有没有骷髅",没有就跳过,绝不强行执行。 对确实需要编辑的镜头,系统会用一个叫HappyHorse的视频编辑模型来执行实际改动,同时再套用一层视频级别的P-NEF反馈循环,检查两件事:编辑任务是不是真的完成了,没被要求改动的背景和运动是不是原封不动地保留下来了。改完之后,把编辑过的镜头和跳过的原始镜头重新拼接起来,就是最终的成品视频。 光有方法不够,得有靶子可以打。研究团队专门造了一个评测数据集,叫MMLVE-Bench,从一个开源的视频理解数据集UniVA-Bench里精选了25个高质量的一分钟左右多镜头长视频,每段视频配上大约五条真实且复杂的编辑指令,先由AI生成候选指令,再由人工核查修正,确保逻辑通顺、描述准确。 评测标准也没有走传统路线。像CLIP分数、PSNR这类经典的图像质量打分方式,压根没有能力去理解"这条指令是不是套用到了错误的镜头"这种语义层面的问题,所以论文干脆用视觉语言模型本身来当裁判,针对CSEC、MID、ZDSS这三个核心指标,每个又细分成五个子维度,每个子维度按0、10、20三档打分,满分一百。 | 方法 | CSEC | MID | ZDSS | 平均分 | | Seedance 2.0 | 77.58 | 78.58 | **82.25** | 79.47 | | Kling o3 | 70.00 | 72.57 | 69.13 | 70.57 | | HappyHorse 1.0 | 74.68 | 67.28 | 66.88 | 69.61 | | MMLVE-Agent(本文方法) | **84.80** | **79.04** | 81.68 | **81.84** | 有个细节很有意思。Seedance 2.0在ZDSS这一项拿了最高分,但这并不代表它做得最好,而是因为它在面对复杂场景时会采取一种保守策略,遇到难改的指令直接放弃不改,这样自然不会破坏画面结构,但代价是大量指令根本没被执行,CSEC和MID的分数因此偏低。MMLVE-Agent则是老老实实把该改的都改了,ZDSS分数略有下降,但换来的是全面且真实的编辑执行。 论文还专门找了9名有视频生成和视觉内容评估经验的专家做人工评测,每人随机分到5个案例进行盲测排序。结果MMLVE-Agent在75.6%的案例中排名第一,在93.3%的案例中排进前二,平均排名1.36,远超其他三个基线方法的2.63到3.16。和Seedance 2.0、Kling o3、HappyHorse三个方法两两对比时,胜率分别达到88.4%、80.5%和93.3%,统计检验也确认了这个差距不是偶然。 论文里还有个很生动的对比案例。同一段视频要求把一个时钟的形状改成方形、颜色改成红色,同时删掉一个坐在椅子上的年轻男子,再给骷髅模型戴上棒球帽。Seedance 2.0成功改了时钟颜色但没改形状,完全没删掉那个男子,也漏掉了给骷髅戴帽子这个操作。Kling o3更离谱,时钟形状忽变忽不变,还把那个本该被删除的男子错误地"移植"到了另一个完全不相关的镜头里。HappyHorse 1.0则是把时钟给一起删了,后面几个镜头的顺序还整个乱套了。只有MMLVE-Agent把三条指令都在各自对应的镜头里精准落地,没有波及不该动的地方。 读完这篇论文,有个细节让我一直在想:为什么这些顶级闭源模型在短视频上表现那么好,一到长视频就集体失灵?答案其实藏在论文对Seedance 2.0"保守策略"的描述里。这类模型面对复杂指令时会本能地选择少做、不做,宁可漏改也不乱改,这其实暴露了一个更深的问题:这些模型压根没有"理解视频结构"这一层能力,它们只是在按帧或者按固定时长处理画面,根本不知道镜头和镜头之间存在着叙事上的连续性。 这让我联想到早期机器翻译的困境。逐词翻译永远翻不出通顺的句子,因为语言的意义是建立在上下文和篇章结构上的,不是孤立的词能承载的。视频编辑现在正处在类似的阶段,如果模型不理解"这是一个镜头,那是另一个镜头,它们讲的是同一件事的不同片段",就永远只能在局部打转,做不出真正连贯的长视频编辑。 论文里那个正负反馈机制的设计也值得多想一层。它其实揭示了一个更普遍的现象:单纯的负反馈会让系统陷入局部震荡,不断修正一个错误的同时制造新的错误。这个现象在很多需要迭代优化的系统里都能看到,不只是AI视频编辑。 这篇论文没有回答的问题是,当视频长度继续增加,比如到十分钟、一小时,镜头数量成倍增长时,这套基于检索和投票的机制还能不能撑住。毕竟现在的测试集只是一分钟左右的视频,投票和检索的计算成本会不会随着镜头数量线性甚至更快地增长,这个问题留在了论文之外。 A:MMLVE指的是多指令多镜头长视频编辑任务,要求AI在处理一分钟以上、包含多个镜头切换的长视频时,同时执行多条不同类型的编辑指令,还要保证跨镜头一致性、指令互不干扰、不破坏原有画面结构。 Q2:MMLVE-Agent和现有视频编辑模型比有什么不同? A:现有模型比如Seedance 2.0大多采用固定时长切块的方式处理长视频,容易产生编辑幻觉和身份不一致问题。MMLVE-Agent通过物理镜头检测、全局记忆卡和正负反馈机制,先理解视频结构再针对性编辑,避免了盲目切块带来的各种问题。 Q3:全局记忆卡是怎么保证跨镜头一致性的? A:全局记忆卡是一张"改前改后"对比图,系统先从所有镜头里检索出目标实体的关键帧生成标准参考图,再按指令编辑出改后的样子,后续所有镜头的编辑都参照这张卡进行,从而保证同一实体在不同镜头里外观统一。 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 智东西 2026-09-08 18:00:16 新智元 2026-09-08 18:53:52 新智元 2026-09-08 18:55:04 钛媒体APP 2026-06-01 17:24:30 量子位 2026-08-06 20:00:27 量子位 2026-06-07 04:37:43 DeepTech深科技 2026-09-08 19:16:32 虎嗅APP 2026-09-08 19:14:12 量子位 2026-04-23 11:44:18 淡然综艺 2026-09-05 16:07:13 泠泠说史 2026-09-06 12:58:54 码上闲叙 2026-09-08 15:33:13 菠萝唠生活 2026-09-07 03:48:03 王衜晓 2026-09-08 06:19:12 弱电大林 2026-09-06 05:21:06 鹿鲨Sakana 2026-09-08 03:40:11 栗飞沉 2026-09-08 06:09:41 名岂文章著 2026-09-08 18:51:40 极目新闻 2026-09-08 09:05:24 扬子晚报 2026-09-07 22:11:30 倔强旳牵强 2026-09-06 03:48:04 白小兔手工 2026-09-08 01:27:59 新浪财经 2026-09-08 19:55:19 大小关物语 2026-09-04 05:04:51 科技视讯 2026-09-08 17:56:20 IT之家 2026-09-04 15:29:10 泡泡网 2026-09-08 11:19:20 都市快报橙柿互动 2026-09-08 13:29:54 钛媒体APP 2026-09-08 10:18:07 色影无忌 2026-09-08 19:05:48 游民星空 2026-09-08 17:30:45 蚌埠日报 2026-09-05 04:33:34 凉爽追剧 2026-09-06 22:19:06 孤城落日 2026-09-08 02:17:25 量子位 2026-06-17 18:36:08 科技视讯 2026-09-08 18:33:59 村里整活小分队 2026-09-08 00:58:53 村里整活小分队 2026-09-07 01:11:19 装甲铲史官 2026-07-31 11:45:33 江山别映剪辑 2026-09-07 11:02:21
AI剪辑一分钟以上、有好几个镜头切换的长视频效果如何? 先说一个可能会让你意外的事实:现在市面上那些号称最先进的视频编辑模型,比如Seedance 2.0、Kling o3这些闭源顶流,一旦碰到超过一分钟、有多个镜头切换、还带着好几条编辑指令的长视频,表现会集体崩盘。不是效果差一点,是那种"改了半天连要改的东西都没改对"的崩盘。 这事听起来有点反直觉。毕竟这些模型在十几秒的单镜头短视频上已经很强了,加个滤镜、换个衣服颜色,毫无压力。可一旦视频变长、镜头一多,事情就完全不一样了。南开大学和腾讯的一个研究团队把这个问题系统地摆了出来,还专门造了一个新词来描述它:多指令多镜头长视频编辑,英文缩写MMLVE。 这篇论文做的事情,说白了就是回答一个问题:为什么现有的AI编辑不了长视频,以及怎么才能编辑好。 想象你有一段一分钟的视频,里面出现了三个镜头:第一个镜头是个老工匠在做手工艺品,第二个镜头是一个骷髅模型摆在桌上,第三个镜头是个士兵走过。你给AI下了三条指令:把老工匠的蓝衬衫换成红衬衫,给骷髅戴个海盗帽,把那个士兵从视频里删掉。 现在最常见的处理方式是什么?把这一分钟视频切成四段十五秒的小片段,然后把这三条指令原封不动地扔给每一段去执行。 骷髅模型可能只出现在第二段里,但AI editor拿到"给骷髅戴帽子"这条指令后,如果第一段视频根本没有骷髅,它很可能会凭空生成一个骷髅出来,然后给它戴帽子。这就是论文里说的编辑幻觉问题:本来不该出现的东西,因为指令的存在被硬凑出来了。 如果你在家里请人装修,只跟一个瓦工说"把厨房的墙刷成蓝色",结果这个瓦工听完转头把客厅、卧室、阳台的墙全刷成了蓝色,因为他没搞清楚这句话只适用于厨房这一个空间。这就是当前AI编辑模型犯的错,它们没有能力去判断一条指令只该在某个特定的镜头里生效,而是把所有指令一股脑地套用到所有片段上,结果哪里都出问题。 除了幻觉问题,还有另外两个更棘手的麻烦。一个是跨镜头一致性问题:如果老工匠这个人物在第一个镜头出现,改了衣服颜色,那么等他在后面第三个镜头再次出现时,衣服颜色还是不是红色的?现有模型往往是把每个片段独立处理,压根不知道这两个片段里其实是同一个人,于是改到第三个片段时,又把衣服颜色改回原样了,或者干脆改成了完全不同的颜色。 另一个是时空结构破坏问题:这种"一刀切"的分段方式,很可能会把原本连续的镜头强行打乱顺序,或者破坏掉背景、摄像机运动这些本来不需要改动的东西,导致画面出现闪烁、跳帧,甚至剧情顺序都乱套了。 论文把这三个问题正式定义成了三个衡量标准。第一个叫**跨镜头编辑一致性**,简称CSEC,要求被编辑的实体在不同镜头里始终保持一致的外观。第二个叫**多指令解耦**,简称MID,要求多条指令互不干扰,各归各位,不能张冠李戴。第三个叫**时空结构零破坏**,简称ZDSS,要求没被要求改动的部分,包括背景和运动轨迹,一点都不能乱动。 这三个词听起来有点绕,其实归纳起来就一句话:改该改的,别的都别碰,改完了还要前后一致。 论文起的框架名字叫MMLVE-Agent,核心思路可以用一句话概括:从"盲目切块"转向"先思考镜头再动手"。 这套系统由大语言模型和视觉语言模型协同工作,构成一个多智能体架构。 大语言模型*:擅长理解和处理文字,比如把用户那段又长又复杂的中文指令拆解成一条条独立、清晰的编辑任务。 视觉语言模型*:能同时看懂图片和文字,比如判断视频某一帧里到底出现了哪个角色、这个角色符不符合用户描述的特征。 第一阶段叫指令与视频分析。系统先用一个叫PyDetect的工具做物理镜头检测,把长视频按真实的镜头切换点切开,而不是按固定的十五秒去硬切。这个区别很关键:按真实镜头切,才能保证一个完整的场景不会被砍成两半。同时,大语言模型负责把用户的复杂指令拆解成独立的编辑任务,明确每条指令该配哪个实体、该在哪个时间段生效。视觉语言模型则会给每个镜头提取关键帧,分析场景里都发生了什么。 第二阶段是这套系统里最巧妙的设计,叫全局记忆卡。 这个设计要解决的问题是跨镜头一致性。系统先在所有镜头里,用视觉语言模型去检索出现目标实体的关键帧,挑出置信度最高的六张拼成一张参考图,再用图像生成模型合成一张这个实体"原本长什么样"的标准照。接着按照用户的编辑指令,把这张标准照编辑成"改完之后长什么样"的样子。这两张照片一左一右拼在一起,就成了所谓的全局记忆卡,相当于给后续的视频编辑器一个统一的视觉参照物。 这就好比拍电影时的连续性检查员。片场里同一个演员今天穿蓝衬衫拍了一个镜头,三天后补拍另一个镜头时,如果没有人拿着照片提醒场务"上次这里衣服是这样系的,头发是这样梳的",补拍出来的画面很可能对不上。全局记忆卡干的正是这个活,它把"这个实体改之前和改之后分别长什么样"钉死在一张参考图上,不管后面视频编辑器处理多少个镜头,都拿同一张图对齐,不会出现"改到第三个镜头衣服颜色又变了"的情况。如果没有这张卡,每个镜头就是各编各的,互相不知道对方的存在,一致性根本无从谈起。 生成这张标准照的过程本身也不是一次成型,论文引入了一个叫**正负反馈编辑**的机制,简称P-NEF。 视觉语言模型会充当一个评估者的角色,检查生成的参考图是否真的匹配关键帧。如果不匹配,它不只是告诉生成模型"这里错了",同时还会告诉它"这里是对的,继续保持"。前者叫负向提示,后者叫正向提示。 为什么要专门加这个正向提示?论文里做了个很直观的对比实验。如果只用负向反馈,就是不断地告诉模型"别这样、别那样",随着重试次数增加,避免事项越堆越多,模型的注意力会不自觉地全部扑到这些"禁止清单"上,反而忘了原本已经改对的地方,结果是越改越乱,把本来正确的细节也改坏了。 这就像老师批改作文,如果只是不停地在错的地方画红圈,学生下一次写作文时脑子里全是"这里不能这样写、那里不能那样写",反而写不出流畅的内容,因为注意力全被负面清单占据了。如果同时告诉他"这一段写得好,继续保持这个风格",他才能在改正错误的同时不丢掉原本的优点。P-NEF的正向提示就是这个"表扬"的部分,它让模型在修正问题的同时,记住哪些地方已经做对了,不要动。 第三阶段是真正执行视频编辑的环节。这里用到一个叫**检索式按需编辑**的策略:对每个镜头,视觉语言模型会做三次投票判断,这个镜头里到底有没有出现目标实体。只有拿到至少两票"有",编辑操作才会真正触发;如果票数不够,这个镜头就原样保留,不做任何改动。 这个投票机制解决的正是开头提到的幻觉问题。如果没有这道检索关卡,"给骷髅戴帽子"这条指令就会不分场合地砸向每一个镜头,逼着模型在没有骷髅的画面里硬凑一个骷髅出来。有了这道关卡,系统会先确认"这个镜头里到底有没有骷髅",没有就跳过,绝不强行执行。 对确实需要编辑的镜头,系统会用一个叫HappyHorse的视频编辑模型来执行实际改动,同时再套用一层视频级别的P-NEF反馈循环,检查两件事:编辑任务是不是真的完成了,没被要求改动的背景和运动是不是原封不动地保留下来了。改完之后,把编辑过的镜头和跳过的原始镜头重新拼接起来,就是最终的成品视频。 光有方法不够,得有靶子可以打。研究团队专门造了一个评测数据集,叫MMLVE-Bench,从一个开源的视频理解数据集UniVA-Bench里精选了25个高质量的一分钟左右多镜头长视频,每段视频配上大约五条真实且复杂的编辑指令,先由AI生成候选指令,再由人工核查修正,确保逻辑通顺、描述准确。 评测标准也没有走传统路线。像CLIP分数、PSNR这类经典的图像质量打分方式,压根没有能力去理解"这条指令是不是套用到了错误的镜头"这种语义层面的问题,所以论文干脆用视觉语言模型本身来当裁判,针对CSEC、MID、ZDSS这三个核心指标,每个又细分成五个子维度,每个子维度按0、10、20三档打分,满分一百。 | 方法 | CSEC | MID | ZDSS | 平均分 | | Seedance 2.0 | 77.58 | 78.58 | **82.25** | 79.47 | | Kling o3 | 70.00 | 72.57 | 69.13 | 70.57 | | HappyHorse 1.0 | 74.68 | 67.28 | 66.88 | 69.61 | | MMLVE-Agent(本文方法) | **84.80** | **79.04** | 81.68 | **81.84** | 有个细节很有意思。Seedance 2.0在ZDSS这一项拿了最高分,但这并不代表它做得最好,而是因为它在面对复杂场景时会采取一种保守策略,遇到难改的指令直接放弃不改,这样自然不会破坏画面结构,但代价是大量指令根本没被执行,CSEC和MID的分数因此偏低。MMLVE-Agent则是老老实实把该改的都改了,ZDSS分数略有下降,但换来的是全面且真实的编辑执行。 论文还专门找了9名有视频生成和视觉内容评估经验的专家做人工评测,每人随机分到5个案例进行盲测排序。结果MMLVE-Agent在75.6%的案例中排名第一,在93.3%的案例中排进前二,平均排名1.36,远超其他三个基线方法的2.63到3.16。和Seedance 2.0、Kling o3、HappyHorse三个方法两两对比时,胜率分别达到88.4%、80.5%和93.3%,统计检验也确认了这个差距不是偶然。 论文里还有个很生动的对比案例。同一段视频要求把一个时钟的形状改成方形、颜色改成红色,同时删掉一个坐在椅子上的年轻男子,再给骷髅模型戴上棒球帽。Seedance 2.0成功改了时钟颜色但没改形状,完全没删掉那个男子,也漏掉了给骷髅戴帽子这个操作。Kling o3更离谱,时钟形状忽变忽不变,还把那个本该被删除的男子错误地"移植"到了另一个完全不相关的镜头里。HappyHorse 1.0则是把时钟给一起删了,后面几个镜头的顺序还整个乱套了。只有MMLVE-Agent把三条指令都在各自对应的镜头里精准落地,没有波及不该动的地方。 读完这篇论文,有个细节让我一直在想:为什么这些顶级闭源模型在短视频上表现那么好,一到长视频就集体失灵?答案其实藏在论文对Seedance 2.0"保守策略"的描述里。这类模型面对复杂指令时会本能地选择少做、不做,宁可漏改也不乱改,这其实暴露了一个更深的问题:这些模型压根没有"理解视频结构"这一层能力,它们只是在按帧或者按固定时长处理画面,根本不知道镜头和镜头之间存在着叙事上的连续性。 这让我联想到早期机器翻译的困境。逐词翻译永远翻不出通顺的句子,因为语言的意义是建立在上下文和篇章结构上的,不是孤立的词能承载的。视频编辑现在正处在类似的阶段,如果模型不理解"这是一个镜头,那是另一个镜头,它们讲的是同一件事的不同片段",就永远只能在局部打转,做不出真正连贯的长视频编辑。 论文里那个正负反馈机制的设计也值得多想一层。它其实揭示了一个更普遍的现象:单纯的负反馈会让系统陷入局部震荡,不断修正一个错误的同时制造新的错误。这个现象在很多需要迭代优化的系统里都能看到,不只是AI视频编辑。 这篇论文没有回答的问题是,当视频长度继续增加,比如到十分钟、一小时,镜头数量成倍增长时,这套基于检索和投票的机制还能不能撑住。毕竟现在的测试集只是一分钟左右的视频,投票和检索的计算成本会不会随着镜头数量线性甚至更快地增长,这个问题留在了论文之外。 A:MMLVE指的是多指令多镜头长视频编辑任务,要求AI在处理一分钟以上、包含多个镜头切换的长视频时,同时执行多条不同类型的编辑指令,还要保证跨镜头一致性、指令互不干扰、不破坏原有画面结构。 Q2:MMLVE-Agent和现有视频编辑模型比有什么不同? A:现有模型比如Seedance 2.0大多采用固定时长切块的方式处理长视频,容易产生编辑幻觉和身份不一致问题。MMLVE-Agent通过物理镜头检测、全局记忆卡和正负反馈机制,先理解视频结构再针对性编辑,避免了盲目切块带来的各种问题。 Q3:全局记忆卡是怎么保证跨镜头一致性的? A:全局记忆卡是一张"改前改后"对比图,系统先从所有镜头里检索出目标实体的关键帧生成标准参考图,再按指令编辑出改后的样子,后续所有镜头的编辑都参照这张卡进行,从而保证同一实体在不同镜头里外观统一。 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 智东西 2026-09-08 18:00:16 新智元 2026-09-08 18:53:52 新智元 2026-09-08 18:55:04 钛媒体APP 2026-06-01 17:24:30 量子位 2026-08-06 20:00:27 量子位 2026-06-07 04:37:43 DeepTech深科技 2026-09-08 19:16:32 虎嗅APP 2026-09-08 19:14:12 量子位 2026-04-23 11:44:18 淡然综艺 2026-09-05 16:07:13 泠泠说史 2026-09-06 12:58:54 码上闲叙 2026-09-08 15:33:13 菠萝唠生活 2026-09-07 03:48:03 王衜晓 2026-09-08 06:19:12 弱电大林 2026-09-06 05:21:06 鹿鲨Sakana 2026-09-08 03:40:11 栗飞沉 2026-09-08 06:09:41 名岂文章著 2026-09-08 18:51:40 极目新闻 2026-09-08 09:05:24 扬子晚报 2026-09-07 22:11:30 倔强旳牵强 2026-09-06 03:48:04 白小兔手工 2026-09-08 01:27:59 新浪财经 2026-09-08 19:55:19 大小关物语 2026-09-04 05:04:51 科技视讯 2026-09-08 17:56:20 IT之家 2026-09-04 15:29:10 泡泡网 2026-09-08 11:19:20 都市快报橙柿互动 2026-09-08 13:29:54 钛媒体APP 2026-09-08 10:18:07 色影无忌 2026-09-08 19:05:48 游民星空 2026-09-08 17:30:45 蚌埠日报 2026-09-05 04:33:34 凉爽追剧 2026-09-06 22:19:06 孤城落日 2026-09-08 02:17:25 量子位 2026-06-17 18:36:08 科技视讯 2026-09-08 18:33:59 村里整活小分队 2026-09-08 00:58:53 村里整活小分队 2026-09-07 01:11:19 装甲铲史官 2026-07-31 11:45:33 江山别映剪辑 2026-09-07 11:02:21
AI剪辑一分钟以上、有好几个镜头切换的长视频效果如何? 先说一个可能会让你意外的事实:现在市面上那些号称最先进的视频编辑模型,比如Seedance 2.0、Kling o3这些闭源顶流,一旦碰到超过一分钟、有多个镜头切换、还带着好几条编辑指令的长视频,表现会集体崩盘。不是效果差一点,是那种"改了半天连要改的东西都没改对"的崩盘。 这事听起来有点反直觉。毕竟这些模型在十几秒的单镜头短视频上已经很强了,加个滤镜、换个衣服颜色,毫无压力。可一旦视频变长、镜头一多,事情就完全不一样了。南开大学和腾讯的一个研究团队把这个问题系统地摆了出来,还专门造了一个新词来描述它:多指令多镜头长视频编辑,英文缩写MMLVE。 这篇论文做的事情,说白了就是回答一个问题:为什么现有的AI编辑不了长视频,以及怎么才能编辑好。 想象你有一段一分钟的视频,里面出现了三个镜头:第一个镜头是个老工匠在做手工艺品,第二个镜头是一个骷髅模型摆在桌上,第三个镜头是个士兵走过。你给AI下了三条指令:把老工匠的蓝衬衫换成红衬衫,给骷髅戴个海盗帽,把那个士兵从视频里删掉。 现在最常见的处理方式是什么?把这一分钟视频切成四段十五秒的小片段,然后把这三条指令原封不动地扔给每一段去执行。 骷髅模型可能只出现在第二段里,但AI editor拿到"给骷髅戴帽子"这条指令后,如果第一段视频根本没有骷髅,它很可能会凭空生成一个骷髅出来,然后给它戴帽子。这就是论文里说的编辑幻觉问题:本来不该出现的东西,因为指令的存在被硬凑出来了。 如果你在家里请人装修,只跟一个瓦工说"把厨房的墙刷成蓝色",结果这个瓦工听完转头把客厅、卧室、阳台的墙全刷成了蓝色,因为他没搞清楚这句话只适用于厨房这一个空间。这就是当前AI编辑模型犯的错,它们没有能力去判断一条指令只该在某个特定的镜头里生效,而是把所有指令一股脑地套用到所有片段上,结果哪里都出问题。 除了幻觉问题,还有另外两个更棘手的麻烦。一个是跨镜头一致性问题:如果老工匠这个人物在第一个镜头出现,改了衣服颜色,那么等他在后面第三个镜头再次出现时,衣服颜色还是不是红色的?现有模型往往是把每个片段独立处理,压根不知道这两个片段里其实是同一个人,于是改到第三个片段时,又把衣服颜色改回原样了,或者干脆改成了完全不同的颜色。 另一个是时空结构破坏问题:这种"一刀切"的分段方式,很可能会把原本连续的镜头强行打乱顺序,或者破坏掉背景、摄像机运动这些本来不需要改动的东西,导致画面出现闪烁、跳帧,甚至剧情顺序都乱套了。 论文把这三个问题正式定义成了三个衡量标准。第一个叫**跨镜头编辑一致性**,简称CSEC,要求被编辑的实体在不同镜头里始终保持一致的外观。第二个叫**多指令解耦**,简称MID,要求多条指令互不干扰,各归各位,不能张冠李戴。第三个叫**时空结构零破坏**,简称ZDSS,要求没被要求改动的部分,包括背景和运动轨迹,一点都不能乱动。 这三个词听起来有点绕,其实归纳起来就一句话:改该改的,别的都别碰,改完了还要前后一致。 论文起的框架名字叫MMLVE-Agent,核心思路可以用一句话概括:从"盲目切块"转向"先思考镜头再动手"。 这套系统由大语言模型和视觉语言模型协同工作,构成一个多智能体架构。 大语言模型*:擅长理解和处理文字,比如把用户那段又长又复杂的中文指令拆解成一条条独立、清晰的编辑任务。 视觉语言模型*:能同时看懂图片和文字,比如判断视频某一帧里到底出现了哪个角色、这个角色符不符合用户描述的特征。 第一阶段叫指令与视频分析。系统先用一个叫PyDetect的工具做物理镜头检测,把长视频按真实的镜头切换点切开,而不是按固定的十五秒去硬切。这个区别很关键:按真实镜头切,才能保证一个完整的场景不会被砍成两半。同时,大语言模型负责把用户的复杂指令拆解成独立的编辑任务,明确每条指令该配哪个实体、该在哪个时间段生效。视觉语言模型则会给每个镜头提取关键帧,分析场景里都发生了什么。 第二阶段是这套系统里最巧妙的设计,叫全局记忆卡。 这个设计要解决的问题是跨镜头一致性。系统先在所有镜头里,用视觉语言模型去检索出现目标实体的关键帧,挑出置信度最高的六张拼成一张参考图,再用图像生成模型合成一张这个实体"原本长什么样"的标准照。接着按照用户的编辑指令,把这张标准照编辑成"改完之后长什么样"的样子。这两张照片一左一右拼在一起,就成了所谓的全局记忆卡,相当于给后续的视频编辑器一个统一的视觉参照物。 这就好比拍电影时的连续性检查员。片场里同一个演员今天穿蓝衬衫拍了一个镜头,三天后补拍另一个镜头时,如果没有人拿着照片提醒场务"上次这里衣服是这样系的,头发是这样梳的",补拍出来的画面很可能对不上。全局记忆卡干的正是这个活,它把"这个实体改之前和改之后分别长什么样"钉死在一张参考图上,不管后面视频编辑器处理多少个镜头,都拿同一张图对齐,不会出现"改到第三个镜头衣服颜色又变了"的情况。如果没有这张卡,每个镜头就是各编各的,互相不知道对方的存在,一致性根本无从谈起。 生成这张标准照的过程本身也不是一次成型,论文引入了一个叫**正负反馈编辑**的机制,简称P-NEF。 视觉语言模型会充当一个评估者的角色,检查生成的参考图是否真的匹配关键帧。如果不匹配,它不只是告诉生成模型"这里错了",同时还会告诉它"这里是对的,继续保持"。前者叫负向提示,后者叫正向提示。 为什么要专门加这个正向提示?论文里做了个很直观的对比实验。如果只用负向反馈,就是不断地告诉模型"别这样、别那样",随着重试次数增加,避免事项越堆越多,模型的注意力会不自觉地全部扑到这些"禁止清单"上,反而忘了原本已经改对的地方,结果是越改越乱,把本来正确的细节也改坏了。 这就像老师批改作文,如果只是不停地在错的地方画红圈,学生下一次写作文时脑子里全是"这里不能这样写、那里不能那样写",反而写不出流畅的内容,因为注意力全被负面清单占据了。如果同时告诉他"这一段写得好,继续保持这个风格",他才能在改正错误的同时不丢掉原本的优点。P-NEF的正向提示就是这个"表扬"的部分,它让模型在修正问题的同时,记住哪些地方已经做对了,不要动。 第三阶段是真正执行视频编辑的环节。这里用到一个叫**检索式按需编辑**的策略:对每个镜头,视觉语言模型会做三次投票判断,这个镜头里到底有没有出现目标实体。只有拿到至少两票"有",编辑操作才会真正触发;如果票数不够,这个镜头就原样保留,不做任何改动。 这个投票机制解决的正是开头提到的幻觉问题。如果没有这道检索关卡,"给骷髅戴帽子"这条指令就会不分场合地砸向每一个镜头,逼着模型在没有骷髅的画面里硬凑一个骷髅出来。有了这道关卡,系统会先确认"这个镜头里到底有没有骷髅",没有就跳过,绝不强行执行。 对确实需要编辑的镜头,系统会用一个叫HappyHorse的视频编辑模型来执行实际改动,同时再套用一层视频级别的P-NEF反馈循环,检查两件事:编辑任务是不是真的完成了,没被要求改动的背景和运动是不是原封不动地保留下来了。改完之后,把编辑过的镜头和跳过的原始镜头重新拼接起来,就是最终的成品视频。 光有方法不够,得有靶子可以打。研究团队专门造了一个评测数据集,叫MMLVE-Bench,从一个开源的视频理解数据集UniVA-Bench里精选了25个高质量的一分钟左右多镜头长视频,每段视频配上大约五条真实且复杂的编辑指令,先由AI生成候选指令,再由人工核查修正,确保逻辑通顺、描述准确。 评测标准也没有走传统路线。像CLIP分数、PSNR这类经典的图像质量打分方式,压根没有能力去理解"这条指令是不是套用到了错误的镜头"这种语义层面的问题,所以论文干脆用视觉语言模型本身来当裁判,针对CSEC、MID、ZDSS这三个核心指标,每个又细分成五个子维度,每个子维度按0、10、20三档打分,满分一百。 | 方法 | CSEC | MID | ZDSS | 平均分 | | Seedance 2.0 | 77.58 | 78.58 | **82.25** | 79.47 | | Kling o3 | 70.00 | 72.57 | 69.13 | 70.57 | | HappyHorse 1.0 | 74.68 | 67.28 | 66.88 | 69.61 | | MMLVE-Agent(本文方法) | **84.80** | **79.04** | 81.68 | **81.84** | 有个细节很有意思。Seedance 2.0在ZDSS这一项拿了最高分,但这并不代表它做得最好,而是因为它在面对复杂场景时会采取一种保守策略,遇到难改的指令直接放弃不改,这样自然不会破坏画面结构,但代价是大量指令根本没被执行,CSEC和MID的分数因此偏低。MMLVE-Agent则是老老实实把该改的都改了,ZDSS分数略有下降,但换来的是全面且真实的编辑执行。 论文还专门找了9名有视频生成和视觉内容评估经验的专家做人工评测,每人随机分到5个案例进行盲测排序。结果MMLVE-Agent在75.6%的案例中排名第一,在93.3%的案例中排进前二,平均排名1.36,远超其他三个基线方法的2.63到3.16。和Seedance 2.0、Kling o3、HappyHorse三个方法两两对比时,胜率分别达到88.4%、80.5%和93.3%,统计检验也确认了这个差距不是偶然。 论文里还有个很生动的对比案例。同一段视频要求把一个时钟的形状改成方形、颜色改成红色,同时删掉一个坐在椅子上的年轻男子,再给骷髅模型戴上棒球帽。Seedance 2.0成功改了时钟颜色但没改形状,完全没删掉那个男子,也漏掉了给骷髅戴帽子这个操作。Kling o3更离谱,时钟形状忽变忽不变,还把那个本该被删除的男子错误地"移植"到了另一个完全不相关的镜头里。HappyHorse 1.0则是把时钟给一起删了,后面几个镜头的顺序还整个乱套了。只有MMLVE-Agent把三条指令都在各自对应的镜头里精准落地,没有波及不该动的地方。 读完这篇论文,有个细节让我一直在想:为什么这些顶级闭源模型在短视频上表现那么好,一到长视频就集体失灵?答案其实藏在论文对Seedance 2.0"保守策略"的描述里。这类模型面对复杂指令时会本能地选择少做、不做,宁可漏改也不乱改,这其实暴露了一个更深的问题:这些模型压根没有"理解视频结构"这一层能力,它们只是在按帧或者按固定时长处理画面,根本不知道镜头和镜头之间存在着叙事上的连续性。 这让我联想到早期机器翻译的困境。逐词翻译永远翻不出通顺的句子,因为语言的意义是建立在上下文和篇章结构上的,不是孤立的词能承载的。视频编辑现在正处在类似的阶段,如果模型不理解"这是一个镜头,那是另一个镜头,它们讲的是同一件事的不同片段",就永远只能在局部打转,做不出真正连贯的长视频编辑。 论文里那个正负反馈机制的设计也值得多想一层。它其实揭示了一个更普遍的现象:单纯的负反馈会让系统陷入局部震荡,不断修正一个错误的同时制造新的错误。这个现象在很多需要迭代优化的系统里都能看到,不只是AI视频编辑。 这篇论文没有回答的问题是,当视频长度继续增加,比如到十分钟、一小时,镜头数量成倍增长时,这套基于检索和投票的机制还能不能撑住。毕竟现在的测试集只是一分钟左右的视频,投票和检索的计算成本会不会随着镜头数量线性甚至更快地增长,这个问题留在了论文之外。 A:MMLVE指的是多指令多镜头长视频编辑任务,要求AI在处理一分钟以上、包含多个镜头切换的长视频时,同时执行多条不同类型的编辑指令,还要保证跨镜头一致性、指令互不干扰、不破坏原有画面结构。 Q2:MMLVE-Agent和现有视频编辑模型比有什么不同? A:现有模型比如Seedance 2.0大多采用固定时长切块的方式处理长视频,容易产生编辑幻觉和身份不一致问题。MMLVE-Agent通过物理镜头检测、全局记忆卡和正负反馈机制,先理解视频结构再针对性编辑,避免了盲目切块带来的各种问题。 Q3:全局记忆卡是怎么保证跨镜头一致性的? A:全局记忆卡是一张"改前改后"对比图,系统先从所有镜头里检索出目标实体的关键帧生成标准参考图,再按指令编辑出改后的样子,后续所有镜头的编辑都参照这张卡进行,从而保证同一实体在不同镜头里外观统一。 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 智东西 2026-09-08 18:00:16 新智元 2026-09-08 18:53:52 新智元 2026-09-08 18:55:04 钛媒体APP 2026-06-01 17:24:30 量子位 2026-08-06 20:00:27 量子位 2026-06-07 04:37:43 DeepTech深科技 2026-09-08 19:16:32 虎嗅APP 2026-09-08 19:14:12 量子位 2026-04-23 11:44:18 淡然综艺 2026-09-05 16:07:13 泠泠说史 2026-09-06 12:58:54 码上闲叙 2026-09-08 15:33:13 菠萝唠生活 2026-09-07 03:48:03 王衜晓 2026-09-08 06:19:12 弱电大林 2026-09-06 05:21:06 鹿鲨Sakana 2026-09-08 03:40:11 栗飞沉 2026-09-08 06:09:41 名岂文章著 2026-09-08 18:51:40 极目新闻 2026-09-08 09:05:24 扬子晚报 2026-09-07 22:11:30 倔强旳牵强 2026-09-06 03:48:04 白小兔手工 2026-09-08 01:27:59 新浪财经 2026-09-08 19:55:19 大小关物语 2026-09-04 05:04:51 科技视讯 2026-09-08 17:56:20 IT之家 2026-09-04 15:29:10 泡泡网 2026-09-08 11:19:20 都市快报橙柿互动 2026-09-08 13:29:54 钛媒体APP 2026-09-08 10:18:07 色影无忌 2026-09-08 19:05:48 游民星空 2026-09-08 17:30:45 蚌埠日报 2026-09-05 04:33:34 凉爽追剧 2026-09-06 22:19:06 孤城落日 2026-09-08 02:17:25 量子位 2026-06-17 18:36:08 科技视讯 2026-09-08 18:33:59 村里整活小分队 2026-09-08 00:58:53 村里整活小分队 2026-09-07 01:11:19 装甲铲史官 2026-07-31 11:45:33 江山别映剪辑 2026-09-07 11:02:21