9天5板!百亿牛股,公告提示风险!股价年内大涨近70%,上半年营收净利双降-2dfe815b 汇总全网 39718246 条结果
神击的巴哈姆特

神击的巴哈姆特

类别 生活服务 大小 50.41MB 系统 Android 更新 人气 6162 评论 8270634591
下载应用

应用介绍

  • 辽篮新赛季首位外援就位!媒体人:克里斯今早顺利落地沈阳-6945857e
  • 未来已来无人驾出租车-474c3da3
  • 4家理财子获配“大肉签”,哪些机构频频现身硬科技IPO-7bd73b55
  • 智造模块·焕新城·链全球——北京住宅产业化集团将携多谱系模块化建筑产品亮相2026年服贸会-9fded937

百度保障,为您搜索护航

最佳回答

〖One〗. 「科普」 神击的巴哈姆特官网-APP下载🤜〰️🖼支持:winall/win7/win10/win11🥗系统类1.打开神击的巴哈姆特下载.进入神击的巴哈姆特前加载界面🍀2.打开修改器3.狂按ctrl+f1.当听到系统"滴"的一声。4.点击进入)神击的巴哈姆特.打开选开界面v.1.3.3.19(安全平台)登录入口✍️《神击的巴哈姆特》

〖Two〗. 「科普盘点」️🖼 1.打开神击的巴哈姆特下载.进入神击的巴哈姆特前加载界面🍀2.打开修改器3.狂按ctrl+f1.当听到系统"滴"的一声。4.点击进入)神击的巴哈姆特.打开选开界面v.1.0.0.93(安全平台)登录入口🛬《神击的巴哈姆特》

〖Three〗. 「分享下」 神击的巴哈姆特官网-APP下载🌗🕉😈支持:winall/win7/win10/win11🕝系统类型:1.打开神击的巴哈姆特下载.进入神击的巴哈姆特前加载界面🍀2.打开修改器3.狂按ctrl+f1.当听到系统"滴"的一声。4.点击进入)神击的巴哈姆特.打开选开界面v.3.6.1.30(安全平台)登录入口✅《神击的巴哈姆特》

〖Four〗.「强烈推荐」 神击的巴哈姆特官网-APP下载♋️🌶🦉支持:winall/win7/win10/win11🌩系统类型1.打开神击的巴哈姆特下载.进入神击的巴哈姆特前加载界面🍀2.打开修改器3.狂按ctrl+f1.当听到系统"滴"的一声。4.点击进入)神击的巴哈姆特.打开选开界面v.1.59.8.5(安全平台)登录入口🕥《神击的巴哈姆特》

〖Five〗.「重大通报」️ 神击的巴哈姆特官网-APP下载⚛️🏸👿支持:winall/win7/win10/win11🦟系统类型:1.打开神击的巴哈姆特下载.进入神击的巴哈姆特前加载界面🍀2.打开修改器3.狂按ctrl+f1.当听到系统"滴"的一声。4.点击进入)神击的巴哈姆特.打开选开界面v.1.5.6.52(安全平台)登录入口💯《神击的巴哈姆特》

〖Six〗、😬体验最新、最热门的国产视频合集,免费提供丰富多样的视频资源,不断更新,确保您随时观赏到优质内容。订阅我们的更新,享受永不间断的精彩视频!🍃✅同居by苏玛丽支持:winall/win7/win10/win11🌐系统类型🌐:WWW,60349D,COM2025全站)最新版本IOS/安卓官方入口v.1.5.53.74(安全平台)

〖Seven〗、👩探索最新的免费国产高清影视作品,尽在我们的精品视频平台。无广告干扰,流畅观看你的最爱电影和电视剧,随时随地享受高质量的视听盛宴。⛔️✅少妇作爱视频播放🔵支持:winall/win7/win10/win11🌐系统类型🌐:极品小爵爷2025全站)最新版本IOS/安卓官方入口v.2.81.5.8(安全平台)

神击的巴哈姆特安卓通用版-神击的巴哈姆特2026最新版v.1.0.2.65-22265安卓网

张新当选中国羽毛球协会主席-be718385

神击的巴哈姆特

世体:纳坦对阵皇马表现出色,巴萨或许找到了理想的左脚中卫-2046517f

滑动窗口打败线性注意力:一篇让整个领域尴尬的论文 2024 年前后,AI 圈子里流行一种说法:大语言模型的注意力机制是个定时炸弹。 每处理一个新词,模型都得把它的信息存起来,存到一个叫做 KV 缓存的地方。 KV缓存:大语言模型在生成文字时,用来记住之前所有词语信息的存储区,随着对话变长,这个缓存会不停膨胀。 问题是,这个缓存只会越存越大,从不清空。对话越长,占用的显存越多,处理速度也越慢。学术界给这个问题起了个名字,叫"二次方扩展",意思是计算量会随着文本长度的平方增长。文本长一倍,计算量涨四倍。这事显然不可持续。 于是"线性注意力"横空出世,听起来像救世主:把二次方的计算量压缩成线性的,不管文本多长,每处理一个新词的成本都是固定的。学术论文里各种线性注意力的变体层出不穷,从 Mamba 到 RWKV,从 GLA 到 Gated DeltaNet,每一篇都说自己解决了问题,而且性能几乎不掉。 但微软这几位研究者做了一件挺较真的事:他们找来一个大家几乎已经遗忘的老方法,滑动窗口注意力,加上一个小技巧,跟这些号称先进的线性注意力模型正面对比了一下。 这个不需要任何训练、几乎零成本的老方法,在几乎所有测试里,表现都不输,甚至超过那些耗费大量算力训练出来的线性注意力模型。 这篇论文的标题就是这么直白:《滑动窗口打败线性注意力》。 要理解这件事的分量,得先明白线性注意力想解决的到底是个什么麻烦事。 Transformer模型:目前几乎所有大语言模型的底层架构,靠"自注意力机制"让模型在处理每个词的时候,都能看看前面所有词跟它的关系。 自注意力的计算方式是这样的:模型处理第 t 个词的时候,要把它和前面所有 t-1 个词都做一次"相关性打分",然后加权汇总。这意味着处理第 1000 个词,要跟前面 999 个词都算一遍关系。处理第 10000 个词,就要跟前面 9999 个词都算一遍。 这就是为什么会有 KV 缓存这种东西存在,模型必须把每个词处理后产生的"键"(key)和"值"(value)都存下来,供后面的词查询用。文本越长,这个缓存越大,占用的显存越夸张,处理速度也越慢。 线性注意力的思路是:能不能不要把每个词的信息单独存起来,而是把它们压缩进一个固定大小的"状态"里,像滚雪球一样不断更新?这样无论文本多长,需要存储和更新的东西大小都是固定的。 线性注意力有三个天生的毛病。第一,表达能力不如原版注意力,因为把信息压缩进固定大小的状态,必然会丢失一些细节。第二,也是最麻烦的一点:模型必须在信息进来的那一刻,就决定要不要把它记住,而且一旦决定,以后很难反悔。这就像你边听课边做笔记,笔记本只有一页纸的空间,你得随时判断哪句话重要,值得记下来,哪句话可以舍弃,等老师讲到重点你才反应过来前面记错了地方,那已经来不及了,之前记的东西已经被新内容覆盖掉了。如果一开始就设计成"只有固定空间可以记笔记",你就必须承担"记错优先级"的风险,而这正是线性注意力模型训练起来特别难、效果总是差一口气的核心原因。第三,训练这类模型的软硬件生态还很不成熟,大部分显卡和框架都是为传统注意力优化的。 正因为从零训练线性注意力模型太贵太麻烦,研究者们想了个取巧的办法:拿一个已经训练好的、用传统注意力的大模型,硬把它的注意力机制换成线性版本,再用少量数据"补一补",让它尽量恢复原来的水平。这个过程叫"线性化"或者"蒸馏"。 其中最出名的一个方法叫 LoLCATs,它只用了 4000 万个训练词元(相当于一本厚字典的量级),就能让线性化后的模型恢复原模型九成以上的性能,堪称业界标杆。这个成绩确实让人眼前一亮,毕竟从零训练一个大模型动辄需要几千亿甚至几万亿词元。 这些论文在展示自己"表现不错"的时候,拿来对比的滑动窗口注意力,用的是一个"缺陷版本",没有加attention sink(注意力汇聚点)。而这个缺陷版本早就被证实会灾难性崩溃。换句话说,线性注意力模型们一直在跟一个"残废对手"比赛,赢了也说明不了什么。 滑动窗口注意力(简称 SWA)这个思路其实特别朴素:既然看全部历史太贵,那就只看最近的 w 个词就行了,别的都不管。 滑动窗口注意力:模型在处理第 t 个词时,只关注前面 w 个词,而不是全部历史词语,这样计算量就固定住了,不会随文本变长而增长。 这个想法乍一听有点简陋,甚至有点"偷懒"的感觉,模型难道不需要记住很久以前说过的话吗? 但这里有个巧妙的地方:虽然单层只能看 w 个词,但 Transformer 是很多层堆叠起来的。第一层看到最近 w 个词,第二层在第一层的基础上又能往前延伸 w 个词的信息,这样一层一层叠加,实际的"感受范围"会随着层数线性增长。这跟卷积神经网络里的"感受野"概念是一个道理,单个卷积核看得不远,但堆叠很多层之后,网络整体能看到的范围就变得很大了。 这就好比一个传声筒游戏,但不是简单的一句话传下去,而是每个人在转述给下一个人时,还能顺便把前面几个人说过的关键词悄悄叠加进去。传的人越多,信息覆盖的范围就越广,即使每个人一次只能记住最近说的几句话。如果没有这种层层叠加的机制,模型就真的只能看到眼前这一小段文字,什么都记不住,那滑动窗口就真的是"金鱼记忆"了,根本没法用。 不过滑动窗口有个致命伤,早年间就被发现了:大语言模型有个很奇怪的习惯,会把大量不必要的注意力都堆到最开头的几个词上,哪怕这几个词本身毫无意义。 这些词被称为attention sink(注意力汇聚点):模型学会把多余的、不知道该放哪里的注意力都堆积在序列最开始的几个词上,即使这些词的实际内容并不重要,它们更像是注意力机制的"泄压阀"。 这就意味着,如果滑动窗口一旦往前滑动,把这几个开头词挤出窗口,模型就会突然"发疯",性能断崖式下跌。这个问题的解法后来也被找到了:无论窗口滑到哪里,始终保留最开始的 4 个词,让它们继续待在窗口里当"泄压阀"。这个简单的补丁彻底解决了滑动窗口的崩溃问题。 想象一下你在整理书桌,规定自己只保留最近处理的 64 份文件,其余的全部扔掉腾地方。如果你把最早放进抽屉的那份说明书也一起扔了,结果发现所有后续文件的编号系统全靠那份说明书才看得懂,那整个抽屉就全乱套了。解决办法很简单:那份说明书永远留着,不管抽屉多满都不动它,剩下的空间才轮到"先进先出"的规则。这就是"4 个哨兵词"的作用,它们不参与正常的新陈代谢,但撑住了整个系统的稳定性。 有了这个补丁的滑动窗口注意力,才是这篇论文里真正拿来做对比的版本,公平地跟各路线性注意力模型掰手腕。 研究团队选了一堆有代表性的模型做基座,从 13 亿参数的小模型 Phi1.5,到 700 亿参数的 Llama-3.1-70B,涵盖了从小到大各个体量。测试的项目是几个业界通用的知识和推理基准,包括常识问答、科学推理、物理常识判断等等。 结果列在论文的核心表格里,这里挑几个有代表性的数字说一说。 在 11 组不同的模型对比里,滑动窗口注意力在其中 9 组里都拿到了最好的平均分。剩下两组也只是"平局"或者微弱落后。 具体到 MMLU(一个综合知识测试,考察模型在 57 个学科上的表现)这个指标上,滑动窗口注意力几乎每次都是表现最好的那个,唯一的例外是在 Llama2.0-7B 上,一个叫 DiJiang 的方法以 40.7 分小胜滑动窗口的 39.8 分,差距只有不到一分。 更有意思的是效率对比。论文里统计了一个"性能恢复率",意思是线性化后的模型能追回原模型多少百分比的分数。滑动窗口注意力在 MMLU 上追回了 93.2% 的分数,平均综合分数追回了 99.0%,而且完全不需要任何训练。 跟它打得最接近的是一个叫 QRWKV6 的方法,MMLU 恢复率 92.4%,平均分恢复率 99.1%,两者其实半斤八两。但 QRWKV6 需要 3.5 到 7 亿个训练词元才能达到这个效果,而滑动窗口注意力用的训练量是零。 这就好比两个学生考试成绩差不多,一个是花了几个月刷题冲刺出来的,另一个是裸考直接上场,压根没复习。两人分数打平,但你会觉得哪个更厉害? 其他方法的表现落差就更明显了。比如 Hedgehog 这个线性化方法,用了 4000 万训练词元,结果 MMLU 只恢复了 36.9%,平均分恢复了 73.9%,比滑动窗口差了一大截。SUPRA 用了整整 1000 亿词元训练,MMLU 恢复率也只有 53.0%。 这些数字放在一起看,传递的信息其实很扎心:花了大价钱训练出来的线性注意力模型,很多时候还打不过一个完全不需要训练、直接改改注意力遮罩就能用的老方法。 如果说短文本知识问答上滑动窗口注意力只是"略胜一筹",那在长文本推理任务上,这个差距直接变成了断崖式的碾压。 论文用了两个经典的长文本测试。第一个叫 Needle-in-a-Haystack(大海捞针),简单说就是在一大段无关文本中间藏一句关键信息,然后问模型能不能找出来。第二个叫 BABILong,是一套更复杂的长文本推理题目,需要模型在很长的干扰文本里做多步逻辑推理。 在大海捞针测试里,测试的上下文长度从 0.5K 一路拉到 4K 词元,窗口大小设置为 128、256、512 三档分别测试。结果是:不管哪个窗口大小,不管哪个长度,滑动窗口注意力的得分永远等于或者高于 LoLCATs 和另一个方法 Liger-GLA。 具体到 4K 长度这一档,滑动窗口注意力能保留原始满血模型 17% 到 23% 的准确率,而 LoLCATs 只能保留最多 5.8%,Liger-GLA 更惨,最多只有 0.8%。 这意味着什么?意味着在长文本场景下,LoLCATs 差不多已经"失明"了,100 次里只有不到 6 次能找到藏起来的关键信息,而滑动窗口注意力至少还能保住五分之一左右的能力。 BABILong 测试的结果趋势也一样。在上下文长度为 0 的时候(也就是没有额外干扰文本),LoLCATs 表现略微领先滑动窗口注意力,56 分对 55 分,差距很小。但一旦上下文拉长到 2K,滑动窗口注意力反超到 19 分,LoLCATs 掉到 10 分。拉长到 4K,滑动窗口注意力还能保住 15 分,LoLCATs 只剩 3 分。 用恢复率来说,在 4K 长度下,滑动窗口注意力能恢复原始满血模型 25% 的表现,LoLCATs 只能恢复 5%。 这个现象背后其实揭示了线性注意力最本质的软肋:它把所有历史信息压缩进一个固定大小的状态里,文本越长,需要压缩进去的信息越多,挤压得越厉害,早期的关键信息就越容易被后来的信息"挤没了"。这就像往一个已经装满的行李箱里硬塞新衣服,塞得越多,越早放进去的东西被压得越扁,甚至找不到了。滑动窗口没有这个"越塞越挤"的问题,因为它压根不试图记住太久以前的东西,它诚实地承认自己的局限,只精确处理最近的一段窗口,反而在长文本上更稳。 除了准确率之外,论文还测了推理速度和显存占用,这两项对实际部署来说同样关键。 测试在 NVIDIA RTX PRO 6000 显卡上进行,对比了传统的全量注意力、不同窗口大小的滑动窗口注意力、纯线性注意力,以及 LoLCATs 这种线性加滑动窗口的混合方案。 速度上,全量注意力在文本长度超过 1000 词元之后就开始明显掉速,越长越慢,一直掉到 25.6 万词元时几乎慢到无法忍受。而滑动窗口注意力从头到尾速度都很平稳,几乎不受文本长度影响,而且是所有方法里最快的,窗口设为 64 的版本比设为 512 的还要更快一些。 显存占用上,全量注意力的显存随文本长度线性暴涨,这也正是本文一开始提到的那个"不可持续"的问题的直观体现。滑动窗口注意力的显存占用会随长度增长,但一旦达到窗口大小就不再增加,稳稳地停在那里。窗口设为 64 的版本显存占用是所有方法里最低的。 这组数据说明一件事:滑动窗口注意力不仅效果不输甚至更好,成本还更低。既省钱又好用,这在工程实践里几乎是不可能同时满足的两个条件,但这次真的同时满足了。 这篇论文之后,研究者们也承认还有不少值得深挖的地方。 比如,这次的滑动窗口注意力是完全不训练的版本,但已经有别的研究证明,如果给滑动窗口也做一些针对性的训练,效果还能更好,这个方向值得跟线性化方法做更细致的对比,看看在同样训练预算下谁更划算。 再比如,这篇论文没有测试"混合模型",也就是那种部分层用全量注意力、部分层用滑动窗口或线性注意力的架构。这类混合方案在工业界其实已经有不少落地案例,未来做一次系统对比会很有价值。 论文里还提到一个挺有意思的旁证:在视频生成这个完全不同的领域,滑动窗口的思路同样很能打。有一个叫 Sliding Tile Attention 的方法,把滑动窗口的思路用在视频扩散模型上,在几乎不训练的情况下,能保留原模型 97% 的生成质量评分,同时速度提升了 3.53 倍。这说明"局部窗口 + 极少数关键锚点"这个思路,可能是一个跨领域都适用的通用规律,不只是语言模型的专利。 读完这篇论文,最让人意外的不是滑动窗口赢了,而是这场"比赛"存在了这么久,却几乎没人认真跑过。 这背后可能藏着一个挺普遍的科研现象:当一个新方向足够热门,聚集了足够多的论文和关注度之后,大家默认的对比基准会不知不觉地被"锚定"在某个不完整的版本上,然后所有后续工作都在这个不完整的基准上争夺一两个百分点的优势,却没人回头去检查这个基准本身对不对。 这篇论文做的事情说起来特别朴素,就是回头把那个被简化掉的细节(attention sink)补上,再重新跑一遍对比。结果发现整个赛道的排名可能都得重新洗一次牌。 这让我想起一件事:技术圈里经常听到"某个老方法已经过时了"这种论断,但很多时候,所谓的"过时"其实只是没人认真给它补上该有的补丁,然后拿一个残缺版本去陪跑,再顺理成章地宣布新方法获胜。 如果连滑动窗口这么简单的东西都能在合理配置下反杀一众精心设计的线性注意力模型,那还有多少被判了"死刑"的老方法,其实只是缺了一个四个词元大小的补丁? Q1:滑动窗口注意力和线性注意力哪个更好? A:根据这篇论文的测试,带有注意力汇聚点的滑动窗口注意力在多数知识问答和长文本推理任务上,表现等于或优于经过后训练的线性注意力模型,而且完全不需要训练,速度更快,显存占用更低。 Q2:为什么滑动窗口注意力需要保留开头的几个词? A:因为大语言模型会把大量不必要的注意力集中堆积在序列最开始的几个词上,这些词被称为注意力汇聚点。如果窗口滑动时把它们挤出去,模型性能会灾难性崩溃,保留开头4个词就能解决这个问题。 A:线性注意力把历史信息压缩进固定大小的状态里,表达能力不如原始注意力,且必须实时决定该记住什么该忘记什么,这个决策一旦做出很难反悔,长文本场景下早期关键信息容易被后续信息挤压丢失,训练和推理生态也不如传统注意力成熟。 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 钛媒体APP 2026-09-09 08:02:13 虎嗅APP 2026-07-26 12:40:09 每日经济新闻 2026-09-09 18:11:11 爱范儿 2026-09-09 18:40:04 量子位 2026-08-06 20:00:27 量子位 2026-06-07 04:37:43 量子位 2026-04-23 11:44:18 量子位 2026-08-29 21:04:32 机器之心Pro 2026-09-08 18:08:41 都市快报橙柿互动 2026-09-09 11:41:44 码上闲叙 2026-09-09 06:48:36 车之天下 2026-09-08 15:45:26 笑笑来看剧 2026-09-05 13:04:30 会投稿的小钱编辑 2026-09-09 13:41:42 新智元 2026-08-14 08:39:24 机器之心Pro 2026-09-08 11:20:07 机器之心Pro 2026-07-23 18:51:50 雄导的日常 2026-09-08 17:18:19 像素与芯片 2026-09-09 06:08:51 量子位 2026-08-19 10:00:47 网易科技态度见闻 2026-09-09 17:43:22 仙味少女心 2026-09-08 01:12:35 参考消息 2026-09-08 21:47:08 一曲一场談 2026-09-08 21:35:41 半岛都市报 2026-09-09 07:35:10 机器之心Pro 2026-09-09 13:33:52 上观新闻 2026-09-09 11:35:29 澎湃新闻 2026-09-08 23:14:11 智东西 2026-09-09 09:40:17 新京报评论 2026-09-09 14:41:24 手巧能干爱学习享生活 2026-09-07 16:16:14 车载娱乐 2026-09-08 10:31:12 中国能源网 2026-09-09 08:15:10 智驭社 2026-09-07 12:17:34 广东卫视 2026-09-09 16:44:44 香蕉唠生活 2026-09-07 02:14:48 星沙时报 2026-09-05 16:04:48 生物世界 2026-09-09 12:46:10 中国新闻周刊 2026-09-09 18:04:48 大风新闻 2026-09-09 10:42:04

特朗普:加拿大产品将被排除出美国政府采购计划-9ffca918

滑动窗口打败线性注意力:一篇让整个领域尴尬的论文 2024 年前后,AI 圈子里流行一种说法:大语言模型的注意力机制是个定时炸弹。 每处理一个新词,模型都得把它的信息存起来,存到一个叫做 KV 缓存的地方。 KV缓存:大语言模型在生成文字时,用来记住之前所有词语信息的存储区,随着对话变长,这个缓存会不停膨胀。 问题是,这个缓存只会越存越大,从不清空。对话越长,占用的显存越多,处理速度也越慢。学术界给这个问题起了个名字,叫"二次方扩展",意思是计算量会随着文本长度的平方增长。文本长一倍,计算量涨四倍。这事显然不可持续。 于是"线性注意力"横空出世,听起来像救世主:把二次方的计算量压缩成线性的,不管文本多长,每处理一个新词的成本都是固定的。学术论文里各种线性注意力的变体层出不穷,从 Mamba 到 RWKV,从 GLA 到 Gated DeltaNet,每一篇都说自己解决了问题,而且性能几乎不掉。 但微软这几位研究者做了一件挺较真的事:他们找来一个大家几乎已经遗忘的老方法,滑动窗口注意力,加上一个小技巧,跟这些号称先进的线性注意力模型正面对比了一下。 这个不需要任何训练、几乎零成本的老方法,在几乎所有测试里,表现都不输,甚至超过那些耗费大量算力训练出来的线性注意力模型。 这篇论文的标题就是这么直白:《滑动窗口打败线性注意力》。 要理解这件事的分量,得先明白线性注意力想解决的到底是个什么麻烦事。 Transformer模型:目前几乎所有大语言模型的底层架构,靠"自注意力机制"让模型在处理每个词的时候,都能看看前面所有词跟它的关系。 自注意力的计算方式是这样的:模型处理第 t 个词的时候,要把它和前面所有 t-1 个词都做一次"相关性打分",然后加权汇总。这意味着处理第 1000 个词,要跟前面 999 个词都算一遍关系。处理第 10000 个词,就要跟前面 9999 个词都算一遍。 这就是为什么会有 KV 缓存这种东西存在,模型必须把每个词处理后产生的"键"(key)和"值"(value)都存下来,供后面的词查询用。文本越长,这个缓存越大,占用的显存越夸张,处理速度也越慢。 线性注意力的思路是:能不能不要把每个词的信息单独存起来,而是把它们压缩进一个固定大小的"状态"里,像滚雪球一样不断更新?这样无论文本多长,需要存储和更新的东西大小都是固定的。 线性注意力有三个天生的毛病。第一,表达能力不如原版注意力,因为把信息压缩进固定大小的状态,必然会丢失一些细节。第二,也是最麻烦的一点:模型必须在信息进来的那一刻,就决定要不要把它记住,而且一旦决定,以后很难反悔。这就像你边听课边做笔记,笔记本只有一页纸的空间,你得随时判断哪句话重要,值得记下来,哪句话可以舍弃,等老师讲到重点你才反应过来前面记错了地方,那已经来不及了,之前记的东西已经被新内容覆盖掉了。如果一开始就设计成"只有固定空间可以记笔记",你就必须承担"记错优先级"的风险,而这正是线性注意力模型训练起来特别难、效果总是差一口气的核心原因。第三,训练这类模型的软硬件生态还很不成熟,大部分显卡和框架都是为传统注意力优化的。 正因为从零训练线性注意力模型太贵太麻烦,研究者们想了个取巧的办法:拿一个已经训练好的、用传统注意力的大模型,硬把它的注意力机制换成线性版本,再用少量数据"补一补",让它尽量恢复原来的水平。这个过程叫"线性化"或者"蒸馏"。 其中最出名的一个方法叫 LoLCATs,它只用了 4000 万个训练词元(相当于一本厚字典的量级),就能让线性化后的模型恢复原模型九成以上的性能,堪称业界标杆。这个成绩确实让人眼前一亮,毕竟从零训练一个大模型动辄需要几千亿甚至几万亿词元。 这些论文在展示自己"表现不错"的时候,拿来对比的滑动窗口注意力,用的是一个"缺陷版本",没有加attention sink(注意力汇聚点)。而这个缺陷版本早就被证实会灾难性崩溃。换句话说,线性注意力模型们一直在跟一个"残废对手"比赛,赢了也说明不了什么。 滑动窗口注意力(简称 SWA)这个思路其实特别朴素:既然看全部历史太贵,那就只看最近的 w 个词就行了,别的都不管。 滑动窗口注意力:模型在处理第 t 个词时,只关注前面 w 个词,而不是全部历史词语,这样计算量就固定住了,不会随文本变长而增长。 这个想法乍一听有点简陋,甚至有点"偷懒"的感觉,模型难道不需要记住很久以前说过的话吗? 但这里有个巧妙的地方:虽然单层只能看 w 个词,但 Transformer 是很多层堆叠起来的。第一层看到最近 w 个词,第二层在第一层的基础上又能往前延伸 w 个词的信息,这样一层一层叠加,实际的"感受范围"会随着层数线性增长。这跟卷积神经网络里的"感受野"概念是一个道理,单个卷积核看得不远,但堆叠很多层之后,网络整体能看到的范围就变得很大了。 这就好比一个传声筒游戏,但不是简单的一句话传下去,而是每个人在转述给下一个人时,还能顺便把前面几个人说过的关键词悄悄叠加进去。传的人越多,信息覆盖的范围就越广,即使每个人一次只能记住最近说的几句话。如果没有这种层层叠加的机制,模型就真的只能看到眼前这一小段文字,什么都记不住,那滑动窗口就真的是"金鱼记忆"了,根本没法用。 不过滑动窗口有个致命伤,早年间就被发现了:大语言模型有个很奇怪的习惯,会把大量不必要的注意力都堆到最开头的几个词上,哪怕这几个词本身毫无意义。 这些词被称为attention sink(注意力汇聚点):模型学会把多余的、不知道该放哪里的注意力都堆积在序列最开始的几个词上,即使这些词的实际内容并不重要,它们更像是注意力机制的"泄压阀"。 这就意味着,如果滑动窗口一旦往前滑动,把这几个开头词挤出窗口,模型就会突然"发疯",性能断崖式下跌。这个问题的解法后来也被找到了:无论窗口滑到哪里,始终保留最开始的 4 个词,让它们继续待在窗口里当"泄压阀"。这个简单的补丁彻底解决了滑动窗口的崩溃问题。 想象一下你在整理书桌,规定自己只保留最近处理的 64 份文件,其余的全部扔掉腾地方。如果你把最早放进抽屉的那份说明书也一起扔了,结果发现所有后续文件的编号系统全靠那份说明书才看得懂,那整个抽屉就全乱套了。解决办法很简单:那份说明书永远留着,不管抽屉多满都不动它,剩下的空间才轮到"先进先出"的规则。这就是"4 个哨兵词"的作用,它们不参与正常的新陈代谢,但撑住了整个系统的稳定性。 有了这个补丁的滑动窗口注意力,才是这篇论文里真正拿来做对比的版本,公平地跟各路线性注意力模型掰手腕。 研究团队选了一堆有代表性的模型做基座,从 13 亿参数的小模型 Phi1.5,到 700 亿参数的 Llama-3.1-70B,涵盖了从小到大各个体量。测试的项目是几个业界通用的知识和推理基准,包括常识问答、科学推理、物理常识判断等等。 结果列在论文的核心表格里,这里挑几个有代表性的数字说一说。 在 11 组不同的模型对比里,滑动窗口注意力在其中 9 组里都拿到了最好的平均分。剩下两组也只是"平局"或者微弱落后。 具体到 MMLU(一个综合知识测试,考察模型在 57 个学科上的表现)这个指标上,滑动窗口注意力几乎每次都是表现最好的那个,唯一的例外是在 Llama2.0-7B 上,一个叫 DiJiang 的方法以 40.7 分小胜滑动窗口的 39.8 分,差距只有不到一分。 更有意思的是效率对比。论文里统计了一个"性能恢复率",意思是线性化后的模型能追回原模型多少百分比的分数。滑动窗口注意力在 MMLU 上追回了 93.2% 的分数,平均综合分数追回了 99.0%,而且完全不需要任何训练。 跟它打得最接近的是一个叫 QRWKV6 的方法,MMLU 恢复率 92.4%,平均分恢复率 99.1%,两者其实半斤八两。但 QRWKV6 需要 3.5 到 7 亿个训练词元才能达到这个效果,而滑动窗口注意力用的训练量是零。 这就好比两个学生考试成绩差不多,一个是花了几个月刷题冲刺出来的,另一个是裸考直接上场,压根没复习。两人分数打平,但你会觉得哪个更厉害? 其他方法的表现落差就更明显了。比如 Hedgehog 这个线性化方法,用了 4000 万训练词元,结果 MMLU 只恢复了 36.9%,平均分恢复了 73.9%,比滑动窗口差了一大截。SUPRA 用了整整 1000 亿词元训练,MMLU 恢复率也只有 53.0%。 这些数字放在一起看,传递的信息其实很扎心:花了大价钱训练出来的线性注意力模型,很多时候还打不过一个完全不需要训练、直接改改注意力遮罩就能用的老方法。 如果说短文本知识问答上滑动窗口注意力只是"略胜一筹",那在长文本推理任务上,这个差距直接变成了断崖式的碾压。 论文用了两个经典的长文本测试。第一个叫 Needle-in-a-Haystack(大海捞针),简单说就是在一大段无关文本中间藏一句关键信息,然后问模型能不能找出来。第二个叫 BABILong,是一套更复杂的长文本推理题目,需要模型在很长的干扰文本里做多步逻辑推理。 在大海捞针测试里,测试的上下文长度从 0.5K 一路拉到 4K 词元,窗口大小设置为 128、256、512 三档分别测试。结果是:不管哪个窗口大小,不管哪个长度,滑动窗口注意力的得分永远等于或者高于 LoLCATs 和另一个方法 Liger-GLA。 具体到 4K 长度这一档,滑动窗口注意力能保留原始满血模型 17% 到 23% 的准确率,而 LoLCATs 只能保留最多 5.8%,Liger-GLA 更惨,最多只有 0.8%。 这意味着什么?意味着在长文本场景下,LoLCATs 差不多已经"失明"了,100 次里只有不到 6 次能找到藏起来的关键信息,而滑动窗口注意力至少还能保住五分之一左右的能力。 BABILong 测试的结果趋势也一样。在上下文长度为 0 的时候(也就是没有额外干扰文本),LoLCATs 表现略微领先滑动窗口注意力,56 分对 55 分,差距很小。但一旦上下文拉长到 2K,滑动窗口注意力反超到 19 分,LoLCATs 掉到 10 分。拉长到 4K,滑动窗口注意力还能保住 15 分,LoLCATs 只剩 3 分。 用恢复率来说,在 4K 长度下,滑动窗口注意力能恢复原始满血模型 25% 的表现,LoLCATs 只能恢复 5%。 这个现象背后其实揭示了线性注意力最本质的软肋:它把所有历史信息压缩进一个固定大小的状态里,文本越长,需要压缩进去的信息越多,挤压得越厉害,早期的关键信息就越容易被后来的信息"挤没了"。这就像往一个已经装满的行李箱里硬塞新衣服,塞得越多,越早放进去的东西被压得越扁,甚至找不到了。滑动窗口没有这个"越塞越挤"的问题,因为它压根不试图记住太久以前的东西,它诚实地承认自己的局限,只精确处理最近的一段窗口,反而在长文本上更稳。 除了准确率之外,论文还测了推理速度和显存占用,这两项对实际部署来说同样关键。 测试在 NVIDIA RTX PRO 6000 显卡上进行,对比了传统的全量注意力、不同窗口大小的滑动窗口注意力、纯线性注意力,以及 LoLCATs 这种线性加滑动窗口的混合方案。 速度上,全量注意力在文本长度超过 1000 词元之后就开始明显掉速,越长越慢,一直掉到 25.6 万词元时几乎慢到无法忍受。而滑动窗口注意力从头到尾速度都很平稳,几乎不受文本长度影响,而且是所有方法里最快的,窗口设为 64 的版本比设为 512 的还要更快一些。 显存占用上,全量注意力的显存随文本长度线性暴涨,这也正是本文一开始提到的那个"不可持续"的问题的直观体现。滑动窗口注意力的显存占用会随长度增长,但一旦达到窗口大小就不再增加,稳稳地停在那里。窗口设为 64 的版本显存占用是所有方法里最低的。 这组数据说明一件事:滑动窗口注意力不仅效果不输甚至更好,成本还更低。既省钱又好用,这在工程实践里几乎是不可能同时满足的两个条件,但这次真的同时满足了。 这篇论文之后,研究者们也承认还有不少值得深挖的地方。 比如,这次的滑动窗口注意力是完全不训练的版本,但已经有别的研究证明,如果给滑动窗口也做一些针对性的训练,效果还能更好,这个方向值得跟线性化方法做更细致的对比,看看在同样训练预算下谁更划算。 再比如,这篇论文没有测试"混合模型",也就是那种部分层用全量注意力、部分层用滑动窗口或线性注意力的架构。这类混合方案在工业界其实已经有不少落地案例,未来做一次系统对比会很有价值。 论文里还提到一个挺有意思的旁证:在视频生成这个完全不同的领域,滑动窗口的思路同样很能打。有一个叫 Sliding Tile Attention 的方法,把滑动窗口的思路用在视频扩散模型上,在几乎不训练的情况下,能保留原模型 97% 的生成质量评分,同时速度提升了 3.53 倍。这说明"局部窗口 + 极少数关键锚点"这个思路,可能是一个跨领域都适用的通用规律,不只是语言模型的专利。 读完这篇论文,最让人意外的不是滑动窗口赢了,而是这场"比赛"存在了这么久,却几乎没人认真跑过。 这背后可能藏着一个挺普遍的科研现象:当一个新方向足够热门,聚集了足够多的论文和关注度之后,大家默认的对比基准会不知不觉地被"锚定"在某个不完整的版本上,然后所有后续工作都在这个不完整的基准上争夺一两个百分点的优势,却没人回头去检查这个基准本身对不对。 这篇论文做的事情说起来特别朴素,就是回头把那个被简化掉的细节(attention sink)补上,再重新跑一遍对比。结果发现整个赛道的排名可能都得重新洗一次牌。 这让我想起一件事:技术圈里经常听到"某个老方法已经过时了"这种论断,但很多时候,所谓的"过时"其实只是没人认真给它补上该有的补丁,然后拿一个残缺版本去陪跑,再顺理成章地宣布新方法获胜。 如果连滑动窗口这么简单的东西都能在合理配置下反杀一众精心设计的线性注意力模型,那还有多少被判了"死刑"的老方法,其实只是缺了一个四个词元大小的补丁? Q1:滑动窗口注意力和线性注意力哪个更好? A:根据这篇论文的测试,带有注意力汇聚点的滑动窗口注意力在多数知识问答和长文本推理任务上,表现等于或优于经过后训练的线性注意力模型,而且完全不需要训练,速度更快,显存占用更低。 Q2:为什么滑动窗口注意力需要保留开头的几个词? A:因为大语言模型会把大量不必要的注意力集中堆积在序列最开始的几个词上,这些词被称为注意力汇聚点。如果窗口滑动时把它们挤出去,模型性能会灾难性崩溃,保留开头4个词就能解决这个问题。 A:线性注意力把历史信息压缩进固定大小的状态里,表达能力不如原始注意力,且必须实时决定该记住什么该忘记什么,这个决策一旦做出很难反悔,长文本场景下早期关键信息容易被后续信息挤压丢失,训练和推理生态也不如传统注意力成熟。 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 钛媒体APP 2026-09-09 08:02:13 虎嗅APP 2026-07-26 12:40:09 每日经济新闻 2026-09-09 18:11:11 爱范儿 2026-09-09 18:40:04 量子位 2026-08-06 20:00:27 量子位 2026-06-07 04:37:43 量子位 2026-04-23 11:44:18 量子位 2026-08-29 21:04:32 机器之心Pro 2026-09-08 18:08:41 都市快报橙柿互动 2026-09-09 11:41:44 码上闲叙 2026-09-09 06:48:36 车之天下 2026-09-08 15:45:26 笑笑来看剧 2026-09-05 13:04:30 会投稿的小钱编辑 2026-09-09 13:41:42 新智元 2026-08-14 08:39:24 机器之心Pro 2026-09-08 11:20:07 机器之心Pro 2026-07-23 18:51:50 雄导的日常 2026-09-08 17:18:19 像素与芯片 2026-09-09 06:08:51 量子位 2026-08-19 10:00:47 网易科技态度见闻 2026-09-09 17:43:22 仙味少女心 2026-09-08 01:12:35 参考消息 2026-09-08 21:47:08 一曲一场談 2026-09-08 21:35:41 半岛都市报 2026-09-09 07:35:10 机器之心Pro 2026-09-09 13:33:52 上观新闻 2026-09-09 11:35:29 澎湃新闻 2026-09-08 23:14:11 智东西 2026-09-09 09:40:17 新京报评论 2026-09-09 14:41:24 手巧能干爱学习享生活 2026-09-07 16:16:14 车载娱乐 2026-09-08 10:31:12 中国能源网 2026-09-09 08:15:10 智驭社 2026-09-07 12:17:34 广东卫视 2026-09-09 16:44:44 香蕉唠生活 2026-09-07 02:14:48 星沙时报 2026-09-05 16:04:48 生物世界 2026-09-09 12:46:10 中国新闻周刊 2026-09-09 18:04:48 大风新闻 2026-09-09 10:42:04

最高涨幅超千元!多家手机厂商集中调价-ed922e88

滑动窗口打败线性注意力:一篇让整个领域尴尬的论文 2024 年前后,AI 圈子里流行一种说法:大语言模型的注意力机制是个定时炸弹。 每处理一个新词,模型都得把它的信息存起来,存到一个叫做 KV 缓存的地方。 KV缓存:大语言模型在生成文字时,用来记住之前所有词语信息的存储区,随着对话变长,这个缓存会不停膨胀。 问题是,这个缓存只会越存越大,从不清空。对话越长,占用的显存越多,处理速度也越慢。学术界给这个问题起了个名字,叫"二次方扩展",意思是计算量会随着文本长度的平方增长。文本长一倍,计算量涨四倍。这事显然不可持续。 于是"线性注意力"横空出世,听起来像救世主:把二次方的计算量压缩成线性的,不管文本多长,每处理一个新词的成本都是固定的。学术论文里各种线性注意力的变体层出不穷,从 Mamba 到 RWKV,从 GLA 到 Gated DeltaNet,每一篇都说自己解决了问题,而且性能几乎不掉。 但微软这几位研究者做了一件挺较真的事:他们找来一个大家几乎已经遗忘的老方法,滑动窗口注意力,加上一个小技巧,跟这些号称先进的线性注意力模型正面对比了一下。 这个不需要任何训练、几乎零成本的老方法,在几乎所有测试里,表现都不输,甚至超过那些耗费大量算力训练出来的线性注意力模型。 这篇论文的标题就是这么直白:《滑动窗口打败线性注意力》。 要理解这件事的分量,得先明白线性注意力想解决的到底是个什么麻烦事。 Transformer模型:目前几乎所有大语言模型的底层架构,靠"自注意力机制"让模型在处理每个词的时候,都能看看前面所有词跟它的关系。 自注意力的计算方式是这样的:模型处理第 t 个词的时候,要把它和前面所有 t-1 个词都做一次"相关性打分",然后加权汇总。这意味着处理第 1000 个词,要跟前面 999 个词都算一遍关系。处理第 10000 个词,就要跟前面 9999 个词都算一遍。 这就是为什么会有 KV 缓存这种东西存在,模型必须把每个词处理后产生的"键"(key)和"值"(value)都存下来,供后面的词查询用。文本越长,这个缓存越大,占用的显存越夸张,处理速度也越慢。 线性注意力的思路是:能不能不要把每个词的信息单独存起来,而是把它们压缩进一个固定大小的"状态"里,像滚雪球一样不断更新?这样无论文本多长,需要存储和更新的东西大小都是固定的。 线性注意力有三个天生的毛病。第一,表达能力不如原版注意力,因为把信息压缩进固定大小的状态,必然会丢失一些细节。第二,也是最麻烦的一点:模型必须在信息进来的那一刻,就决定要不要把它记住,而且一旦决定,以后很难反悔。这就像你边听课边做笔记,笔记本只有一页纸的空间,你得随时判断哪句话重要,值得记下来,哪句话可以舍弃,等老师讲到重点你才反应过来前面记错了地方,那已经来不及了,之前记的东西已经被新内容覆盖掉了。如果一开始就设计成"只有固定空间可以记笔记",你就必须承担"记错优先级"的风险,而这正是线性注意力模型训练起来特别难、效果总是差一口气的核心原因。第三,训练这类模型的软硬件生态还很不成熟,大部分显卡和框架都是为传统注意力优化的。 正因为从零训练线性注意力模型太贵太麻烦,研究者们想了个取巧的办法:拿一个已经训练好的、用传统注意力的大模型,硬把它的注意力机制换成线性版本,再用少量数据"补一补",让它尽量恢复原来的水平。这个过程叫"线性化"或者"蒸馏"。 其中最出名的一个方法叫 LoLCATs,它只用了 4000 万个训练词元(相当于一本厚字典的量级),就能让线性化后的模型恢复原模型九成以上的性能,堪称业界标杆。这个成绩确实让人眼前一亮,毕竟从零训练一个大模型动辄需要几千亿甚至几万亿词元。 这些论文在展示自己"表现不错"的时候,拿来对比的滑动窗口注意力,用的是一个"缺陷版本",没有加attention sink(注意力汇聚点)。而这个缺陷版本早就被证实会灾难性崩溃。换句话说,线性注意力模型们一直在跟一个"残废对手"比赛,赢了也说明不了什么。 滑动窗口注意力(简称 SWA)这个思路其实特别朴素:既然看全部历史太贵,那就只看最近的 w 个词就行了,别的都不管。 滑动窗口注意力:模型在处理第 t 个词时,只关注前面 w 个词,而不是全部历史词语,这样计算量就固定住了,不会随文本变长而增长。 这个想法乍一听有点简陋,甚至有点"偷懒"的感觉,模型难道不需要记住很久以前说过的话吗? 但这里有个巧妙的地方:虽然单层只能看 w 个词,但 Transformer 是很多层堆叠起来的。第一层看到最近 w 个词,第二层在第一层的基础上又能往前延伸 w 个词的信息,这样一层一层叠加,实际的"感受范围"会随着层数线性增长。这跟卷积神经网络里的"感受野"概念是一个道理,单个卷积核看得不远,但堆叠很多层之后,网络整体能看到的范围就变得很大了。 这就好比一个传声筒游戏,但不是简单的一句话传下去,而是每个人在转述给下一个人时,还能顺便把前面几个人说过的关键词悄悄叠加进去。传的人越多,信息覆盖的范围就越广,即使每个人一次只能记住最近说的几句话。如果没有这种层层叠加的机制,模型就真的只能看到眼前这一小段文字,什么都记不住,那滑动窗口就真的是"金鱼记忆"了,根本没法用。 不过滑动窗口有个致命伤,早年间就被发现了:大语言模型有个很奇怪的习惯,会把大量不必要的注意力都堆到最开头的几个词上,哪怕这几个词本身毫无意义。 这些词被称为attention sink(注意力汇聚点):模型学会把多余的、不知道该放哪里的注意力都堆积在序列最开始的几个词上,即使这些词的实际内容并不重要,它们更像是注意力机制的"泄压阀"。 这就意味着,如果滑动窗口一旦往前滑动,把这几个开头词挤出窗口,模型就会突然"发疯",性能断崖式下跌。这个问题的解法后来也被找到了:无论窗口滑到哪里,始终保留最开始的 4 个词,让它们继续待在窗口里当"泄压阀"。这个简单的补丁彻底解决了滑动窗口的崩溃问题。 想象一下你在整理书桌,规定自己只保留最近处理的 64 份文件,其余的全部扔掉腾地方。如果你把最早放进抽屉的那份说明书也一起扔了,结果发现所有后续文件的编号系统全靠那份说明书才看得懂,那整个抽屉就全乱套了。解决办法很简单:那份说明书永远留着,不管抽屉多满都不动它,剩下的空间才轮到"先进先出"的规则。这就是"4 个哨兵词"的作用,它们不参与正常的新陈代谢,但撑住了整个系统的稳定性。 有了这个补丁的滑动窗口注意力,才是这篇论文里真正拿来做对比的版本,公平地跟各路线性注意力模型掰手腕。 研究团队选了一堆有代表性的模型做基座,从 13 亿参数的小模型 Phi1.5,到 700 亿参数的 Llama-3.1-70B,涵盖了从小到大各个体量。测试的项目是几个业界通用的知识和推理基准,包括常识问答、科学推理、物理常识判断等等。 结果列在论文的核心表格里,这里挑几个有代表性的数字说一说。 在 11 组不同的模型对比里,滑动窗口注意力在其中 9 组里都拿到了最好的平均分。剩下两组也只是"平局"或者微弱落后。 具体到 MMLU(一个综合知识测试,考察模型在 57 个学科上的表现)这个指标上,滑动窗口注意力几乎每次都是表现最好的那个,唯一的例外是在 Llama2.0-7B 上,一个叫 DiJiang 的方法以 40.7 分小胜滑动窗口的 39.8 分,差距只有不到一分。 更有意思的是效率对比。论文里统计了一个"性能恢复率",意思是线性化后的模型能追回原模型多少百分比的分数。滑动窗口注意力在 MMLU 上追回了 93.2% 的分数,平均综合分数追回了 99.0%,而且完全不需要任何训练。 跟它打得最接近的是一个叫 QRWKV6 的方法,MMLU 恢复率 92.4%,平均分恢复率 99.1%,两者其实半斤八两。但 QRWKV6 需要 3.5 到 7 亿个训练词元才能达到这个效果,而滑动窗口注意力用的训练量是零。 这就好比两个学生考试成绩差不多,一个是花了几个月刷题冲刺出来的,另一个是裸考直接上场,压根没复习。两人分数打平,但你会觉得哪个更厉害? 其他方法的表现落差就更明显了。比如 Hedgehog 这个线性化方法,用了 4000 万训练词元,结果 MMLU 只恢复了 36.9%,平均分恢复了 73.9%,比滑动窗口差了一大截。SUPRA 用了整整 1000 亿词元训练,MMLU 恢复率也只有 53.0%。 这些数字放在一起看,传递的信息其实很扎心:花了大价钱训练出来的线性注意力模型,很多时候还打不过一个完全不需要训练、直接改改注意力遮罩就能用的老方法。 如果说短文本知识问答上滑动窗口注意力只是"略胜一筹",那在长文本推理任务上,这个差距直接变成了断崖式的碾压。 论文用了两个经典的长文本测试。第一个叫 Needle-in-a-Haystack(大海捞针),简单说就是在一大段无关文本中间藏一句关键信息,然后问模型能不能找出来。第二个叫 BABILong,是一套更复杂的长文本推理题目,需要模型在很长的干扰文本里做多步逻辑推理。 在大海捞针测试里,测试的上下文长度从 0.5K 一路拉到 4K 词元,窗口大小设置为 128、256、512 三档分别测试。结果是:不管哪个窗口大小,不管哪个长度,滑动窗口注意力的得分永远等于或者高于 LoLCATs 和另一个方法 Liger-GLA。 具体到 4K 长度这一档,滑动窗口注意力能保留原始满血模型 17% 到 23% 的准确率,而 LoLCATs 只能保留最多 5.8%,Liger-GLA 更惨,最多只有 0.8%。 这意味着什么?意味着在长文本场景下,LoLCATs 差不多已经"失明"了,100 次里只有不到 6 次能找到藏起来的关键信息,而滑动窗口注意力至少还能保住五分之一左右的能力。 BABILong 测试的结果趋势也一样。在上下文长度为 0 的时候(也就是没有额外干扰文本),LoLCATs 表现略微领先滑动窗口注意力,56 分对 55 分,差距很小。但一旦上下文拉长到 2K,滑动窗口注意力反超到 19 分,LoLCATs 掉到 10 分。拉长到 4K,滑动窗口注意力还能保住 15 分,LoLCATs 只剩 3 分。 用恢复率来说,在 4K 长度下,滑动窗口注意力能恢复原始满血模型 25% 的表现,LoLCATs 只能恢复 5%。 这个现象背后其实揭示了线性注意力最本质的软肋:它把所有历史信息压缩进一个固定大小的状态里,文本越长,需要压缩进去的信息越多,挤压得越厉害,早期的关键信息就越容易被后来的信息"挤没了"。这就像往一个已经装满的行李箱里硬塞新衣服,塞得越多,越早放进去的东西被压得越扁,甚至找不到了。滑动窗口没有这个"越塞越挤"的问题,因为它压根不试图记住太久以前的东西,它诚实地承认自己的局限,只精确处理最近的一段窗口,反而在长文本上更稳。 除了准确率之外,论文还测了推理速度和显存占用,这两项对实际部署来说同样关键。 测试在 NVIDIA RTX PRO 6000 显卡上进行,对比了传统的全量注意力、不同窗口大小的滑动窗口注意力、纯线性注意力,以及 LoLCATs 这种线性加滑动窗口的混合方案。 速度上,全量注意力在文本长度超过 1000 词元之后就开始明显掉速,越长越慢,一直掉到 25.6 万词元时几乎慢到无法忍受。而滑动窗口注意力从头到尾速度都很平稳,几乎不受文本长度影响,而且是所有方法里最快的,窗口设为 64 的版本比设为 512 的还要更快一些。 显存占用上,全量注意力的显存随文本长度线性暴涨,这也正是本文一开始提到的那个"不可持续"的问题的直观体现。滑动窗口注意力的显存占用会随长度增长,但一旦达到窗口大小就不再增加,稳稳地停在那里。窗口设为 64 的版本显存占用是所有方法里最低的。 这组数据说明一件事:滑动窗口注意力不仅效果不输甚至更好,成本还更低。既省钱又好用,这在工程实践里几乎是不可能同时满足的两个条件,但这次真的同时满足了。 这篇论文之后,研究者们也承认还有不少值得深挖的地方。 比如,这次的滑动窗口注意力是完全不训练的版本,但已经有别的研究证明,如果给滑动窗口也做一些针对性的训练,效果还能更好,这个方向值得跟线性化方法做更细致的对比,看看在同样训练预算下谁更划算。 再比如,这篇论文没有测试"混合模型",也就是那种部分层用全量注意力、部分层用滑动窗口或线性注意力的架构。这类混合方案在工业界其实已经有不少落地案例,未来做一次系统对比会很有价值。 论文里还提到一个挺有意思的旁证:在视频生成这个完全不同的领域,滑动窗口的思路同样很能打。有一个叫 Sliding Tile Attention 的方法,把滑动窗口的思路用在视频扩散模型上,在几乎不训练的情况下,能保留原模型 97% 的生成质量评分,同时速度提升了 3.53 倍。这说明"局部窗口 + 极少数关键锚点"这个思路,可能是一个跨领域都适用的通用规律,不只是语言模型的专利。 读完这篇论文,最让人意外的不是滑动窗口赢了,而是这场"比赛"存在了这么久,却几乎没人认真跑过。 这背后可能藏着一个挺普遍的科研现象:当一个新方向足够热门,聚集了足够多的论文和关注度之后,大家默认的对比基准会不知不觉地被"锚定"在某个不完整的版本上,然后所有后续工作都在这个不完整的基准上争夺一两个百分点的优势,却没人回头去检查这个基准本身对不对。 这篇论文做的事情说起来特别朴素,就是回头把那个被简化掉的细节(attention sink)补上,再重新跑一遍对比。结果发现整个赛道的排名可能都得重新洗一次牌。 这让我想起一件事:技术圈里经常听到"某个老方法已经过时了"这种论断,但很多时候,所谓的"过时"其实只是没人认真给它补上该有的补丁,然后拿一个残缺版本去陪跑,再顺理成章地宣布新方法获胜。 如果连滑动窗口这么简单的东西都能在合理配置下反杀一众精心设计的线性注意力模型,那还有多少被判了"死刑"的老方法,其实只是缺了一个四个词元大小的补丁? Q1:滑动窗口注意力和线性注意力哪个更好? A:根据这篇论文的测试,带有注意力汇聚点的滑动窗口注意力在多数知识问答和长文本推理任务上,表现等于或优于经过后训练的线性注意力模型,而且完全不需要训练,速度更快,显存占用更低。 Q2:为什么滑动窗口注意力需要保留开头的几个词? A:因为大语言模型会把大量不必要的注意力集中堆积在序列最开始的几个词上,这些词被称为注意力汇聚点。如果窗口滑动时把它们挤出去,模型性能会灾难性崩溃,保留开头4个词就能解决这个问题。 A:线性注意力把历史信息压缩进固定大小的状态里,表达能力不如原始注意力,且必须实时决定该记住什么该忘记什么,这个决策一旦做出很难反悔,长文本场景下早期关键信息容易被后续信息挤压丢失,训练和推理生态也不如传统注意力成熟。 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 钛媒体APP 2026-09-09 08:02:13 虎嗅APP 2026-07-26 12:40:09 每日经济新闻 2026-09-09 18:11:11 爱范儿 2026-09-09 18:40:04 量子位 2026-08-06 20:00:27 量子位 2026-06-07 04:37:43 量子位 2026-04-23 11:44:18 量子位 2026-08-29 21:04:32 机器之心Pro 2026-09-08 18:08:41 都市快报橙柿互动 2026-09-09 11:41:44 码上闲叙 2026-09-09 06:48:36 车之天下 2026-09-08 15:45:26 笑笑来看剧 2026-09-05 13:04:30 会投稿的小钱编辑 2026-09-09 13:41:42 新智元 2026-08-14 08:39:24 机器之心Pro 2026-09-08 11:20:07 机器之心Pro 2026-07-23 18:51:50 雄导的日常 2026-09-08 17:18:19 像素与芯片 2026-09-09 06:08:51 量子位 2026-08-19 10:00:47 网易科技态度见闻 2026-09-09 17:43:22 仙味少女心 2026-09-08 01:12:35 参考消息 2026-09-08 21:47:08 一曲一场談 2026-09-08 21:35:41 半岛都市报 2026-09-09 07:35:10 机器之心Pro 2026-09-09 13:33:52 上观新闻 2026-09-09 11:35:29 澎湃新闻 2026-09-08 23:14:11 智东西 2026-09-09 09:40:17 新京报评论 2026-09-09 14:41:24 手巧能干爱学习享生活 2026-09-07 16:16:14 车载娱乐 2026-09-08 10:31:12 中国能源网 2026-09-09 08:15:10 智驭社 2026-09-07 12:17:34 广东卫视 2026-09-09 16:44:44 香蕉唠生活 2026-09-07 02:14:48 星沙时报 2026-09-05 16:04:48 生物世界 2026-09-09 12:46:10 中国新闻周刊 2026-09-09 18:04:48 大风新闻 2026-09-09 10:42:04

中京电子:公司9-f4c6429b

滑动窗口打败线性注意力:一篇让整个领域尴尬的论文 2024 年前后,AI 圈子里流行一种说法:大语言模型的注意力机制是个定时炸弹。 每处理一个新词,模型都得把它的信息存起来,存到一个叫做 KV 缓存的地方。 KV缓存:大语言模型在生成文字时,用来记住之前所有词语信息的存储区,随着对话变长,这个缓存会不停膨胀。 问题是,这个缓存只会越存越大,从不清空。对话越长,占用的显存越多,处理速度也越慢。学术界给这个问题起了个名字,叫"二次方扩展",意思是计算量会随着文本长度的平方增长。文本长一倍,计算量涨四倍。这事显然不可持续。 于是"线性注意力"横空出世,听起来像救世主:把二次方的计算量压缩成线性的,不管文本多长,每处理一个新词的成本都是固定的。学术论文里各种线性注意力的变体层出不穷,从 Mamba 到 RWKV,从 GLA 到 Gated DeltaNet,每一篇都说自己解决了问题,而且性能几乎不掉。 但微软这几位研究者做了一件挺较真的事:他们找来一个大家几乎已经遗忘的老方法,滑动窗口注意力,加上一个小技巧,跟这些号称先进的线性注意力模型正面对比了一下。 这个不需要任何训练、几乎零成本的老方法,在几乎所有测试里,表现都不输,甚至超过那些耗费大量算力训练出来的线性注意力模型。 这篇论文的标题就是这么直白:《滑动窗口打败线性注意力》。 要理解这件事的分量,得先明白线性注意力想解决的到底是个什么麻烦事。 Transformer模型:目前几乎所有大语言模型的底层架构,靠"自注意力机制"让模型在处理每个词的时候,都能看看前面所有词跟它的关系。 自注意力的计算方式是这样的:模型处理第 t 个词的时候,要把它和前面所有 t-1 个词都做一次"相关性打分",然后加权汇总。这意味着处理第 1000 个词,要跟前面 999 个词都算一遍关系。处理第 10000 个词,就要跟前面 9999 个词都算一遍。 这就是为什么会有 KV 缓存这种东西存在,模型必须把每个词处理后产生的"键"(key)和"值"(value)都存下来,供后面的词查询用。文本越长,这个缓存越大,占用的显存越夸张,处理速度也越慢。 线性注意力的思路是:能不能不要把每个词的信息单独存起来,而是把它们压缩进一个固定大小的"状态"里,像滚雪球一样不断更新?这样无论文本多长,需要存储和更新的东西大小都是固定的。 线性注意力有三个天生的毛病。第一,表达能力不如原版注意力,因为把信息压缩进固定大小的状态,必然会丢失一些细节。第二,也是最麻烦的一点:模型必须在信息进来的那一刻,就决定要不要把它记住,而且一旦决定,以后很难反悔。这就像你边听课边做笔记,笔记本只有一页纸的空间,你得随时判断哪句话重要,值得记下来,哪句话可以舍弃,等老师讲到重点你才反应过来前面记错了地方,那已经来不及了,之前记的东西已经被新内容覆盖掉了。如果一开始就设计成"只有固定空间可以记笔记",你就必须承担"记错优先级"的风险,而这正是线性注意力模型训练起来特别难、效果总是差一口气的核心原因。第三,训练这类模型的软硬件生态还很不成熟,大部分显卡和框架都是为传统注意力优化的。 正因为从零训练线性注意力模型太贵太麻烦,研究者们想了个取巧的办法:拿一个已经训练好的、用传统注意力的大模型,硬把它的注意力机制换成线性版本,再用少量数据"补一补",让它尽量恢复原来的水平。这个过程叫"线性化"或者"蒸馏"。 其中最出名的一个方法叫 LoLCATs,它只用了 4000 万个训练词元(相当于一本厚字典的量级),就能让线性化后的模型恢复原模型九成以上的性能,堪称业界标杆。这个成绩确实让人眼前一亮,毕竟从零训练一个大模型动辄需要几千亿甚至几万亿词元。 这些论文在展示自己"表现不错"的时候,拿来对比的滑动窗口注意力,用的是一个"缺陷版本",没有加attention sink(注意力汇聚点)。而这个缺陷版本早就被证实会灾难性崩溃。换句话说,线性注意力模型们一直在跟一个"残废对手"比赛,赢了也说明不了什么。 滑动窗口注意力(简称 SWA)这个思路其实特别朴素:既然看全部历史太贵,那就只看最近的 w 个词就行了,别的都不管。 滑动窗口注意力:模型在处理第 t 个词时,只关注前面 w 个词,而不是全部历史词语,这样计算量就固定住了,不会随文本变长而增长。 这个想法乍一听有点简陋,甚至有点"偷懒"的感觉,模型难道不需要记住很久以前说过的话吗? 但这里有个巧妙的地方:虽然单层只能看 w 个词,但 Transformer 是很多层堆叠起来的。第一层看到最近 w 个词,第二层在第一层的基础上又能往前延伸 w 个词的信息,这样一层一层叠加,实际的"感受范围"会随着层数线性增长。这跟卷积神经网络里的"感受野"概念是一个道理,单个卷积核看得不远,但堆叠很多层之后,网络整体能看到的范围就变得很大了。 这就好比一个传声筒游戏,但不是简单的一句话传下去,而是每个人在转述给下一个人时,还能顺便把前面几个人说过的关键词悄悄叠加进去。传的人越多,信息覆盖的范围就越广,即使每个人一次只能记住最近说的几句话。如果没有这种层层叠加的机制,模型就真的只能看到眼前这一小段文字,什么都记不住,那滑动窗口就真的是"金鱼记忆"了,根本没法用。 不过滑动窗口有个致命伤,早年间就被发现了:大语言模型有个很奇怪的习惯,会把大量不必要的注意力都堆到最开头的几个词上,哪怕这几个词本身毫无意义。 这些词被称为attention sink(注意力汇聚点):模型学会把多余的、不知道该放哪里的注意力都堆积在序列最开始的几个词上,即使这些词的实际内容并不重要,它们更像是注意力机制的"泄压阀"。 这就意味着,如果滑动窗口一旦往前滑动,把这几个开头词挤出窗口,模型就会突然"发疯",性能断崖式下跌。这个问题的解法后来也被找到了:无论窗口滑到哪里,始终保留最开始的 4 个词,让它们继续待在窗口里当"泄压阀"。这个简单的补丁彻底解决了滑动窗口的崩溃问题。 想象一下你在整理书桌,规定自己只保留最近处理的 64 份文件,其余的全部扔掉腾地方。如果你把最早放进抽屉的那份说明书也一起扔了,结果发现所有后续文件的编号系统全靠那份说明书才看得懂,那整个抽屉就全乱套了。解决办法很简单:那份说明书永远留着,不管抽屉多满都不动它,剩下的空间才轮到"先进先出"的规则。这就是"4 个哨兵词"的作用,它们不参与正常的新陈代谢,但撑住了整个系统的稳定性。 有了这个补丁的滑动窗口注意力,才是这篇论文里真正拿来做对比的版本,公平地跟各路线性注意力模型掰手腕。 研究团队选了一堆有代表性的模型做基座,从 13 亿参数的小模型 Phi1.5,到 700 亿参数的 Llama-3.1-70B,涵盖了从小到大各个体量。测试的项目是几个业界通用的知识和推理基准,包括常识问答、科学推理、物理常识判断等等。 结果列在论文的核心表格里,这里挑几个有代表性的数字说一说。 在 11 组不同的模型对比里,滑动窗口注意力在其中 9 组里都拿到了最好的平均分。剩下两组也只是"平局"或者微弱落后。 具体到 MMLU(一个综合知识测试,考察模型在 57 个学科上的表现)这个指标上,滑动窗口注意力几乎每次都是表现最好的那个,唯一的例外是在 Llama2.0-7B 上,一个叫 DiJiang 的方法以 40.7 分小胜滑动窗口的 39.8 分,差距只有不到一分。 更有意思的是效率对比。论文里统计了一个"性能恢复率",意思是线性化后的模型能追回原模型多少百分比的分数。滑动窗口注意力在 MMLU 上追回了 93.2% 的分数,平均综合分数追回了 99.0%,而且完全不需要任何训练。 跟它打得最接近的是一个叫 QRWKV6 的方法,MMLU 恢复率 92.4%,平均分恢复率 99.1%,两者其实半斤八两。但 QRWKV6 需要 3.5 到 7 亿个训练词元才能达到这个效果,而滑动窗口注意力用的训练量是零。 这就好比两个学生考试成绩差不多,一个是花了几个月刷题冲刺出来的,另一个是裸考直接上场,压根没复习。两人分数打平,但你会觉得哪个更厉害? 其他方法的表现落差就更明显了。比如 Hedgehog 这个线性化方法,用了 4000 万训练词元,结果 MMLU 只恢复了 36.9%,平均分恢复了 73.9%,比滑动窗口差了一大截。SUPRA 用了整整 1000 亿词元训练,MMLU 恢复率也只有 53.0%。 这些数字放在一起看,传递的信息其实很扎心:花了大价钱训练出来的线性注意力模型,很多时候还打不过一个完全不需要训练、直接改改注意力遮罩就能用的老方法。 如果说短文本知识问答上滑动窗口注意力只是"略胜一筹",那在长文本推理任务上,这个差距直接变成了断崖式的碾压。 论文用了两个经典的长文本测试。第一个叫 Needle-in-a-Haystack(大海捞针),简单说就是在一大段无关文本中间藏一句关键信息,然后问模型能不能找出来。第二个叫 BABILong,是一套更复杂的长文本推理题目,需要模型在很长的干扰文本里做多步逻辑推理。 在大海捞针测试里,测试的上下文长度从 0.5K 一路拉到 4K 词元,窗口大小设置为 128、256、512 三档分别测试。结果是:不管哪个窗口大小,不管哪个长度,滑动窗口注意力的得分永远等于或者高于 LoLCATs 和另一个方法 Liger-GLA。 具体到 4K 长度这一档,滑动窗口注意力能保留原始满血模型 17% 到 23% 的准确率,而 LoLCATs 只能保留最多 5.8%,Liger-GLA 更惨,最多只有 0.8%。 这意味着什么?意味着在长文本场景下,LoLCATs 差不多已经"失明"了,100 次里只有不到 6 次能找到藏起来的关键信息,而滑动窗口注意力至少还能保住五分之一左右的能力。 BABILong 测试的结果趋势也一样。在上下文长度为 0 的时候(也就是没有额外干扰文本),LoLCATs 表现略微领先滑动窗口注意力,56 分对 55 分,差距很小。但一旦上下文拉长到 2K,滑动窗口注意力反超到 19 分,LoLCATs 掉到 10 分。拉长到 4K,滑动窗口注意力还能保住 15 分,LoLCATs 只剩 3 分。 用恢复率来说,在 4K 长度下,滑动窗口注意力能恢复原始满血模型 25% 的表现,LoLCATs 只能恢复 5%。 这个现象背后其实揭示了线性注意力最本质的软肋:它把所有历史信息压缩进一个固定大小的状态里,文本越长,需要压缩进去的信息越多,挤压得越厉害,早期的关键信息就越容易被后来的信息"挤没了"。这就像往一个已经装满的行李箱里硬塞新衣服,塞得越多,越早放进去的东西被压得越扁,甚至找不到了。滑动窗口没有这个"越塞越挤"的问题,因为它压根不试图记住太久以前的东西,它诚实地承认自己的局限,只精确处理最近的一段窗口,反而在长文本上更稳。 除了准确率之外,论文还测了推理速度和显存占用,这两项对实际部署来说同样关键。 测试在 NVIDIA RTX PRO 6000 显卡上进行,对比了传统的全量注意力、不同窗口大小的滑动窗口注意力、纯线性注意力,以及 LoLCATs 这种线性加滑动窗口的混合方案。 速度上,全量注意力在文本长度超过 1000 词元之后就开始明显掉速,越长越慢,一直掉到 25.6 万词元时几乎慢到无法忍受。而滑动窗口注意力从头到尾速度都很平稳,几乎不受文本长度影响,而且是所有方法里最快的,窗口设为 64 的版本比设为 512 的还要更快一些。 显存占用上,全量注意力的显存随文本长度线性暴涨,这也正是本文一开始提到的那个"不可持续"的问题的直观体现。滑动窗口注意力的显存占用会随长度增长,但一旦达到窗口大小就不再增加,稳稳地停在那里。窗口设为 64 的版本显存占用是所有方法里最低的。 这组数据说明一件事:滑动窗口注意力不仅效果不输甚至更好,成本还更低。既省钱又好用,这在工程实践里几乎是不可能同时满足的两个条件,但这次真的同时满足了。 这篇论文之后,研究者们也承认还有不少值得深挖的地方。 比如,这次的滑动窗口注意力是完全不训练的版本,但已经有别的研究证明,如果给滑动窗口也做一些针对性的训练,效果还能更好,这个方向值得跟线性化方法做更细致的对比,看看在同样训练预算下谁更划算。 再比如,这篇论文没有测试"混合模型",也就是那种部分层用全量注意力、部分层用滑动窗口或线性注意力的架构。这类混合方案在工业界其实已经有不少落地案例,未来做一次系统对比会很有价值。 论文里还提到一个挺有意思的旁证:在视频生成这个完全不同的领域,滑动窗口的思路同样很能打。有一个叫 Sliding Tile Attention 的方法,把滑动窗口的思路用在视频扩散模型上,在几乎不训练的情况下,能保留原模型 97% 的生成质量评分,同时速度提升了 3.53 倍。这说明"局部窗口 + 极少数关键锚点"这个思路,可能是一个跨领域都适用的通用规律,不只是语言模型的专利。 读完这篇论文,最让人意外的不是滑动窗口赢了,而是这场"比赛"存在了这么久,却几乎没人认真跑过。 这背后可能藏着一个挺普遍的科研现象:当一个新方向足够热门,聚集了足够多的论文和关注度之后,大家默认的对比基准会不知不觉地被"锚定"在某个不完整的版本上,然后所有后续工作都在这个不完整的基准上争夺一两个百分点的优势,却没人回头去检查这个基准本身对不对。 这篇论文做的事情说起来特别朴素,就是回头把那个被简化掉的细节(attention sink)补上,再重新跑一遍对比。结果发现整个赛道的排名可能都得重新洗一次牌。 这让我想起一件事:技术圈里经常听到"某个老方法已经过时了"这种论断,但很多时候,所谓的"过时"其实只是没人认真给它补上该有的补丁,然后拿一个残缺版本去陪跑,再顺理成章地宣布新方法获胜。 如果连滑动窗口这么简单的东西都能在合理配置下反杀一众精心设计的线性注意力模型,那还有多少被判了"死刑"的老方法,其实只是缺了一个四个词元大小的补丁? Q1:滑动窗口注意力和线性注意力哪个更好? A:根据这篇论文的测试,带有注意力汇聚点的滑动窗口注意力在多数知识问答和长文本推理任务上,表现等于或优于经过后训练的线性注意力模型,而且完全不需要训练,速度更快,显存占用更低。 Q2:为什么滑动窗口注意力需要保留开头的几个词? A:因为大语言模型会把大量不必要的注意力集中堆积在序列最开始的几个词上,这些词被称为注意力汇聚点。如果窗口滑动时把它们挤出去,模型性能会灾难性崩溃,保留开头4个词就能解决这个问题。 A:线性注意力把历史信息压缩进固定大小的状态里,表达能力不如原始注意力,且必须实时决定该记住什么该忘记什么,这个决策一旦做出很难反悔,长文本场景下早期关键信息容易被后续信息挤压丢失,训练和推理生态也不如传统注意力成熟。 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 钛媒体APP 2026-09-09 08:02:13 虎嗅APP 2026-07-26 12:40:09 每日经济新闻 2026-09-09 18:11:11 爱范儿 2026-09-09 18:40:04 量子位 2026-08-06 20:00:27 量子位 2026-06-07 04:37:43 量子位 2026-04-23 11:44:18 量子位 2026-08-29 21:04:32 机器之心Pro 2026-09-08 18:08:41 都市快报橙柿互动 2026-09-09 11:41:44 码上闲叙 2026-09-09 06:48:36 车之天下 2026-09-08 15:45:26 笑笑来看剧 2026-09-05 13:04:30 会投稿的小钱编辑 2026-09-09 13:41:42 新智元 2026-08-14 08:39:24 机器之心Pro 2026-09-08 11:20:07 机器之心Pro 2026-07-23 18:51:50 雄导的日常 2026-09-08 17:18:19 像素与芯片 2026-09-09 06:08:51 量子位 2026-08-19 10:00:47 网易科技态度见闻 2026-09-09 17:43:22 仙味少女心 2026-09-08 01:12:35 参考消息 2026-09-08 21:47:08 一曲一场談 2026-09-08 21:35:41 半岛都市报 2026-09-09 07:35:10 机器之心Pro 2026-09-09 13:33:52 上观新闻 2026-09-09 11:35:29 澎湃新闻 2026-09-08 23:14:11 智东西 2026-09-09 09:40:17 新京报评论 2026-09-09 14:41:24 手巧能干爱学习享生活 2026-09-07 16:16:14 车载娱乐 2026-09-08 10:31:12 中国能源网 2026-09-09 08:15:10 智驭社 2026-09-07 12:17:34 广东卫视 2026-09-09 16:44:44 香蕉唠生活 2026-09-07 02:14:48 星沙时报 2026-09-05 16:04:48 生物世界 2026-09-09 12:46:10 中国新闻周刊 2026-09-09 18:04:48 大风新闻 2026-09-09 10:42:04

本文链接:http://www.teycb.com/ArTicle/details/20198534.sHtML

百度承诺:如遇虚假欺诈,助您****(责编:王秀天、王秀天)

相关应用