涩多多网站在线观看视频网站入口尽情享受高清国产视频免费看,无需担心卡顿问题,流畅播放让您体验最佳观影乐趣。精心挑选优质影片,随时随地观看最新热门内容,满足您的视听需求。
六部门印发实施方案完善乡村振兴投入机制-news590da541e08b197b
涩多多网站在线观看视频网站入口AGI 怎样才算真的来了? 本文来自微信公众号: 深流研究所 ,作者:吴绛枫 9月3日,OpenAI总裁格雷格·布罗克曼在发布新模型GPT-6 Astra后,抛出了一句话:“欢迎来到AGI时代。” 三天后,黄仁勋在社交平台上把话说得更直接:“从ChatGPT到o1,再到GPT-6 Astra,只用了四年。AGI已经到来。” 众所期待的AGI,就这么突然被宣布实现了? GPT-6 Astra发布前不久,OpenAI CEO山姆·奥尔特曼还在说,AGI是一个“定义极其模糊的词”,甚至差点称它为“无关紧要的营销术语”。 负责GPT-6 Astra关键评测的ARC Prize团队也专门提醒:GPT-6 Astra确实代表了通用化能力的重要进步,但“我们并不声称它就是AGI”。 一边是“欢迎来到AGI时代”,一边是“我们没有说这是AGI”。 今天,谁都在谈AGI,却没有谁能说清楚:AI究竟要做到什么,才算真正越过了AGI这条线。 先来看看GPT-6 Astra最令人咋舌的成绩,是在ARC-AGI-3上拿到99.9%。 ARC-AGI与普通评测不太一样。它不会直接告诉模型规则,而是把模型放进陌生环境,让模型自己判断目标、理解反馈,再找到解决办法。 这项评测试图衡量的,正是当前AI最受质疑的一种能力:面对没见过的问题,能不能现场学会。 99.9%的得分当然惊人。但这个数字有一个常被省略的前提。 在ARC Prize统一提供的标准测试框架中,GPT-6 Astra得分为62.7%;接入OpenAI提供的专用适配框架后,得分才上升到99.9%。 后者允许模型保留跨请求的隐藏推理状态,并利用上下文压缩延续此前的探索经验。 我们无法把OpenAI这项操作简单归类为“作弊”。毕竟,现实中的AI本来就不会裸机运行。记忆、工具和运行框架都可能成为智能系统的一部分。 问题在于,62.7%测量的更接近单个模型的能力;99.9%测量的则是一套经过专门优化的完整系统。 两项成绩都是真的,却不能混为一谈。更不能把99.9%的测试得分,顺手换算成“99.9%的AGI”。 此外,GPT-6 Astra在其他评测上的表现,也没有呈现出一个无懈可击的通才形象。 它在高难数学测试FrontierMath Tier 4上达到97.6%,在计算机操作测试OSWorld 2.0上得到72.6%;但到了更接近真实办公流程的AutomationBench,成绩降至41.4%,在复杂专业任务测试Agents’Last Exam上也只有59.3%。 这些数字真正说明的是,当任务规则清晰、答案可以验证时,Astra已经能够逼近甚至超过人类;一旦进入流程冗长、目标模糊的现实环境,它仍然会频繁失败。 深蓝击败国际象棋世界冠军,Watson赢下《危险边缘》,AlphaGo走出“神之一手”时,人们都曾短暂地产生过类似的错觉:既然机器已经征服了如此复杂的任务,通用智能大概也不远了。 规则明确、反馈即时、有自动裁判的世界,与现实生活并不是一回事。 OpenAI采用了最具经济导向的定义。其在2018年发布的公司章程将AGI描述为“在大多数具有经济价值的工作上超越人类的高度自主系统”。 这一定义包含三个关键条件——覆盖广泛的工作、表现超过人类、能够高度自主运行。 现实工作中的产出构成了核心尺度。意识、情感和人类式思维并未被列为必要条件。 这一标准与OpenAI近年的产品路线高度契合。 推理模型提升复杂任务的处理能力,智能体强化工具调用和计算机操作,Codex等产品进一步进入软件开发流程。 各项能力最终汇向同一个目标:让AI承担更完整的工作,并将模型能力转化为可规模化部署的生产力。 Anthropic对AGI的处理方式更加谨慎。CEO达里奥·阿莫迪认为,这个词承载了过多模糊含义,因此更常使用“强大的AI”。 在2024年10月发表的《Machines of Loving Grace》中,阿莫迪描述了一类具体系统: 它在多数重要领域达到或超过顶尖专家水平,能够独立完成持续数小时、数天乃至数周的任务,还可以复制成数百万个实例,以远高于人类的速度同时工作。 这幅图景包含能力、自主性和复制规模三个变量。三者共同决定AI的现实影响,也会同步放大滥用、失控和系统性风险。 基于这一判断,Anthropic将能力扩展与风险治理绑定。公司的战略重点可以概括为:保持前沿模型竞争力,同时让安全保障随能力等级同步升级。 Google DeepMind关注的,则是AGI的测量标准。 其2023年发布的《Levels of AGI》文章,以“性能”和“通用性”为两条主轴,将通用智能划分为“新兴”“胜任”“专家”“大师”和“超人类”五个等级,并把自主性作为独立维度处理。这套框架要求研究者同时考察能力强度和覆盖范围。 2026年3月,DeepMind进一步发布认知分类框架,将通用智能拆分为感知、生成、注意力、学习、记忆、推理、元认知、执行功能、问题解决和社会认知十个维度。 评估流程使用未公开测试集、具有代表性的人类样本,以及模型相对于人类能力分布的位置。 DeepMind还与Kaggle设立20万美元奖金,为其中五个评测较薄弱的维度征集测试方案。 这套思路把AGI从单一标签转化为可比较的认知能力图谱,也体现了DeepMind的研究取向:建立统一尺度,识别能力缺口,再据此组织评测和研发。 采用什么标准,就会把什么能力视为关键进展;把什么能力视为关键进展,就会决定一家公司的产品路线、资源配置和安全重点。 ■为什么说“AGI是否到来”,成了一场叙事之争? 人们总是习惯把技术革命想象成一个明确的瞬间。 莱特兄弟的飞机离开地面,第一颗原子弹爆炸,阿波罗11号登上月球。 回到当下的AGI到来之争,“GPT-6 Astra就是AGI”与“我们进入了AGI时代”,其实是两种不同性质的表达。 前者是可以被质疑和检验的技术结论:既然它是AGI,就应当说明采用了什么定义、满足了哪些条件,又在哪些测试中得到独立验证。 后者则更像一种时代判断。布罗克曼说的正是“欢迎来到AGI时代”。这种表述既制造了历史时刻,又保留了足够大的解释空间。 对模型公司和AI产业链而言,“AGI”首先是一种强大的产品叙事。 模型能力的真实进步通常是零散而不均匀的。准确描述这些变化,需要一长串评测、条件和限定语。 “AGI时代来了”却可以把一切压缩成一句话。 它把一次模型发布从产品升级变成历史节点,也把算力投入、技术路线和商业前景组织进同一个故事。 对于争夺用户、企业客户、人才和资本的公司来说,这种叙事的价值,或许并不亚于一次模型能力的重大突破。 黄仁勋的表态,也不能脱离这个叙事框架来理解。 2025年9月,英伟达与OpenAI宣布达成战略合作意向。按照当时公布的计划,OpenAI将部署至少10吉瓦的英伟达系统,规模相当于数百万颗GPU;英伟达则准备随着基础设施逐步落地,向OpenAI投资最高1000亿美元。 这是一份意向书,并非已经全部落地的最终协议,后续也一度传出方案可能调整。 但在最初的合作设想中,英伟达被定位为OpenAI扩建AI基础设施时的首选计算与网络合作伙伴。双方在公告中直接表示,这些设施将服务于OpenAI“迈向部署超级智能”的路径。 近期,黄仁勋在宣布“AGI已经到来”的同时,专门提到训练Astra所使用的英伟达计算系统,以及下一批即将上线的GPU。 整段话隐含着一条完整的因果链:大规模算力投入带来了智能跃迁,因此更大规模的算力投入仍然必要。 作为全球AI算力扩张的主要受益者,英伟达当然有理由强调这是一场时代转折。 事实上,这也不是黄仁勋第一次宣布AGI到来。 2024年,他曾表示,如果把AGI定义为能够通过几乎所有人类设计的考试,那么这一目标可能在五年内实现。 到2026年3月,他又在Lex Fridman的播客中表示:“我认为我们已经实现了AGI。” 这么看来,AGI不仅是一个等待技术跨越的终点,也是一种能够影响资本、市场、政策和产业预期的叙事资源。 至于AGI怎样才算真的来了?是一次模型发布、一项评测纪录,还是一家公司的宣告? 也可能,这就是一个所有人都身处其中、潜移默化的过程。 正如知名AI研究者、OpenAI创始成员Andrej Karpathy提出的一个判断,AGI不会带来一条陡然拐起的曲线,它会平滑地融进已有的增长里,事后你甚至找不到拐点在哪。 本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。如对本稿件有异议或投诉,请联系 tougao@huxiu.com。 本文来自虎嗅,原文链接:https://www.huxiu.com/article/4889598.html?f=wyxwapp 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 每日经济新闻 2026-06-02 06:05:39 财联社 2026-06-26 06:55:01 36氪 2026-09-07 14:32:58 新智元 2026-09-09 06:18:46 量子位 2026-09-07 16:33:45 每日经济新闻 2026-07-28 16:03:44 虎嗅APP 2026-09-09 03:06:12 经济观察报 2026-09-07 20:40:15 智东西 2026-09-08 23:35:50 酱本增笑 2026-09-07 11:17:43 大春不一样 2026-09-07 03:08:18 极目新闻 2026-09-08 09:05:24 财联社 2026-09-09 03:41:03 都市快报橙柿互动 2026-09-08 13:29:54 上观新闻 2026-09-08 09:04:25 机器之心Pro 2026-09-06 16:00:04 正和远景 2026-09-07 15:23:45 快科技 2026-09-06 21:34:46 奇葩街坊故事会 2026-09-07 13:21:38 网易科技态度见闻 2026-09-08 17:08:18 爱看头条 2026-09-08 20:16:08 星河佰E际 2026-09-09 01:38:15 拳击格斗大放送 2026-09-08 13:12:57 每日经济新闻 2026-06-07 04:19:46 36氪 2026-06-19 17:24:18 邻家二蛋不靠谱 2026-09-08 01:41:02 人民网 2026-09-09 06:24:41 中国经济网 2026-09-08 11:11:11 潇湘晨报 2026-09-08 19:10:47 新京报 2026-09-08 08:06:25 天天汽车 2026-09-05 16:21:57 游戏茶馆 2026-09-07 09:40:51 财联社 2026-08-25 16:33:12 鲨鲨笑场 2026-09-05 11:12:05 甜份超标的我 2026-09-09 02:19:36 左脚爆射得分 2026-09-08 17:54:49 鲁中晨报 2026-09-06 15:47:03 北纬的咖啡豆 2026-09-09 07:04:49 36氪 2026-09-08 16:25:32 武汉发布 2026-09-08 10:47:56
AGI 怎样才算真的来了? 本文来自微信公众号: 深流研究所 ,作者:吴绛枫 9月3日,OpenAI总裁格雷格·布罗克曼在发布新模型GPT-6 Astra后,抛出了一句话:“欢迎来到AGI时代。” 三天后,黄仁勋在社交平台上把话说得更直接:“从ChatGPT到o1,再到GPT-6 Astra,只用了四年。AGI已经到来。” 众所期待的AGI,就这么突然被宣布实现了? GPT-6 Astra发布前不久,OpenAI CEO山姆·奥尔特曼还在说,AGI是一个“定义极其模糊的词”,甚至差点称它为“无关紧要的营销术语”。 负责GPT-6 Astra关键评测的ARC Prize团队也专门提醒:GPT-6 Astra确实代表了通用化能力的重要进步,但“我们并不声称它就是AGI”。 一边是“欢迎来到AGI时代”,一边是“我们没有说这是AGI”。 今天,谁都在谈AGI,却没有谁能说清楚:AI究竟要做到什么,才算真正越过了AGI这条线。 先来看看GPT-6 Astra最令人咋舌的成绩,是在ARC-AGI-3上拿到99.9%。 ARC-AGI与普通评测不太一样。它不会直接告诉模型规则,而是把模型放进陌生环境,让模型自己判断目标、理解反馈,再找到解决办法。 这项评测试图衡量的,正是当前AI最受质疑的一种能力:面对没见过的问题,能不能现场学会。 99.9%的得分当然惊人。但这个数字有一个常被省略的前提。 在ARC Prize统一提供的标准测试框架中,GPT-6 Astra得分为62.7%;接入OpenAI提供的专用适配框架后,得分才上升到99.9%。 后者允许模型保留跨请求的隐藏推理状态,并利用上下文压缩延续此前的探索经验。 我们无法把OpenAI这项操作简单归类为“作弊”。毕竟,现实中的AI本来就不会裸机运行。记忆、工具和运行框架都可能成为智能系统的一部分。 问题在于,62.7%测量的更接近单个模型的能力;99.9%测量的则是一套经过专门优化的完整系统。 两项成绩都是真的,却不能混为一谈。更不能把99.9%的测试得分,顺手换算成“99.9%的AGI”。 此外,GPT-6 Astra在其他评测上的表现,也没有呈现出一个无懈可击的通才形象。 它在高难数学测试FrontierMath Tier 4上达到97.6%,在计算机操作测试OSWorld 2.0上得到72.6%;但到了更接近真实办公流程的AutomationBench,成绩降至41.4%,在复杂专业任务测试Agents’Last Exam上也只有59.3%。 这些数字真正说明的是,当任务规则清晰、答案可以验证时,Astra已经能够逼近甚至超过人类;一旦进入流程冗长、目标模糊的现实环境,它仍然会频繁失败。 深蓝击败国际象棋世界冠军,Watson赢下《危险边缘》,AlphaGo走出“神之一手”时,人们都曾短暂地产生过类似的错觉:既然机器已经征服了如此复杂的任务,通用智能大概也不远了。 规则明确、反馈即时、有自动裁判的世界,与现实生活并不是一回事。 OpenAI采用了最具经济导向的定义。其在2018年发布的公司章程将AGI描述为“在大多数具有经济价值的工作上超越人类的高度自主系统”。 这一定义包含三个关键条件——覆盖广泛的工作、表现超过人类、能够高度自主运行。 现实工作中的产出构成了核心尺度。意识、情感和人类式思维并未被列为必要条件。 这一标准与OpenAI近年的产品路线高度契合。 推理模型提升复杂任务的处理能力,智能体强化工具调用和计算机操作,Codex等产品进一步进入软件开发流程。 各项能力最终汇向同一个目标:让AI承担更完整的工作,并将模型能力转化为可规模化部署的生产力。 Anthropic对AGI的处理方式更加谨慎。CEO达里奥·阿莫迪认为,这个词承载了过多模糊含义,因此更常使用“强大的AI”。 在2024年10月发表的《Machines of Loving Grace》中,阿莫迪描述了一类具体系统: 它在多数重要领域达到或超过顶尖专家水平,能够独立完成持续数小时、数天乃至数周的任务,还可以复制成数百万个实例,以远高于人类的速度同时工作。 这幅图景包含能力、自主性和复制规模三个变量。三者共同决定AI的现实影响,也会同步放大滥用、失控和系统性风险。 基于这一判断,Anthropic将能力扩展与风险治理绑定。公司的战略重点可以概括为:保持前沿模型竞争力,同时让安全保障随能力等级同步升级。 Google DeepMind关注的,则是AGI的测量标准。 其2023年发布的《Levels of AGI》文章,以“性能”和“通用性”为两条主轴,将通用智能划分为“新兴”“胜任”“专家”“大师”和“超人类”五个等级,并把自主性作为独立维度处理。这套框架要求研究者同时考察能力强度和覆盖范围。 2026年3月,DeepMind进一步发布认知分类框架,将通用智能拆分为感知、生成、注意力、学习、记忆、推理、元认知、执行功能、问题解决和社会认知十个维度。 评估流程使用未公开测试集、具有代表性的人类样本,以及模型相对于人类能力分布的位置。 DeepMind还与Kaggle设立20万美元奖金,为其中五个评测较薄弱的维度征集测试方案。 这套思路把AGI从单一标签转化为可比较的认知能力图谱,也体现了DeepMind的研究取向:建立统一尺度,识别能力缺口,再据此组织评测和研发。 采用什么标准,就会把什么能力视为关键进展;把什么能力视为关键进展,就会决定一家公司的产品路线、资源配置和安全重点。 ■为什么说“AGI是否到来”,成了一场叙事之争? 人们总是习惯把技术革命想象成一个明确的瞬间。 莱特兄弟的飞机离开地面,第一颗原子弹爆炸,阿波罗11号登上月球。 回到当下的AGI到来之争,“GPT-6 Astra就是AGI”与“我们进入了AGI时代”,其实是两种不同性质的表达。 前者是可以被质疑和检验的技术结论:既然它是AGI,就应当说明采用了什么定义、满足了哪些条件,又在哪些测试中得到独立验证。 后者则更像一种时代判断。布罗克曼说的正是“欢迎来到AGI时代”。这种表述既制造了历史时刻,又保留了足够大的解释空间。 对模型公司和AI产业链而言,“AGI”首先是一种强大的产品叙事。 模型能力的真实进步通常是零散而不均匀的。准确描述这些变化,需要一长串评测、条件和限定语。 “AGI时代来了”却可以把一切压缩成一句话。 它把一次模型发布从产品升级变成历史节点,也把算力投入、技术路线和商业前景组织进同一个故事。 对于争夺用户、企业客户、人才和资本的公司来说,这种叙事的价值,或许并不亚于一次模型能力的重大突破。 黄仁勋的表态,也不能脱离这个叙事框架来理解。 2025年9月,英伟达与OpenAI宣布达成战略合作意向。按照当时公布的计划,OpenAI将部署至少10吉瓦的英伟达系统,规模相当于数百万颗GPU;英伟达则准备随着基础设施逐步落地,向OpenAI投资最高1000亿美元。 这是一份意向书,并非已经全部落地的最终协议,后续也一度传出方案可能调整。 但在最初的合作设想中,英伟达被定位为OpenAI扩建AI基础设施时的首选计算与网络合作伙伴。双方在公告中直接表示,这些设施将服务于OpenAI“迈向部署超级智能”的路径。 近期,黄仁勋在宣布“AGI已经到来”的同时,专门提到训练Astra所使用的英伟达计算系统,以及下一批即将上线的GPU。 整段话隐含着一条完整的因果链:大规模算力投入带来了智能跃迁,因此更大规模的算力投入仍然必要。 作为全球AI算力扩张的主要受益者,英伟达当然有理由强调这是一场时代转折。 事实上,这也不是黄仁勋第一次宣布AGI到来。 2024年,他曾表示,如果把AGI定义为能够通过几乎所有人类设计的考试,那么这一目标可能在五年内实现。 到2026年3月,他又在Lex Fridman的播客中表示:“我认为我们已经实现了AGI。” 这么看来,AGI不仅是一个等待技术跨越的终点,也是一种能够影响资本、市场、政策和产业预期的叙事资源。 至于AGI怎样才算真的来了?是一次模型发布、一项评测纪录,还是一家公司的宣告? 也可能,这就是一个所有人都身处其中、潜移默化的过程。 正如知名AI研究者、OpenAI创始成员Andrej Karpathy提出的一个判断,AGI不会带来一条陡然拐起的曲线,它会平滑地融进已有的增长里,事后你甚至找不到拐点在哪。 本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。如对本稿件有异议或投诉,请联系 tougao@huxiu.com。 本文来自虎嗅,原文链接:https://www.huxiu.com/article/4889598.html?f=wyxwapp 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 每日经济新闻 2026-06-02 06:05:39 财联社 2026-06-26 06:55:01 36氪 2026-09-07 14:32:58 新智元 2026-09-09 06:18:46 量子位 2026-09-07 16:33:45 每日经济新闻 2026-07-28 16:03:44 虎嗅APP 2026-09-09 03:06:12 经济观察报 2026-09-07 20:40:15 智东西 2026-09-08 23:35:50 酱本增笑 2026-09-07 11:17:43 大春不一样 2026-09-07 03:08:18 极目新闻 2026-09-08 09:05:24 财联社 2026-09-09 03:41:03 都市快报橙柿互动 2026-09-08 13:29:54 上观新闻 2026-09-08 09:04:25 机器之心Pro 2026-09-06 16:00:04 正和远景 2026-09-07 15:23:45 快科技 2026-09-06 21:34:46 奇葩街坊故事会 2026-09-07 13:21:38 网易科技态度见闻 2026-09-08 17:08:18 爱看头条 2026-09-08 20:16:08 星河佰E际 2026-09-09 01:38:15 拳击格斗大放送 2026-09-08 13:12:57 每日经济新闻 2026-06-07 04:19:46 36氪 2026-06-19 17:24:18 邻家二蛋不靠谱 2026-09-08 01:41:02 人民网 2026-09-09 06:24:41 中国经济网 2026-09-08 11:11:11 潇湘晨报 2026-09-08 19:10:47 新京报 2026-09-08 08:06:25 天天汽车 2026-09-05 16:21:57 游戏茶馆 2026-09-07 09:40:51 财联社 2026-08-25 16:33:12 鲨鲨笑场 2026-09-05 11:12:05 甜份超标的我 2026-09-09 02:19:36 左脚爆射得分 2026-09-08 17:54:49 鲁中晨报 2026-09-06 15:47:03 北纬的咖啡豆 2026-09-09 07:04:49 36氪 2026-09-08 16:25:32 武汉发布 2026-09-08 10:47:56
AGI 怎样才算真的来了? 本文来自微信公众号: 深流研究所 ,作者:吴绛枫 9月3日,OpenAI总裁格雷格·布罗克曼在发布新模型GPT-6 Astra后,抛出了一句话:“欢迎来到AGI时代。” 三天后,黄仁勋在社交平台上把话说得更直接:“从ChatGPT到o1,再到GPT-6 Astra,只用了四年。AGI已经到来。” 众所期待的AGI,就这么突然被宣布实现了? GPT-6 Astra发布前不久,OpenAI CEO山姆·奥尔特曼还在说,AGI是一个“定义极其模糊的词”,甚至差点称它为“无关紧要的营销术语”。 负责GPT-6 Astra关键评测的ARC Prize团队也专门提醒:GPT-6 Astra确实代表了通用化能力的重要进步,但“我们并不声称它就是AGI”。 一边是“欢迎来到AGI时代”,一边是“我们没有说这是AGI”。 今天,谁都在谈AGI,却没有谁能说清楚:AI究竟要做到什么,才算真正越过了AGI这条线。 先来看看GPT-6 Astra最令人咋舌的成绩,是在ARC-AGI-3上拿到99.9%。 ARC-AGI与普通评测不太一样。它不会直接告诉模型规则,而是把模型放进陌生环境,让模型自己判断目标、理解反馈,再找到解决办法。 这项评测试图衡量的,正是当前AI最受质疑的一种能力:面对没见过的问题,能不能现场学会。 99.9%的得分当然惊人。但这个数字有一个常被省略的前提。 在ARC Prize统一提供的标准测试框架中,GPT-6 Astra得分为62.7%;接入OpenAI提供的专用适配框架后,得分才上升到99.9%。 后者允许模型保留跨请求的隐藏推理状态,并利用上下文压缩延续此前的探索经验。 我们无法把OpenAI这项操作简单归类为“作弊”。毕竟,现实中的AI本来就不会裸机运行。记忆、工具和运行框架都可能成为智能系统的一部分。 问题在于,62.7%测量的更接近单个模型的能力;99.9%测量的则是一套经过专门优化的完整系统。 两项成绩都是真的,却不能混为一谈。更不能把99.9%的测试得分,顺手换算成“99.9%的AGI”。 此外,GPT-6 Astra在其他评测上的表现,也没有呈现出一个无懈可击的通才形象。 它在高难数学测试FrontierMath Tier 4上达到97.6%,在计算机操作测试OSWorld 2.0上得到72.6%;但到了更接近真实办公流程的AutomationBench,成绩降至41.4%,在复杂专业任务测试Agents’Last Exam上也只有59.3%。 这些数字真正说明的是,当任务规则清晰、答案可以验证时,Astra已经能够逼近甚至超过人类;一旦进入流程冗长、目标模糊的现实环境,它仍然会频繁失败。 深蓝击败国际象棋世界冠军,Watson赢下《危险边缘》,AlphaGo走出“神之一手”时,人们都曾短暂地产生过类似的错觉:既然机器已经征服了如此复杂的任务,通用智能大概也不远了。 规则明确、反馈即时、有自动裁判的世界,与现实生活并不是一回事。 OpenAI采用了最具经济导向的定义。其在2018年发布的公司章程将AGI描述为“在大多数具有经济价值的工作上超越人类的高度自主系统”。 这一定义包含三个关键条件——覆盖广泛的工作、表现超过人类、能够高度自主运行。 现实工作中的产出构成了核心尺度。意识、情感和人类式思维并未被列为必要条件。 这一标准与OpenAI近年的产品路线高度契合。 推理模型提升复杂任务的处理能力,智能体强化工具调用和计算机操作,Codex等产品进一步进入软件开发流程。 各项能力最终汇向同一个目标:让AI承担更完整的工作,并将模型能力转化为可规模化部署的生产力。 Anthropic对AGI的处理方式更加谨慎。CEO达里奥·阿莫迪认为,这个词承载了过多模糊含义,因此更常使用“强大的AI”。 在2024年10月发表的《Machines of Loving Grace》中,阿莫迪描述了一类具体系统: 它在多数重要领域达到或超过顶尖专家水平,能够独立完成持续数小时、数天乃至数周的任务,还可以复制成数百万个实例,以远高于人类的速度同时工作。 这幅图景包含能力、自主性和复制规模三个变量。三者共同决定AI的现实影响,也会同步放大滥用、失控和系统性风险。 基于这一判断,Anthropic将能力扩展与风险治理绑定。公司的战略重点可以概括为:保持前沿模型竞争力,同时让安全保障随能力等级同步升级。 Google DeepMind关注的,则是AGI的测量标准。 其2023年发布的《Levels of AGI》文章,以“性能”和“通用性”为两条主轴,将通用智能划分为“新兴”“胜任”“专家”“大师”和“超人类”五个等级,并把自主性作为独立维度处理。这套框架要求研究者同时考察能力强度和覆盖范围。 2026年3月,DeepMind进一步发布认知分类框架,将通用智能拆分为感知、生成、注意力、学习、记忆、推理、元认知、执行功能、问题解决和社会认知十个维度。 评估流程使用未公开测试集、具有代表性的人类样本,以及模型相对于人类能力分布的位置。 DeepMind还与Kaggle设立20万美元奖金,为其中五个评测较薄弱的维度征集测试方案。 这套思路把AGI从单一标签转化为可比较的认知能力图谱,也体现了DeepMind的研究取向:建立统一尺度,识别能力缺口,再据此组织评测和研发。 采用什么标准,就会把什么能力视为关键进展;把什么能力视为关键进展,就会决定一家公司的产品路线、资源配置和安全重点。 ■为什么说“AGI是否到来”,成了一场叙事之争? 人们总是习惯把技术革命想象成一个明确的瞬间。 莱特兄弟的飞机离开地面,第一颗原子弹爆炸,阿波罗11号登上月球。 回到当下的AGI到来之争,“GPT-6 Astra就是AGI”与“我们进入了AGI时代”,其实是两种不同性质的表达。 前者是可以被质疑和检验的技术结论:既然它是AGI,就应当说明采用了什么定义、满足了哪些条件,又在哪些测试中得到独立验证。 后者则更像一种时代判断。布罗克曼说的正是“欢迎来到AGI时代”。这种表述既制造了历史时刻,又保留了足够大的解释空间。 对模型公司和AI产业链而言,“AGI”首先是一种强大的产品叙事。 模型能力的真实进步通常是零散而不均匀的。准确描述这些变化,需要一长串评测、条件和限定语。 “AGI时代来了”却可以把一切压缩成一句话。 它把一次模型发布从产品升级变成历史节点,也把算力投入、技术路线和商业前景组织进同一个故事。 对于争夺用户、企业客户、人才和资本的公司来说,这种叙事的价值,或许并不亚于一次模型能力的重大突破。 黄仁勋的表态,也不能脱离这个叙事框架来理解。 2025年9月,英伟达与OpenAI宣布达成战略合作意向。按照当时公布的计划,OpenAI将部署至少10吉瓦的英伟达系统,规模相当于数百万颗GPU;英伟达则准备随着基础设施逐步落地,向OpenAI投资最高1000亿美元。 这是一份意向书,并非已经全部落地的最终协议,后续也一度传出方案可能调整。 但在最初的合作设想中,英伟达被定位为OpenAI扩建AI基础设施时的首选计算与网络合作伙伴。双方在公告中直接表示,这些设施将服务于OpenAI“迈向部署超级智能”的路径。 近期,黄仁勋在宣布“AGI已经到来”的同时,专门提到训练Astra所使用的英伟达计算系统,以及下一批即将上线的GPU。 整段话隐含着一条完整的因果链:大规模算力投入带来了智能跃迁,因此更大规模的算力投入仍然必要。 作为全球AI算力扩张的主要受益者,英伟达当然有理由强调这是一场时代转折。 事实上,这也不是黄仁勋第一次宣布AGI到来。 2024年,他曾表示,如果把AGI定义为能够通过几乎所有人类设计的考试,那么这一目标可能在五年内实现。 到2026年3月,他又在Lex Fridman的播客中表示:“我认为我们已经实现了AGI。” 这么看来,AGI不仅是一个等待技术跨越的终点,也是一种能够影响资本、市场、政策和产业预期的叙事资源。 至于AGI怎样才算真的来了?是一次模型发布、一项评测纪录,还是一家公司的宣告? 也可能,这就是一个所有人都身处其中、潜移默化的过程。 正如知名AI研究者、OpenAI创始成员Andrej Karpathy提出的一个判断,AGI不会带来一条陡然拐起的曲线,它会平滑地融进已有的增长里,事后你甚至找不到拐点在哪。 本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。如对本稿件有异议或投诉,请联系 tougao@huxiu.com。 本文来自虎嗅,原文链接:https://www.huxiu.com/article/4889598.html?f=wyxwapp 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 每日经济新闻 2026-06-02 06:05:39 财联社 2026-06-26 06:55:01 36氪 2026-09-07 14:32:58 新智元 2026-09-09 06:18:46 量子位 2026-09-07 16:33:45 每日经济新闻 2026-07-28 16:03:44 虎嗅APP 2026-09-09 03:06:12 经济观察报 2026-09-07 20:40:15 智东西 2026-09-08 23:35:50 酱本增笑 2026-09-07 11:17:43 大春不一样 2026-09-07 03:08:18 极目新闻 2026-09-08 09:05:24 财联社 2026-09-09 03:41:03 都市快报橙柿互动 2026-09-08 13:29:54 上观新闻 2026-09-08 09:04:25 机器之心Pro 2026-09-06 16:00:04 正和远景 2026-09-07 15:23:45 快科技 2026-09-06 21:34:46 奇葩街坊故事会 2026-09-07 13:21:38 网易科技态度见闻 2026-09-08 17:08:18 爱看头条 2026-09-08 20:16:08 星河佰E际 2026-09-09 01:38:15 拳击格斗大放送 2026-09-08 13:12:57 每日经济新闻 2026-06-07 04:19:46 36氪 2026-06-19 17:24:18 邻家二蛋不靠谱 2026-09-08 01:41:02 人民网 2026-09-09 06:24:41 中国经济网 2026-09-08 11:11:11 潇湘晨报 2026-09-08 19:10:47 新京报 2026-09-08 08:06:25 天天汽车 2026-09-05 16:21:57 游戏茶馆 2026-09-07 09:40:51 财联社 2026-08-25 16:33:12 鲨鲨笑场 2026-09-05 11:12:05 甜份超标的我 2026-09-09 02:19:36 左脚爆射得分 2026-09-08 17:54:49 鲁中晨报 2026-09-06 15:47:03 北纬的咖啡豆 2026-09-09 07:04:49 36氪 2026-09-08 16:25:32 武汉发布 2026-09-08 10:47:56
俄罗斯要求关闭德国驻圣彼得堡总领事馆-4ce61ac4
涩多多网站在线观看视频网站入口AGI 怎样才算真的来了? 本文来自微信公众号: 深流研究所 ,作者:吴绛枫 9月3日,OpenAI总裁格雷格·布罗克曼在发布新模型GPT-6 Astra后,抛出了一句话:“欢迎来到AGI时代。” 三天后,黄仁勋在社交平台上把话说得更直接:“从ChatGPT到o1,再到GPT-6 Astra,只用了四年。AGI已经到来。” 众所期待的AGI,就这么突然被宣布实现了? GPT-6 Astra发布前不久,OpenAI CEO山姆·奥尔特曼还在说,AGI是一个“定义极其模糊的词”,甚至差点称它为“无关紧要的营销术语”。 负责GPT-6 Astra关键评测的ARC Prize团队也专门提醒:GPT-6 Astra确实代表了通用化能力的重要进步,但“我们并不声称它就是AGI”。 一边是“欢迎来到AGI时代”,一边是“我们没有说这是AGI”。 今天,谁都在谈AGI,却没有谁能说清楚:AI究竟要做到什么,才算真正越过了AGI这条线。 先来看看GPT-6 Astra最令人咋舌的成绩,是在ARC-AGI-3上拿到99.9%。 ARC-AGI与普通评测不太一样。它不会直接告诉模型规则,而是把模型放进陌生环境,让模型自己判断目标、理解反馈,再找到解决办法。 这项评测试图衡量的,正是当前AI最受质疑的一种能力:面对没见过的问题,能不能现场学会。 99.9%的得分当然惊人。但这个数字有一个常被省略的前提。 在ARC Prize统一提供的标准测试框架中,GPT-6 Astra得分为62.7%;接入OpenAI提供的专用适配框架后,得分才上升到99.9%。 后者允许模型保留跨请求的隐藏推理状态,并利用上下文压缩延续此前的探索经验。 我们无法把OpenAI这项操作简单归类为“作弊”。毕竟,现实中的AI本来就不会裸机运行。记忆、工具和运行框架都可能成为智能系统的一部分。 问题在于,62.7%测量的更接近单个模型的能力;99.9%测量的则是一套经过专门优化的完整系统。 两项成绩都是真的,却不能混为一谈。更不能把99.9%的测试得分,顺手换算成“99.9%的AGI”。 此外,GPT-6 Astra在其他评测上的表现,也没有呈现出一个无懈可击的通才形象。 它在高难数学测试FrontierMath Tier 4上达到97.6%,在计算机操作测试OSWorld 2.0上得到72.6%;但到了更接近真实办公流程的AutomationBench,成绩降至41.4%,在复杂专业任务测试Agents’Last Exam上也只有59.3%。 这些数字真正说明的是,当任务规则清晰、答案可以验证时,Astra已经能够逼近甚至超过人类;一旦进入流程冗长、目标模糊的现实环境,它仍然会频繁失败。 深蓝击败国际象棋世界冠军,Watson赢下《危险边缘》,AlphaGo走出“神之一手”时,人们都曾短暂地产生过类似的错觉:既然机器已经征服了如此复杂的任务,通用智能大概也不远了。 规则明确、反馈即时、有自动裁判的世界,与现实生活并不是一回事。 OpenAI采用了最具经济导向的定义。其在2018年发布的公司章程将AGI描述为“在大多数具有经济价值的工作上超越人类的高度自主系统”。 这一定义包含三个关键条件——覆盖广泛的工作、表现超过人类、能够高度自主运行。 现实工作中的产出构成了核心尺度。意识、情感和人类式思维并未被列为必要条件。 这一标准与OpenAI近年的产品路线高度契合。 推理模型提升复杂任务的处理能力,智能体强化工具调用和计算机操作,Codex等产品进一步进入软件开发流程。 各项能力最终汇向同一个目标:让AI承担更完整的工作,并将模型能力转化为可规模化部署的生产力。 Anthropic对AGI的处理方式更加谨慎。CEO达里奥·阿莫迪认为,这个词承载了过多模糊含义,因此更常使用“强大的AI”。 在2024年10月发表的《Machines of Loving Grace》中,阿莫迪描述了一类具体系统: 它在多数重要领域达到或超过顶尖专家水平,能够独立完成持续数小时、数天乃至数周的任务,还可以复制成数百万个实例,以远高于人类的速度同时工作。 这幅图景包含能力、自主性和复制规模三个变量。三者共同决定AI的现实影响,也会同步放大滥用、失控和系统性风险。 基于这一判断,Anthropic将能力扩展与风险治理绑定。公司的战略重点可以概括为:保持前沿模型竞争力,同时让安全保障随能力等级同步升级。 Google DeepMind关注的,则是AGI的测量标准。 其2023年发布的《Levels of AGI》文章,以“性能”和“通用性”为两条主轴,将通用智能划分为“新兴”“胜任”“专家”“大师”和“超人类”五个等级,并把自主性作为独立维度处理。这套框架要求研究者同时考察能力强度和覆盖范围。 2026年3月,DeepMind进一步发布认知分类框架,将通用智能拆分为感知、生成、注意力、学习、记忆、推理、元认知、执行功能、问题解决和社会认知十个维度。 评估流程使用未公开测试集、具有代表性的人类样本,以及模型相对于人类能力分布的位置。 DeepMind还与Kaggle设立20万美元奖金,为其中五个评测较薄弱的维度征集测试方案。 这套思路把AGI从单一标签转化为可比较的认知能力图谱,也体现了DeepMind的研究取向:建立统一尺度,识别能力缺口,再据此组织评测和研发。 采用什么标准,就会把什么能力视为关键进展;把什么能力视为关键进展,就会决定一家公司的产品路线、资源配置和安全重点。 ■为什么说“AGI是否到来”,成了一场叙事之争? 人们总是习惯把技术革命想象成一个明确的瞬间。 莱特兄弟的飞机离开地面,第一颗原子弹爆炸,阿波罗11号登上月球。 回到当下的AGI到来之争,“GPT-6 Astra就是AGI”与“我们进入了AGI时代”,其实是两种不同性质的表达。 前者是可以被质疑和检验的技术结论:既然它是AGI,就应当说明采用了什么定义、满足了哪些条件,又在哪些测试中得到独立验证。 后者则更像一种时代判断。布罗克曼说的正是“欢迎来到AGI时代”。这种表述既制造了历史时刻,又保留了足够大的解释空间。 对模型公司和AI产业链而言,“AGI”首先是一种强大的产品叙事。 模型能力的真实进步通常是零散而不均匀的。准确描述这些变化,需要一长串评测、条件和限定语。 “AGI时代来了”却可以把一切压缩成一句话。 它把一次模型发布从产品升级变成历史节点,也把算力投入、技术路线和商业前景组织进同一个故事。 对于争夺用户、企业客户、人才和资本的公司来说,这种叙事的价值,或许并不亚于一次模型能力的重大突破。 黄仁勋的表态,也不能脱离这个叙事框架来理解。 2025年9月,英伟达与OpenAI宣布达成战略合作意向。按照当时公布的计划,OpenAI将部署至少10吉瓦的英伟达系统,规模相当于数百万颗GPU;英伟达则准备随着基础设施逐步落地,向OpenAI投资最高1000亿美元。 这是一份意向书,并非已经全部落地的最终协议,后续也一度传出方案可能调整。 但在最初的合作设想中,英伟达被定位为OpenAI扩建AI基础设施时的首选计算与网络合作伙伴。双方在公告中直接表示,这些设施将服务于OpenAI“迈向部署超级智能”的路径。 近期,黄仁勋在宣布“AGI已经到来”的同时,专门提到训练Astra所使用的英伟达计算系统,以及下一批即将上线的GPU。 整段话隐含着一条完整的因果链:大规模算力投入带来了智能跃迁,因此更大规模的算力投入仍然必要。 作为全球AI算力扩张的主要受益者,英伟达当然有理由强调这是一场时代转折。 事实上,这也不是黄仁勋第一次宣布AGI到来。 2024年,他曾表示,如果把AGI定义为能够通过几乎所有人类设计的考试,那么这一目标可能在五年内实现。 到2026年3月,他又在Lex Fridman的播客中表示:“我认为我们已经实现了AGI。” 这么看来,AGI不仅是一个等待技术跨越的终点,也是一种能够影响资本、市场、政策和产业预期的叙事资源。 至于AGI怎样才算真的来了?是一次模型发布、一项评测纪录,还是一家公司的宣告? 也可能,这就是一个所有人都身处其中、潜移默化的过程。 正如知名AI研究者、OpenAI创始成员Andrej Karpathy提出的一个判断,AGI不会带来一条陡然拐起的曲线,它会平滑地融进已有的增长里,事后你甚至找不到拐点在哪。 本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。如对本稿件有异议或投诉,请联系 tougao@huxiu.com。 本文来自虎嗅,原文链接:https://www.huxiu.com/article/4889598.html?f=wyxwapp 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 每日经济新闻 2026-06-02 06:05:39 财联社 2026-06-26 06:55:01 36氪 2026-09-07 14:32:58 新智元 2026-09-09 06:18:46 量子位 2026-09-07 16:33:45 每日经济新闻 2026-07-28 16:03:44 虎嗅APP 2026-09-09 03:06:12 经济观察报 2026-09-07 20:40:15 智东西 2026-09-08 23:35:50 酱本增笑 2026-09-07 11:17:43 大春不一样 2026-09-07 03:08:18 极目新闻 2026-09-08 09:05:24 财联社 2026-09-09 03:41:03 都市快报橙柿互动 2026-09-08 13:29:54 上观新闻 2026-09-08 09:04:25 机器之心Pro 2026-09-06 16:00:04 正和远景 2026-09-07 15:23:45 快科技 2026-09-06 21:34:46 奇葩街坊故事会 2026-09-07 13:21:38 网易科技态度见闻 2026-09-08 17:08:18 爱看头条 2026-09-08 20:16:08 星河佰E际 2026-09-09 01:38:15 拳击格斗大放送 2026-09-08 13:12:57 每日经济新闻 2026-06-07 04:19:46 36氪 2026-06-19 17:24:18 邻家二蛋不靠谱 2026-09-08 01:41:02 人民网 2026-09-09 06:24:41 中国经济网 2026-09-08 11:11:11 潇湘晨报 2026-09-08 19:10:47 新京报 2026-09-08 08:06:25 天天汽车 2026-09-05 16:21:57 游戏茶馆 2026-09-07 09:40:51 财联社 2026-08-25 16:33:12 鲨鲨笑场 2026-09-05 11:12:05 甜份超标的我 2026-09-09 02:19:36 左脚爆射得分 2026-09-08 17:54:49 鲁中晨报 2026-09-06 15:47:03 北纬的咖啡豆 2026-09-09 07:04:49 36氪 2026-09-08 16:25:32 武汉发布 2026-09-08 10:47:56
AGI 怎样才算真的来了? 本文来自微信公众号: 深流研究所 ,作者:吴绛枫 9月3日,OpenAI总裁格雷格·布罗克曼在发布新模型GPT-6 Astra后,抛出了一句话:“欢迎来到AGI时代。” 三天后,黄仁勋在社交平台上把话说得更直接:“从ChatGPT到o1,再到GPT-6 Astra,只用了四年。AGI已经到来。” 众所期待的AGI,就这么突然被宣布实现了? GPT-6 Astra发布前不久,OpenAI CEO山姆·奥尔特曼还在说,AGI是一个“定义极其模糊的词”,甚至差点称它为“无关紧要的营销术语”。 负责GPT-6 Astra关键评测的ARC Prize团队也专门提醒:GPT-6 Astra确实代表了通用化能力的重要进步,但“我们并不声称它就是AGI”。 一边是“欢迎来到AGI时代”,一边是“我们没有说这是AGI”。 今天,谁都在谈AGI,却没有谁能说清楚:AI究竟要做到什么,才算真正越过了AGI这条线。 先来看看GPT-6 Astra最令人咋舌的成绩,是在ARC-AGI-3上拿到99.9%。 ARC-AGI与普通评测不太一样。它不会直接告诉模型规则,而是把模型放进陌生环境,让模型自己判断目标、理解反馈,再找到解决办法。 这项评测试图衡量的,正是当前AI最受质疑的一种能力:面对没见过的问题,能不能现场学会。 99.9%的得分当然惊人。但这个数字有一个常被省略的前提。 在ARC Prize统一提供的标准测试框架中,GPT-6 Astra得分为62.7%;接入OpenAI提供的专用适配框架后,得分才上升到99.9%。 后者允许模型保留跨请求的隐藏推理状态,并利用上下文压缩延续此前的探索经验。 我们无法把OpenAI这项操作简单归类为“作弊”。毕竟,现实中的AI本来就不会裸机运行。记忆、工具和运行框架都可能成为智能系统的一部分。 问题在于,62.7%测量的更接近单个模型的能力;99.9%测量的则是一套经过专门优化的完整系统。 两项成绩都是真的,却不能混为一谈。更不能把99.9%的测试得分,顺手换算成“99.9%的AGI”。 此外,GPT-6 Astra在其他评测上的表现,也没有呈现出一个无懈可击的通才形象。 它在高难数学测试FrontierMath Tier 4上达到97.6%,在计算机操作测试OSWorld 2.0上得到72.6%;但到了更接近真实办公流程的AutomationBench,成绩降至41.4%,在复杂专业任务测试Agents’Last Exam上也只有59.3%。 这些数字真正说明的是,当任务规则清晰、答案可以验证时,Astra已经能够逼近甚至超过人类;一旦进入流程冗长、目标模糊的现实环境,它仍然会频繁失败。 深蓝击败国际象棋世界冠军,Watson赢下《危险边缘》,AlphaGo走出“神之一手”时,人们都曾短暂地产生过类似的错觉:既然机器已经征服了如此复杂的任务,通用智能大概也不远了。 规则明确、反馈即时、有自动裁判的世界,与现实生活并不是一回事。 OpenAI采用了最具经济导向的定义。其在2018年发布的公司章程将AGI描述为“在大多数具有经济价值的工作上超越人类的高度自主系统”。 这一定义包含三个关键条件——覆盖广泛的工作、表现超过人类、能够高度自主运行。 现实工作中的产出构成了核心尺度。意识、情感和人类式思维并未被列为必要条件。 这一标准与OpenAI近年的产品路线高度契合。 推理模型提升复杂任务的处理能力,智能体强化工具调用和计算机操作,Codex等产品进一步进入软件开发流程。 各项能力最终汇向同一个目标:让AI承担更完整的工作,并将模型能力转化为可规模化部署的生产力。 Anthropic对AGI的处理方式更加谨慎。CEO达里奥·阿莫迪认为,这个词承载了过多模糊含义,因此更常使用“强大的AI”。 在2024年10月发表的《Machines of Loving Grace》中,阿莫迪描述了一类具体系统: 它在多数重要领域达到或超过顶尖专家水平,能够独立完成持续数小时、数天乃至数周的任务,还可以复制成数百万个实例,以远高于人类的速度同时工作。 这幅图景包含能力、自主性和复制规模三个变量。三者共同决定AI的现实影响,也会同步放大滥用、失控和系统性风险。 基于这一判断,Anthropic将能力扩展与风险治理绑定。公司的战略重点可以概括为:保持前沿模型竞争力,同时让安全保障随能力等级同步升级。 Google DeepMind关注的,则是AGI的测量标准。 其2023年发布的《Levels of AGI》文章,以“性能”和“通用性”为两条主轴,将通用智能划分为“新兴”“胜任”“专家”“大师”和“超人类”五个等级,并把自主性作为独立维度处理。这套框架要求研究者同时考察能力强度和覆盖范围。 2026年3月,DeepMind进一步发布认知分类框架,将通用智能拆分为感知、生成、注意力、学习、记忆、推理、元认知、执行功能、问题解决和社会认知十个维度。 评估流程使用未公开测试集、具有代表性的人类样本,以及模型相对于人类能力分布的位置。 DeepMind还与Kaggle设立20万美元奖金,为其中五个评测较薄弱的维度征集测试方案。 这套思路把AGI从单一标签转化为可比较的认知能力图谱,也体现了DeepMind的研究取向:建立统一尺度,识别能力缺口,再据此组织评测和研发。 采用什么标准,就会把什么能力视为关键进展;把什么能力视为关键进展,就会决定一家公司的产品路线、资源配置和安全重点。 ■为什么说“AGI是否到来”,成了一场叙事之争? 人们总是习惯把技术革命想象成一个明确的瞬间。 莱特兄弟的飞机离开地面,第一颗原子弹爆炸,阿波罗11号登上月球。 回到当下的AGI到来之争,“GPT-6 Astra就是AGI”与“我们进入了AGI时代”,其实是两种不同性质的表达。 前者是可以被质疑和检验的技术结论:既然它是AGI,就应当说明采用了什么定义、满足了哪些条件,又在哪些测试中得到独立验证。 后者则更像一种时代判断。布罗克曼说的正是“欢迎来到AGI时代”。这种表述既制造了历史时刻,又保留了足够大的解释空间。 对模型公司和AI产业链而言,“AGI”首先是一种强大的产品叙事。 模型能力的真实进步通常是零散而不均匀的。准确描述这些变化,需要一长串评测、条件和限定语。 “AGI时代来了”却可以把一切压缩成一句话。 它把一次模型发布从产品升级变成历史节点,也把算力投入、技术路线和商业前景组织进同一个故事。 对于争夺用户、企业客户、人才和资本的公司来说,这种叙事的价值,或许并不亚于一次模型能力的重大突破。 黄仁勋的表态,也不能脱离这个叙事框架来理解。 2025年9月,英伟达与OpenAI宣布达成战略合作意向。按照当时公布的计划,OpenAI将部署至少10吉瓦的英伟达系统,规模相当于数百万颗GPU;英伟达则准备随着基础设施逐步落地,向OpenAI投资最高1000亿美元。 这是一份意向书,并非已经全部落地的最终协议,后续也一度传出方案可能调整。 但在最初的合作设想中,英伟达被定位为OpenAI扩建AI基础设施时的首选计算与网络合作伙伴。双方在公告中直接表示,这些设施将服务于OpenAI“迈向部署超级智能”的路径。 近期,黄仁勋在宣布“AGI已经到来”的同时,专门提到训练Astra所使用的英伟达计算系统,以及下一批即将上线的GPU。 整段话隐含着一条完整的因果链:大规模算力投入带来了智能跃迁,因此更大规模的算力投入仍然必要。 作为全球AI算力扩张的主要受益者,英伟达当然有理由强调这是一场时代转折。 事实上,这也不是黄仁勋第一次宣布AGI到来。 2024年,他曾表示,如果把AGI定义为能够通过几乎所有人类设计的考试,那么这一目标可能在五年内实现。 到2026年3月,他又在Lex Fridman的播客中表示:“我认为我们已经实现了AGI。” 这么看来,AGI不仅是一个等待技术跨越的终点,也是一种能够影响资本、市场、政策和产业预期的叙事资源。 至于AGI怎样才算真的来了?是一次模型发布、一项评测纪录,还是一家公司的宣告? 也可能,这就是一个所有人都身处其中、潜移默化的过程。 正如知名AI研究者、OpenAI创始成员Andrej Karpathy提出的一个判断,AGI不会带来一条陡然拐起的曲线,它会平滑地融进已有的增长里,事后你甚至找不到拐点在哪。 本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。如对本稿件有异议或投诉,请联系 tougao@huxiu.com。 本文来自虎嗅,原文链接:https://www.huxiu.com/article/4889598.html?f=wyxwapp 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 每日经济新闻 2026-06-02 06:05:39 财联社 2026-06-26 06:55:01 36氪 2026-09-07 14:32:58 新智元 2026-09-09 06:18:46 量子位 2026-09-07 16:33:45 每日经济新闻 2026-07-28 16:03:44 虎嗅APP 2026-09-09 03:06:12 经济观察报 2026-09-07 20:40:15 智东西 2026-09-08 23:35:50 酱本增笑 2026-09-07 11:17:43 大春不一样 2026-09-07 03:08:18 极目新闻 2026-09-08 09:05:24 财联社 2026-09-09 03:41:03 都市快报橙柿互动 2026-09-08 13:29:54 上观新闻 2026-09-08 09:04:25 机器之心Pro 2026-09-06 16:00:04 正和远景 2026-09-07 15:23:45 快科技 2026-09-06 21:34:46 奇葩街坊故事会 2026-09-07 13:21:38 网易科技态度见闻 2026-09-08 17:08:18 爱看头条 2026-09-08 20:16:08 星河佰E际 2026-09-09 01:38:15 拳击格斗大放送 2026-09-08 13:12:57 每日经济新闻 2026-06-07 04:19:46 36氪 2026-06-19 17:24:18 邻家二蛋不靠谱 2026-09-08 01:41:02 人民网 2026-09-09 06:24:41 中国经济网 2026-09-08 11:11:11 潇湘晨报 2026-09-08 19:10:47 新京报 2026-09-08 08:06:25 天天汽车 2026-09-05 16:21:57 游戏茶馆 2026-09-07 09:40:51 财联社 2026-08-25 16:33:12 鲨鲨笑场 2026-09-05 11:12:05 甜份超标的我 2026-09-09 02:19:36 左脚爆射得分 2026-09-08 17:54:49 鲁中晨报 2026-09-06 15:47:03 北纬的咖啡豆 2026-09-09 07:04:49 36氪 2026-09-08 16:25:32 武汉发布 2026-09-08 10:47:56
AGI 怎样才算真的来了? 本文来自微信公众号: 深流研究所 ,作者:吴绛枫 9月3日,OpenAI总裁格雷格·布罗克曼在发布新模型GPT-6 Astra后,抛出了一句话:“欢迎来到AGI时代。” 三天后,黄仁勋在社交平台上把话说得更直接:“从ChatGPT到o1,再到GPT-6 Astra,只用了四年。AGI已经到来。” 众所期待的AGI,就这么突然被宣布实现了? GPT-6 Astra发布前不久,OpenAI CEO山姆·奥尔特曼还在说,AGI是一个“定义极其模糊的词”,甚至差点称它为“无关紧要的营销术语”。 负责GPT-6 Astra关键评测的ARC Prize团队也专门提醒:GPT-6 Astra确实代表了通用化能力的重要进步,但“我们并不声称它就是AGI”。 一边是“欢迎来到AGI时代”,一边是“我们没有说这是AGI”。 今天,谁都在谈AGI,却没有谁能说清楚:AI究竟要做到什么,才算真正越过了AGI这条线。 先来看看GPT-6 Astra最令人咋舌的成绩,是在ARC-AGI-3上拿到99.9%。 ARC-AGI与普通评测不太一样。它不会直接告诉模型规则,而是把模型放进陌生环境,让模型自己判断目标、理解反馈,再找到解决办法。 这项评测试图衡量的,正是当前AI最受质疑的一种能力:面对没见过的问题,能不能现场学会。 99.9%的得分当然惊人。但这个数字有一个常被省略的前提。 在ARC Prize统一提供的标准测试框架中,GPT-6 Astra得分为62.7%;接入OpenAI提供的专用适配框架后,得分才上升到99.9%。 后者允许模型保留跨请求的隐藏推理状态,并利用上下文压缩延续此前的探索经验。 我们无法把OpenAI这项操作简单归类为“作弊”。毕竟,现实中的AI本来就不会裸机运行。记忆、工具和运行框架都可能成为智能系统的一部分。 问题在于,62.7%测量的更接近单个模型的能力;99.9%测量的则是一套经过专门优化的完整系统。 两项成绩都是真的,却不能混为一谈。更不能把99.9%的测试得分,顺手换算成“99.9%的AGI”。 此外,GPT-6 Astra在其他评测上的表现,也没有呈现出一个无懈可击的通才形象。 它在高难数学测试FrontierMath Tier 4上达到97.6%,在计算机操作测试OSWorld 2.0上得到72.6%;但到了更接近真实办公流程的AutomationBench,成绩降至41.4%,在复杂专业任务测试Agents’Last Exam上也只有59.3%。 这些数字真正说明的是,当任务规则清晰、答案可以验证时,Astra已经能够逼近甚至超过人类;一旦进入流程冗长、目标模糊的现实环境,它仍然会频繁失败。 深蓝击败国际象棋世界冠军,Watson赢下《危险边缘》,AlphaGo走出“神之一手”时,人们都曾短暂地产生过类似的错觉:既然机器已经征服了如此复杂的任务,通用智能大概也不远了。 规则明确、反馈即时、有自动裁判的世界,与现实生活并不是一回事。 OpenAI采用了最具经济导向的定义。其在2018年发布的公司章程将AGI描述为“在大多数具有经济价值的工作上超越人类的高度自主系统”。 这一定义包含三个关键条件——覆盖广泛的工作、表现超过人类、能够高度自主运行。 现实工作中的产出构成了核心尺度。意识、情感和人类式思维并未被列为必要条件。 这一标准与OpenAI近年的产品路线高度契合。 推理模型提升复杂任务的处理能力,智能体强化工具调用和计算机操作,Codex等产品进一步进入软件开发流程。 各项能力最终汇向同一个目标:让AI承担更完整的工作,并将模型能力转化为可规模化部署的生产力。 Anthropic对AGI的处理方式更加谨慎。CEO达里奥·阿莫迪认为,这个词承载了过多模糊含义,因此更常使用“强大的AI”。 在2024年10月发表的《Machines of Loving Grace》中,阿莫迪描述了一类具体系统: 它在多数重要领域达到或超过顶尖专家水平,能够独立完成持续数小时、数天乃至数周的任务,还可以复制成数百万个实例,以远高于人类的速度同时工作。 这幅图景包含能力、自主性和复制规模三个变量。三者共同决定AI的现实影响,也会同步放大滥用、失控和系统性风险。 基于这一判断,Anthropic将能力扩展与风险治理绑定。公司的战略重点可以概括为:保持前沿模型竞争力,同时让安全保障随能力等级同步升级。 Google DeepMind关注的,则是AGI的测量标准。 其2023年发布的《Levels of AGI》文章,以“性能”和“通用性”为两条主轴,将通用智能划分为“新兴”“胜任”“专家”“大师”和“超人类”五个等级,并把自主性作为独立维度处理。这套框架要求研究者同时考察能力强度和覆盖范围。 2026年3月,DeepMind进一步发布认知分类框架,将通用智能拆分为感知、生成、注意力、学习、记忆、推理、元认知、执行功能、问题解决和社会认知十个维度。 评估流程使用未公开测试集、具有代表性的人类样本,以及模型相对于人类能力分布的位置。 DeepMind还与Kaggle设立20万美元奖金,为其中五个评测较薄弱的维度征集测试方案。 这套思路把AGI从单一标签转化为可比较的认知能力图谱,也体现了DeepMind的研究取向:建立统一尺度,识别能力缺口,再据此组织评测和研发。 采用什么标准,就会把什么能力视为关键进展;把什么能力视为关键进展,就会决定一家公司的产品路线、资源配置和安全重点。 ■为什么说“AGI是否到来”,成了一场叙事之争? 人们总是习惯把技术革命想象成一个明确的瞬间。 莱特兄弟的飞机离开地面,第一颗原子弹爆炸,阿波罗11号登上月球。 回到当下的AGI到来之争,“GPT-6 Astra就是AGI”与“我们进入了AGI时代”,其实是两种不同性质的表达。 前者是可以被质疑和检验的技术结论:既然它是AGI,就应当说明采用了什么定义、满足了哪些条件,又在哪些测试中得到独立验证。 后者则更像一种时代判断。布罗克曼说的正是“欢迎来到AGI时代”。这种表述既制造了历史时刻,又保留了足够大的解释空间。 对模型公司和AI产业链而言,“AGI”首先是一种强大的产品叙事。 模型能力的真实进步通常是零散而不均匀的。准确描述这些变化,需要一长串评测、条件和限定语。 “AGI时代来了”却可以把一切压缩成一句话。 它把一次模型发布从产品升级变成历史节点,也把算力投入、技术路线和商业前景组织进同一个故事。 对于争夺用户、企业客户、人才和资本的公司来说,这种叙事的价值,或许并不亚于一次模型能力的重大突破。 黄仁勋的表态,也不能脱离这个叙事框架来理解。 2025年9月,英伟达与OpenAI宣布达成战略合作意向。按照当时公布的计划,OpenAI将部署至少10吉瓦的英伟达系统,规模相当于数百万颗GPU;英伟达则准备随着基础设施逐步落地,向OpenAI投资最高1000亿美元。 这是一份意向书,并非已经全部落地的最终协议,后续也一度传出方案可能调整。 但在最初的合作设想中,英伟达被定位为OpenAI扩建AI基础设施时的首选计算与网络合作伙伴。双方在公告中直接表示,这些设施将服务于OpenAI“迈向部署超级智能”的路径。 近期,黄仁勋在宣布“AGI已经到来”的同时,专门提到训练Astra所使用的英伟达计算系统,以及下一批即将上线的GPU。 整段话隐含着一条完整的因果链:大规模算力投入带来了智能跃迁,因此更大规模的算力投入仍然必要。 作为全球AI算力扩张的主要受益者,英伟达当然有理由强调这是一场时代转折。 事实上,这也不是黄仁勋第一次宣布AGI到来。 2024年,他曾表示,如果把AGI定义为能够通过几乎所有人类设计的考试,那么这一目标可能在五年内实现。 到2026年3月,他又在Lex Fridman的播客中表示:“我认为我们已经实现了AGI。” 这么看来,AGI不仅是一个等待技术跨越的终点,也是一种能够影响资本、市场、政策和产业预期的叙事资源。 至于AGI怎样才算真的来了?是一次模型发布、一项评测纪录,还是一家公司的宣告? 也可能,这就是一个所有人都身处其中、潜移默化的过程。 正如知名AI研究者、OpenAI创始成员Andrej Karpathy提出的一个判断,AGI不会带来一条陡然拐起的曲线,它会平滑地融进已有的增长里,事后你甚至找不到拐点在哪。 本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。如对本稿件有异议或投诉,请联系 tougao@huxiu.com。 本文来自虎嗅,原文链接:https://www.huxiu.com/article/4889598.html?f=wyxwapp 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 每日经济新闻 2026-06-02 06:05:39 财联社 2026-06-26 06:55:01 36氪 2026-09-07 14:32:58 新智元 2026-09-09 06:18:46 量子位 2026-09-07 16:33:45 每日经济新闻 2026-07-28 16:03:44 虎嗅APP 2026-09-09 03:06:12 经济观察报 2026-09-07 20:40:15 智东西 2026-09-08 23:35:50 酱本增笑 2026-09-07 11:17:43 大春不一样 2026-09-07 03:08:18 极目新闻 2026-09-08 09:05:24 财联社 2026-09-09 03:41:03 都市快报橙柿互动 2026-09-08 13:29:54 上观新闻 2026-09-08 09:04:25 机器之心Pro 2026-09-06 16:00:04 正和远景 2026-09-07 15:23:45 快科技 2026-09-06 21:34:46 奇葩街坊故事会 2026-09-07 13:21:38 网易科技态度见闻 2026-09-08 17:08:18 爱看头条 2026-09-08 20:16:08 星河佰E际 2026-09-09 01:38:15 拳击格斗大放送 2026-09-08 13:12:57 每日经济新闻 2026-06-07 04:19:46 36氪 2026-06-19 17:24:18 邻家二蛋不靠谱 2026-09-08 01:41:02 人民网 2026-09-09 06:24:41 中国经济网 2026-09-08 11:11:11 潇湘晨报 2026-09-08 19:10:47 新京报 2026-09-08 08:06:25 天天汽车 2026-09-05 16:21:57 游戏茶馆 2026-09-07 09:40:51 财联社 2026-08-25 16:33:12 鲨鲨笑场 2026-09-05 11:12:05 甜份超标的我 2026-09-09 02:19:36 左脚爆射得分 2026-09-08 17:54:49 鲁中晨报 2026-09-06 15:47:03 北纬的咖啡豆 2026-09-09 07:04:49 36氪 2026-09-08 16:25:32 武汉发布 2026-09-08 10:47:56
腾讯公关总监发文回应“微信视频号崩了”:好几个朋友第一时间就微信提醒我们-cc994830
涩多多网站在线观看视频网站入口AGI 怎样才算真的来了? 本文来自微信公众号: 深流研究所 ,作者:吴绛枫 9月3日,OpenAI总裁格雷格·布罗克曼在发布新模型GPT-6 Astra后,抛出了一句话:“欢迎来到AGI时代。” 三天后,黄仁勋在社交平台上把话说得更直接:“从ChatGPT到o1,再到GPT-6 Astra,只用了四年。AGI已经到来。” 众所期待的AGI,就这么突然被宣布实现了? GPT-6 Astra发布前不久,OpenAI CEO山姆·奥尔特曼还在说,AGI是一个“定义极其模糊的词”,甚至差点称它为“无关紧要的营销术语”。 负责GPT-6 Astra关键评测的ARC Prize团队也专门提醒:GPT-6 Astra确实代表了通用化能力的重要进步,但“我们并不声称它就是AGI”。 一边是“欢迎来到AGI时代”,一边是“我们没有说这是AGI”。 今天,谁都在谈AGI,却没有谁能说清楚:AI究竟要做到什么,才算真正越过了AGI这条线。 先来看看GPT-6 Astra最令人咋舌的成绩,是在ARC-AGI-3上拿到99.9%。 ARC-AGI与普通评测不太一样。它不会直接告诉模型规则,而是把模型放进陌生环境,让模型自己判断目标、理解反馈,再找到解决办法。 这项评测试图衡量的,正是当前AI最受质疑的一种能力:面对没见过的问题,能不能现场学会。 99.9%的得分当然惊人。但这个数字有一个常被省略的前提。 在ARC Prize统一提供的标准测试框架中,GPT-6 Astra得分为62.7%;接入OpenAI提供的专用适配框架后,得分才上升到99.9%。 后者允许模型保留跨请求的隐藏推理状态,并利用上下文压缩延续此前的探索经验。 我们无法把OpenAI这项操作简单归类为“作弊”。毕竟,现实中的AI本来就不会裸机运行。记忆、工具和运行框架都可能成为智能系统的一部分。 问题在于,62.7%测量的更接近单个模型的能力;99.9%测量的则是一套经过专门优化的完整系统。 两项成绩都是真的,却不能混为一谈。更不能把99.9%的测试得分,顺手换算成“99.9%的AGI”。 此外,GPT-6 Astra在其他评测上的表现,也没有呈现出一个无懈可击的通才形象。 它在高难数学测试FrontierMath Tier 4上达到97.6%,在计算机操作测试OSWorld 2.0上得到72.6%;但到了更接近真实办公流程的AutomationBench,成绩降至41.4%,在复杂专业任务测试Agents’Last Exam上也只有59.3%。 这些数字真正说明的是,当任务规则清晰、答案可以验证时,Astra已经能够逼近甚至超过人类;一旦进入流程冗长、目标模糊的现实环境,它仍然会频繁失败。 深蓝击败国际象棋世界冠军,Watson赢下《危险边缘》,AlphaGo走出“神之一手”时,人们都曾短暂地产生过类似的错觉:既然机器已经征服了如此复杂的任务,通用智能大概也不远了。 规则明确、反馈即时、有自动裁判的世界,与现实生活并不是一回事。 OpenAI采用了最具经济导向的定义。其在2018年发布的公司章程将AGI描述为“在大多数具有经济价值的工作上超越人类的高度自主系统”。 这一定义包含三个关键条件——覆盖广泛的工作、表现超过人类、能够高度自主运行。 现实工作中的产出构成了核心尺度。意识、情感和人类式思维并未被列为必要条件。 这一标准与OpenAI近年的产品路线高度契合。 推理模型提升复杂任务的处理能力,智能体强化工具调用和计算机操作,Codex等产品进一步进入软件开发流程。 各项能力最终汇向同一个目标:让AI承担更完整的工作,并将模型能力转化为可规模化部署的生产力。 Anthropic对AGI的处理方式更加谨慎。CEO达里奥·阿莫迪认为,这个词承载了过多模糊含义,因此更常使用“强大的AI”。 在2024年10月发表的《Machines of Loving Grace》中,阿莫迪描述了一类具体系统: 它在多数重要领域达到或超过顶尖专家水平,能够独立完成持续数小时、数天乃至数周的任务,还可以复制成数百万个实例,以远高于人类的速度同时工作。 这幅图景包含能力、自主性和复制规模三个变量。三者共同决定AI的现实影响,也会同步放大滥用、失控和系统性风险。 基于这一判断,Anthropic将能力扩展与风险治理绑定。公司的战略重点可以概括为:保持前沿模型竞争力,同时让安全保障随能力等级同步升级。 Google DeepMind关注的,则是AGI的测量标准。 其2023年发布的《Levels of AGI》文章,以“性能”和“通用性”为两条主轴,将通用智能划分为“新兴”“胜任”“专家”“大师”和“超人类”五个等级,并把自主性作为独立维度处理。这套框架要求研究者同时考察能力强度和覆盖范围。 2026年3月,DeepMind进一步发布认知分类框架,将通用智能拆分为感知、生成、注意力、学习、记忆、推理、元认知、执行功能、问题解决和社会认知十个维度。 评估流程使用未公开测试集、具有代表性的人类样本,以及模型相对于人类能力分布的位置。 DeepMind还与Kaggle设立20万美元奖金,为其中五个评测较薄弱的维度征集测试方案。 这套思路把AGI从单一标签转化为可比较的认知能力图谱,也体现了DeepMind的研究取向:建立统一尺度,识别能力缺口,再据此组织评测和研发。 采用什么标准,就会把什么能力视为关键进展;把什么能力视为关键进展,就会决定一家公司的产品路线、资源配置和安全重点。 ■为什么说“AGI是否到来”,成了一场叙事之争? 人们总是习惯把技术革命想象成一个明确的瞬间。 莱特兄弟的飞机离开地面,第一颗原子弹爆炸,阿波罗11号登上月球。 回到当下的AGI到来之争,“GPT-6 Astra就是AGI”与“我们进入了AGI时代”,其实是两种不同性质的表达。 前者是可以被质疑和检验的技术结论:既然它是AGI,就应当说明采用了什么定义、满足了哪些条件,又在哪些测试中得到独立验证。 后者则更像一种时代判断。布罗克曼说的正是“欢迎来到AGI时代”。这种表述既制造了历史时刻,又保留了足够大的解释空间。 对模型公司和AI产业链而言,“AGI”首先是一种强大的产品叙事。 模型能力的真实进步通常是零散而不均匀的。准确描述这些变化,需要一长串评测、条件和限定语。 “AGI时代来了”却可以把一切压缩成一句话。 它把一次模型发布从产品升级变成历史节点,也把算力投入、技术路线和商业前景组织进同一个故事。 对于争夺用户、企业客户、人才和资本的公司来说,这种叙事的价值,或许并不亚于一次模型能力的重大突破。 黄仁勋的表态,也不能脱离这个叙事框架来理解。 2025年9月,英伟达与OpenAI宣布达成战略合作意向。按照当时公布的计划,OpenAI将部署至少10吉瓦的英伟达系统,规模相当于数百万颗GPU;英伟达则准备随着基础设施逐步落地,向OpenAI投资最高1000亿美元。 这是一份意向书,并非已经全部落地的最终协议,后续也一度传出方案可能调整。 但在最初的合作设想中,英伟达被定位为OpenAI扩建AI基础设施时的首选计算与网络合作伙伴。双方在公告中直接表示,这些设施将服务于OpenAI“迈向部署超级智能”的路径。 近期,黄仁勋在宣布“AGI已经到来”的同时,专门提到训练Astra所使用的英伟达计算系统,以及下一批即将上线的GPU。 整段话隐含着一条完整的因果链:大规模算力投入带来了智能跃迁,因此更大规模的算力投入仍然必要。 作为全球AI算力扩张的主要受益者,英伟达当然有理由强调这是一场时代转折。 事实上,这也不是黄仁勋第一次宣布AGI到来。 2024年,他曾表示,如果把AGI定义为能够通过几乎所有人类设计的考试,那么这一目标可能在五年内实现。 到2026年3月,他又在Lex Fridman的播客中表示:“我认为我们已经实现了AGI。” 这么看来,AGI不仅是一个等待技术跨越的终点,也是一种能够影响资本、市场、政策和产业预期的叙事资源。 至于AGI怎样才算真的来了?是一次模型发布、一项评测纪录,还是一家公司的宣告? 也可能,这就是一个所有人都身处其中、潜移默化的过程。 正如知名AI研究者、OpenAI创始成员Andrej Karpathy提出的一个判断,AGI不会带来一条陡然拐起的曲线,它会平滑地融进已有的增长里,事后你甚至找不到拐点在哪。 本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。如对本稿件有异议或投诉,请联系 tougao@huxiu.com。 本文来自虎嗅,原文链接:https://www.huxiu.com/article/4889598.html?f=wyxwapp 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 每日经济新闻 2026-06-02 06:05:39 财联社 2026-06-26 06:55:01 36氪 2026-09-07 14:32:58 新智元 2026-09-09 06:18:46 量子位 2026-09-07 16:33:45 每日经济新闻 2026-07-28 16:03:44 虎嗅APP 2026-09-09 03:06:12 经济观察报 2026-09-07 20:40:15 智东西 2026-09-08 23:35:50 酱本增笑 2026-09-07 11:17:43 大春不一样 2026-09-07 03:08:18 极目新闻 2026-09-08 09:05:24 财联社 2026-09-09 03:41:03 都市快报橙柿互动 2026-09-08 13:29:54 上观新闻 2026-09-08 09:04:25 机器之心Pro 2026-09-06 16:00:04 正和远景 2026-09-07 15:23:45 快科技 2026-09-06 21:34:46 奇葩街坊故事会 2026-09-07 13:21:38 网易科技态度见闻 2026-09-08 17:08:18 爱看头条 2026-09-08 20:16:08 星河佰E际 2026-09-09 01:38:15 拳击格斗大放送 2026-09-08 13:12:57 每日经济新闻 2026-06-07 04:19:46 36氪 2026-06-19 17:24:18 邻家二蛋不靠谱 2026-09-08 01:41:02 人民网 2026-09-09 06:24:41 中国经济网 2026-09-08 11:11:11 潇湘晨报 2026-09-08 19:10:47 新京报 2026-09-08 08:06:25 天天汽车 2026-09-05 16:21:57 游戏茶馆 2026-09-07 09:40:51 财联社 2026-08-25 16:33:12 鲨鲨笑场 2026-09-05 11:12:05 甜份超标的我 2026-09-09 02:19:36 左脚爆射得分 2026-09-08 17:54:49 鲁中晨报 2026-09-06 15:47:03 北纬的咖啡豆 2026-09-09 07:04:49 36氪 2026-09-08 16:25:32 武汉发布 2026-09-08 10:47:56
AGI 怎样才算真的来了? 本文来自微信公众号: 深流研究所 ,作者:吴绛枫 9月3日,OpenAI总裁格雷格·布罗克曼在发布新模型GPT-6 Astra后,抛出了一句话:“欢迎来到AGI时代。” 三天后,黄仁勋在社交平台上把话说得更直接:“从ChatGPT到o1,再到GPT-6 Astra,只用了四年。AGI已经到来。” 众所期待的AGI,就这么突然被宣布实现了? GPT-6 Astra发布前不久,OpenAI CEO山姆·奥尔特曼还在说,AGI是一个“定义极其模糊的词”,甚至差点称它为“无关紧要的营销术语”。 负责GPT-6 Astra关键评测的ARC Prize团队也专门提醒:GPT-6 Astra确实代表了通用化能力的重要进步,但“我们并不声称它就是AGI”。 一边是“欢迎来到AGI时代”,一边是“我们没有说这是AGI”。 今天,谁都在谈AGI,却没有谁能说清楚:AI究竟要做到什么,才算真正越过了AGI这条线。 先来看看GPT-6 Astra最令人咋舌的成绩,是在ARC-AGI-3上拿到99.9%。 ARC-AGI与普通评测不太一样。它不会直接告诉模型规则,而是把模型放进陌生环境,让模型自己判断目标、理解反馈,再找到解决办法。 这项评测试图衡量的,正是当前AI最受质疑的一种能力:面对没见过的问题,能不能现场学会。 99.9%的得分当然惊人。但这个数字有一个常被省略的前提。 在ARC Prize统一提供的标准测试框架中,GPT-6 Astra得分为62.7%;接入OpenAI提供的专用适配框架后,得分才上升到99.9%。 后者允许模型保留跨请求的隐藏推理状态,并利用上下文压缩延续此前的探索经验。 我们无法把OpenAI这项操作简单归类为“作弊”。毕竟,现实中的AI本来就不会裸机运行。记忆、工具和运行框架都可能成为智能系统的一部分。 问题在于,62.7%测量的更接近单个模型的能力;99.9%测量的则是一套经过专门优化的完整系统。 两项成绩都是真的,却不能混为一谈。更不能把99.9%的测试得分,顺手换算成“99.9%的AGI”。 此外,GPT-6 Astra在其他评测上的表现,也没有呈现出一个无懈可击的通才形象。 它在高难数学测试FrontierMath Tier 4上达到97.6%,在计算机操作测试OSWorld 2.0上得到72.6%;但到了更接近真实办公流程的AutomationBench,成绩降至41.4%,在复杂专业任务测试Agents’Last Exam上也只有59.3%。 这些数字真正说明的是,当任务规则清晰、答案可以验证时,Astra已经能够逼近甚至超过人类;一旦进入流程冗长、目标模糊的现实环境,它仍然会频繁失败。 深蓝击败国际象棋世界冠军,Watson赢下《危险边缘》,AlphaGo走出“神之一手”时,人们都曾短暂地产生过类似的错觉:既然机器已经征服了如此复杂的任务,通用智能大概也不远了。 规则明确、反馈即时、有自动裁判的世界,与现实生活并不是一回事。 OpenAI采用了最具经济导向的定义。其在2018年发布的公司章程将AGI描述为“在大多数具有经济价值的工作上超越人类的高度自主系统”。 这一定义包含三个关键条件——覆盖广泛的工作、表现超过人类、能够高度自主运行。 现实工作中的产出构成了核心尺度。意识、情感和人类式思维并未被列为必要条件。 这一标准与OpenAI近年的产品路线高度契合。 推理模型提升复杂任务的处理能力,智能体强化工具调用和计算机操作,Codex等产品进一步进入软件开发流程。 各项能力最终汇向同一个目标:让AI承担更完整的工作,并将模型能力转化为可规模化部署的生产力。 Anthropic对AGI的处理方式更加谨慎。CEO达里奥·阿莫迪认为,这个词承载了过多模糊含义,因此更常使用“强大的AI”。 在2024年10月发表的《Machines of Loving Grace》中,阿莫迪描述了一类具体系统: 它在多数重要领域达到或超过顶尖专家水平,能够独立完成持续数小时、数天乃至数周的任务,还可以复制成数百万个实例,以远高于人类的速度同时工作。 这幅图景包含能力、自主性和复制规模三个变量。三者共同决定AI的现实影响,也会同步放大滥用、失控和系统性风险。 基于这一判断,Anthropic将能力扩展与风险治理绑定。公司的战略重点可以概括为:保持前沿模型竞争力,同时让安全保障随能力等级同步升级。 Google DeepMind关注的,则是AGI的测量标准。 其2023年发布的《Levels of AGI》文章,以“性能”和“通用性”为两条主轴,将通用智能划分为“新兴”“胜任”“专家”“大师”和“超人类”五个等级,并把自主性作为独立维度处理。这套框架要求研究者同时考察能力强度和覆盖范围。 2026年3月,DeepMind进一步发布认知分类框架,将通用智能拆分为感知、生成、注意力、学习、记忆、推理、元认知、执行功能、问题解决和社会认知十个维度。 评估流程使用未公开测试集、具有代表性的人类样本,以及模型相对于人类能力分布的位置。 DeepMind还与Kaggle设立20万美元奖金,为其中五个评测较薄弱的维度征集测试方案。 这套思路把AGI从单一标签转化为可比较的认知能力图谱,也体现了DeepMind的研究取向:建立统一尺度,识别能力缺口,再据此组织评测和研发。 采用什么标准,就会把什么能力视为关键进展;把什么能力视为关键进展,就会决定一家公司的产品路线、资源配置和安全重点。 ■为什么说“AGI是否到来”,成了一场叙事之争? 人们总是习惯把技术革命想象成一个明确的瞬间。 莱特兄弟的飞机离开地面,第一颗原子弹爆炸,阿波罗11号登上月球。 回到当下的AGI到来之争,“GPT-6 Astra就是AGI”与“我们进入了AGI时代”,其实是两种不同性质的表达。 前者是可以被质疑和检验的技术结论:既然它是AGI,就应当说明采用了什么定义、满足了哪些条件,又在哪些测试中得到独立验证。 后者则更像一种时代判断。布罗克曼说的正是“欢迎来到AGI时代”。这种表述既制造了历史时刻,又保留了足够大的解释空间。 对模型公司和AI产业链而言,“AGI”首先是一种强大的产品叙事。 模型能力的真实进步通常是零散而不均匀的。准确描述这些变化,需要一长串评测、条件和限定语。 “AGI时代来了”却可以把一切压缩成一句话。 它把一次模型发布从产品升级变成历史节点,也把算力投入、技术路线和商业前景组织进同一个故事。 对于争夺用户、企业客户、人才和资本的公司来说,这种叙事的价值,或许并不亚于一次模型能力的重大突破。 黄仁勋的表态,也不能脱离这个叙事框架来理解。 2025年9月,英伟达与OpenAI宣布达成战略合作意向。按照当时公布的计划,OpenAI将部署至少10吉瓦的英伟达系统,规模相当于数百万颗GPU;英伟达则准备随着基础设施逐步落地,向OpenAI投资最高1000亿美元。 这是一份意向书,并非已经全部落地的最终协议,后续也一度传出方案可能调整。 但在最初的合作设想中,英伟达被定位为OpenAI扩建AI基础设施时的首选计算与网络合作伙伴。双方在公告中直接表示,这些设施将服务于OpenAI“迈向部署超级智能”的路径。 近期,黄仁勋在宣布“AGI已经到来”的同时,专门提到训练Astra所使用的英伟达计算系统,以及下一批即将上线的GPU。 整段话隐含着一条完整的因果链:大规模算力投入带来了智能跃迁,因此更大规模的算力投入仍然必要。 作为全球AI算力扩张的主要受益者,英伟达当然有理由强调这是一场时代转折。 事实上,这也不是黄仁勋第一次宣布AGI到来。 2024年,他曾表示,如果把AGI定义为能够通过几乎所有人类设计的考试,那么这一目标可能在五年内实现。 到2026年3月,他又在Lex Fridman的播客中表示:“我认为我们已经实现了AGI。” 这么看来,AGI不仅是一个等待技术跨越的终点,也是一种能够影响资本、市场、政策和产业预期的叙事资源。 至于AGI怎样才算真的来了?是一次模型发布、一项评测纪录,还是一家公司的宣告? 也可能,这就是一个所有人都身处其中、潜移默化的过程。 正如知名AI研究者、OpenAI创始成员Andrej Karpathy提出的一个判断,AGI不会带来一条陡然拐起的曲线,它会平滑地融进已有的增长里,事后你甚至找不到拐点在哪。 本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。如对本稿件有异议或投诉,请联系 tougao@huxiu.com。 本文来自虎嗅,原文链接:https://www.huxiu.com/article/4889598.html?f=wyxwapp 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 每日经济新闻 2026-06-02 06:05:39 财联社 2026-06-26 06:55:01 36氪 2026-09-07 14:32:58 新智元 2026-09-09 06:18:46 量子位 2026-09-07 16:33:45 每日经济新闻 2026-07-28 16:03:44 虎嗅APP 2026-09-09 03:06:12 经济观察报 2026-09-07 20:40:15 智东西 2026-09-08 23:35:50 酱本增笑 2026-09-07 11:17:43 大春不一样 2026-09-07 03:08:18 极目新闻 2026-09-08 09:05:24 财联社 2026-09-09 03:41:03 都市快报橙柿互动 2026-09-08 13:29:54 上观新闻 2026-09-08 09:04:25 机器之心Pro 2026-09-06 16:00:04 正和远景 2026-09-07 15:23:45 快科技 2026-09-06 21:34:46 奇葩街坊故事会 2026-09-07 13:21:38 网易科技态度见闻 2026-09-08 17:08:18 爱看头条 2026-09-08 20:16:08 星河佰E际 2026-09-09 01:38:15 拳击格斗大放送 2026-09-08 13:12:57 每日经济新闻 2026-06-07 04:19:46 36氪 2026-06-19 17:24:18 邻家二蛋不靠谱 2026-09-08 01:41:02 人民网 2026-09-09 06:24:41 中国经济网 2026-09-08 11:11:11 潇湘晨报 2026-09-08 19:10:47 新京报 2026-09-08 08:06:25 天天汽车 2026-09-05 16:21:57 游戏茶馆 2026-09-07 09:40:51 财联社 2026-08-25 16:33:12 鲨鲨笑场 2026-09-05 11:12:05 甜份超标的我 2026-09-09 02:19:36 左脚爆射得分 2026-09-08 17:54:49 鲁中晨报 2026-09-06 15:47:03 北纬的咖啡豆 2026-09-09 07:04:49 36氪 2026-09-08 16:25:32 武汉发布 2026-09-08 10:47:56
AGI 怎样才算真的来了? 本文来自微信公众号: 深流研究所 ,作者:吴绛枫 9月3日,OpenAI总裁格雷格·布罗克曼在发布新模型GPT-6 Astra后,抛出了一句话:“欢迎来到AGI时代。” 三天后,黄仁勋在社交平台上把话说得更直接:“从ChatGPT到o1,再到GPT-6 Astra,只用了四年。AGI已经到来。” 众所期待的AGI,就这么突然被宣布实现了? GPT-6 Astra发布前不久,OpenAI CEO山姆·奥尔特曼还在说,AGI是一个“定义极其模糊的词”,甚至差点称它为“无关紧要的营销术语”。 负责GPT-6 Astra关键评测的ARC Prize团队也专门提醒:GPT-6 Astra确实代表了通用化能力的重要进步,但“我们并不声称它就是AGI”。 一边是“欢迎来到AGI时代”,一边是“我们没有说这是AGI”。 今天,谁都在谈AGI,却没有谁能说清楚:AI究竟要做到什么,才算真正越过了AGI这条线。 先来看看GPT-6 Astra最令人咋舌的成绩,是在ARC-AGI-3上拿到99.9%。 ARC-AGI与普通评测不太一样。它不会直接告诉模型规则,而是把模型放进陌生环境,让模型自己判断目标、理解反馈,再找到解决办法。 这项评测试图衡量的,正是当前AI最受质疑的一种能力:面对没见过的问题,能不能现场学会。 99.9%的得分当然惊人。但这个数字有一个常被省略的前提。 在ARC Prize统一提供的标准测试框架中,GPT-6 Astra得分为62.7%;接入OpenAI提供的专用适配框架后,得分才上升到99.9%。 后者允许模型保留跨请求的隐藏推理状态,并利用上下文压缩延续此前的探索经验。 我们无法把OpenAI这项操作简单归类为“作弊”。毕竟,现实中的AI本来就不会裸机运行。记忆、工具和运行框架都可能成为智能系统的一部分。 问题在于,62.7%测量的更接近单个模型的能力;99.9%测量的则是一套经过专门优化的完整系统。 两项成绩都是真的,却不能混为一谈。更不能把99.9%的测试得分,顺手换算成“99.9%的AGI”。 此外,GPT-6 Astra在其他评测上的表现,也没有呈现出一个无懈可击的通才形象。 它在高难数学测试FrontierMath Tier 4上达到97.6%,在计算机操作测试OSWorld 2.0上得到72.6%;但到了更接近真实办公流程的AutomationBench,成绩降至41.4%,在复杂专业任务测试Agents’Last Exam上也只有59.3%。 这些数字真正说明的是,当任务规则清晰、答案可以验证时,Astra已经能够逼近甚至超过人类;一旦进入流程冗长、目标模糊的现实环境,它仍然会频繁失败。 深蓝击败国际象棋世界冠军,Watson赢下《危险边缘》,AlphaGo走出“神之一手”时,人们都曾短暂地产生过类似的错觉:既然机器已经征服了如此复杂的任务,通用智能大概也不远了。 规则明确、反馈即时、有自动裁判的世界,与现实生活并不是一回事。 OpenAI采用了最具经济导向的定义。其在2018年发布的公司章程将AGI描述为“在大多数具有经济价值的工作上超越人类的高度自主系统”。 这一定义包含三个关键条件——覆盖广泛的工作、表现超过人类、能够高度自主运行。 现实工作中的产出构成了核心尺度。意识、情感和人类式思维并未被列为必要条件。 这一标准与OpenAI近年的产品路线高度契合。 推理模型提升复杂任务的处理能力,智能体强化工具调用和计算机操作,Codex等产品进一步进入软件开发流程。 各项能力最终汇向同一个目标:让AI承担更完整的工作,并将模型能力转化为可规模化部署的生产力。 Anthropic对AGI的处理方式更加谨慎。CEO达里奥·阿莫迪认为,这个词承载了过多模糊含义,因此更常使用“强大的AI”。 在2024年10月发表的《Machines of Loving Grace》中,阿莫迪描述了一类具体系统: 它在多数重要领域达到或超过顶尖专家水平,能够独立完成持续数小时、数天乃至数周的任务,还可以复制成数百万个实例,以远高于人类的速度同时工作。 这幅图景包含能力、自主性和复制规模三个变量。三者共同决定AI的现实影响,也会同步放大滥用、失控和系统性风险。 基于这一判断,Anthropic将能力扩展与风险治理绑定。公司的战略重点可以概括为:保持前沿模型竞争力,同时让安全保障随能力等级同步升级。 Google DeepMind关注的,则是AGI的测量标准。 其2023年发布的《Levels of AGI》文章,以“性能”和“通用性”为两条主轴,将通用智能划分为“新兴”“胜任”“专家”“大师”和“超人类”五个等级,并把自主性作为独立维度处理。这套框架要求研究者同时考察能力强度和覆盖范围。 2026年3月,DeepMind进一步发布认知分类框架,将通用智能拆分为感知、生成、注意力、学习、记忆、推理、元认知、执行功能、问题解决和社会认知十个维度。 评估流程使用未公开测试集、具有代表性的人类样本,以及模型相对于人类能力分布的位置。 DeepMind还与Kaggle设立20万美元奖金,为其中五个评测较薄弱的维度征集测试方案。 这套思路把AGI从单一标签转化为可比较的认知能力图谱,也体现了DeepMind的研究取向:建立统一尺度,识别能力缺口,再据此组织评测和研发。 采用什么标准,就会把什么能力视为关键进展;把什么能力视为关键进展,就会决定一家公司的产品路线、资源配置和安全重点。 ■为什么说“AGI是否到来”,成了一场叙事之争? 人们总是习惯把技术革命想象成一个明确的瞬间。 莱特兄弟的飞机离开地面,第一颗原子弹爆炸,阿波罗11号登上月球。 回到当下的AGI到来之争,“GPT-6 Astra就是AGI”与“我们进入了AGI时代”,其实是两种不同性质的表达。 前者是可以被质疑和检验的技术结论:既然它是AGI,就应当说明采用了什么定义、满足了哪些条件,又在哪些测试中得到独立验证。 后者则更像一种时代判断。布罗克曼说的正是“欢迎来到AGI时代”。这种表述既制造了历史时刻,又保留了足够大的解释空间。 对模型公司和AI产业链而言,“AGI”首先是一种强大的产品叙事。 模型能力的真实进步通常是零散而不均匀的。准确描述这些变化,需要一长串评测、条件和限定语。 “AGI时代来了”却可以把一切压缩成一句话。 它把一次模型发布从产品升级变成历史节点,也把算力投入、技术路线和商业前景组织进同一个故事。 对于争夺用户、企业客户、人才和资本的公司来说,这种叙事的价值,或许并不亚于一次模型能力的重大突破。 黄仁勋的表态,也不能脱离这个叙事框架来理解。 2025年9月,英伟达与OpenAI宣布达成战略合作意向。按照当时公布的计划,OpenAI将部署至少10吉瓦的英伟达系统,规模相当于数百万颗GPU;英伟达则准备随着基础设施逐步落地,向OpenAI投资最高1000亿美元。 这是一份意向书,并非已经全部落地的最终协议,后续也一度传出方案可能调整。 但在最初的合作设想中,英伟达被定位为OpenAI扩建AI基础设施时的首选计算与网络合作伙伴。双方在公告中直接表示,这些设施将服务于OpenAI“迈向部署超级智能”的路径。 近期,黄仁勋在宣布“AGI已经到来”的同时,专门提到训练Astra所使用的英伟达计算系统,以及下一批即将上线的GPU。 整段话隐含着一条完整的因果链:大规模算力投入带来了智能跃迁,因此更大规模的算力投入仍然必要。 作为全球AI算力扩张的主要受益者,英伟达当然有理由强调这是一场时代转折。 事实上,这也不是黄仁勋第一次宣布AGI到来。 2024年,他曾表示,如果把AGI定义为能够通过几乎所有人类设计的考试,那么这一目标可能在五年内实现。 到2026年3月,他又在Lex Fridman的播客中表示:“我认为我们已经实现了AGI。” 这么看来,AGI不仅是一个等待技术跨越的终点,也是一种能够影响资本、市场、政策和产业预期的叙事资源。 至于AGI怎样才算真的来了?是一次模型发布、一项评测纪录,还是一家公司的宣告? 也可能,这就是一个所有人都身处其中、潜移默化的过程。 正如知名AI研究者、OpenAI创始成员Andrej Karpathy提出的一个判断,AGI不会带来一条陡然拐起的曲线,它会平滑地融进已有的增长里,事后你甚至找不到拐点在哪。 本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。如对本稿件有异议或投诉,请联系 tougao@huxiu.com。 本文来自虎嗅,原文链接:https://www.huxiu.com/article/4889598.html?f=wyxwapp 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 每日经济新闻 2026-06-02 06:05:39 财联社 2026-06-26 06:55:01 36氪 2026-09-07 14:32:58 新智元 2026-09-09 06:18:46 量子位 2026-09-07 16:33:45 每日经济新闻 2026-07-28 16:03:44 虎嗅APP 2026-09-09 03:06:12 经济观察报 2026-09-07 20:40:15 智东西 2026-09-08 23:35:50 酱本增笑 2026-09-07 11:17:43 大春不一样 2026-09-07 03:08:18 极目新闻 2026-09-08 09:05:24 财联社 2026-09-09 03:41:03 都市快报橙柿互动 2026-09-08 13:29:54 上观新闻 2026-09-08 09:04:25 机器之心Pro 2026-09-06 16:00:04 正和远景 2026-09-07 15:23:45 快科技 2026-09-06 21:34:46 奇葩街坊故事会 2026-09-07 13:21:38 网易科技态度见闻 2026-09-08 17:08:18 爱看头条 2026-09-08 20:16:08 星河佰E际 2026-09-09 01:38:15 拳击格斗大放送 2026-09-08 13:12:57 每日经济新闻 2026-06-07 04:19:46 36氪 2026-06-19 17:24:18 邻家二蛋不靠谱 2026-09-08 01:41:02 人民网 2026-09-09 06:24:41 中国经济网 2026-09-08 11:11:11 潇湘晨报 2026-09-08 19:10:47 新京报 2026-09-08 08:06:25 天天汽车 2026-09-05 16:21:57 游戏茶馆 2026-09-07 09:40:51 财联社 2026-08-25 16:33:12 鲨鲨笑场 2026-09-05 11:12:05 甜份超标的我 2026-09-09 02:19:36 左脚爆射得分 2026-09-08 17:54:49 鲁中晨报 2026-09-06 15:47:03 北纬的咖啡豆 2026-09-09 07:04:49 36氪 2026-09-08 16:25:32 武汉发布 2026-09-08 10:47:56
一个猛打把!北京通州男子醉酒骑车被撞后开颅,老父亲绝望:“什么都不知道了”-e385ac4f
涩多多网站在线观看视频网站入口AGI 怎样才算真的来了? 本文来自微信公众号: 深流研究所 ,作者:吴绛枫 9月3日,OpenAI总裁格雷格·布罗克曼在发布新模型GPT-6 Astra后,抛出了一句话:“欢迎来到AGI时代。” 三天后,黄仁勋在社交平台上把话说得更直接:“从ChatGPT到o1,再到GPT-6 Astra,只用了四年。AGI已经到来。” 众所期待的AGI,就这么突然被宣布实现了? GPT-6 Astra发布前不久,OpenAI CEO山姆·奥尔特曼还在说,AGI是一个“定义极其模糊的词”,甚至差点称它为“无关紧要的营销术语”。 负责GPT-6 Astra关键评测的ARC Prize团队也专门提醒:GPT-6 Astra确实代表了通用化能力的重要进步,但“我们并不声称它就是AGI”。 一边是“欢迎来到AGI时代”,一边是“我们没有说这是AGI”。 今天,谁都在谈AGI,却没有谁能说清楚:AI究竟要做到什么,才算真正越过了AGI这条线。 先来看看GPT-6 Astra最令人咋舌的成绩,是在ARC-AGI-3上拿到99.9%。 ARC-AGI与普通评测不太一样。它不会直接告诉模型规则,而是把模型放进陌生环境,让模型自己判断目标、理解反馈,再找到解决办法。 这项评测试图衡量的,正是当前AI最受质疑的一种能力:面对没见过的问题,能不能现场学会。 99.9%的得分当然惊人。但这个数字有一个常被省略的前提。 在ARC Prize统一提供的标准测试框架中,GPT-6 Astra得分为62.7%;接入OpenAI提供的专用适配框架后,得分才上升到99.9%。 后者允许模型保留跨请求的隐藏推理状态,并利用上下文压缩延续此前的探索经验。 我们无法把OpenAI这项操作简单归类为“作弊”。毕竟,现实中的AI本来就不会裸机运行。记忆、工具和运行框架都可能成为智能系统的一部分。 问题在于,62.7%测量的更接近单个模型的能力;99.9%测量的则是一套经过专门优化的完整系统。 两项成绩都是真的,却不能混为一谈。更不能把99.9%的测试得分,顺手换算成“99.9%的AGI”。 此外,GPT-6 Astra在其他评测上的表现,也没有呈现出一个无懈可击的通才形象。 它在高难数学测试FrontierMath Tier 4上达到97.6%,在计算机操作测试OSWorld 2.0上得到72.6%;但到了更接近真实办公流程的AutomationBench,成绩降至41.4%,在复杂专业任务测试Agents’Last Exam上也只有59.3%。 这些数字真正说明的是,当任务规则清晰、答案可以验证时,Astra已经能够逼近甚至超过人类;一旦进入流程冗长、目标模糊的现实环境,它仍然会频繁失败。 深蓝击败国际象棋世界冠军,Watson赢下《危险边缘》,AlphaGo走出“神之一手”时,人们都曾短暂地产生过类似的错觉:既然机器已经征服了如此复杂的任务,通用智能大概也不远了。 规则明确、反馈即时、有自动裁判的世界,与现实生活并不是一回事。 OpenAI采用了最具经济导向的定义。其在2018年发布的公司章程将AGI描述为“在大多数具有经济价值的工作上超越人类的高度自主系统”。 这一定义包含三个关键条件——覆盖广泛的工作、表现超过人类、能够高度自主运行。 现实工作中的产出构成了核心尺度。意识、情感和人类式思维并未被列为必要条件。 这一标准与OpenAI近年的产品路线高度契合。 推理模型提升复杂任务的处理能力,智能体强化工具调用和计算机操作,Codex等产品进一步进入软件开发流程。 各项能力最终汇向同一个目标:让AI承担更完整的工作,并将模型能力转化为可规模化部署的生产力。 Anthropic对AGI的处理方式更加谨慎。CEO达里奥·阿莫迪认为,这个词承载了过多模糊含义,因此更常使用“强大的AI”。 在2024年10月发表的《Machines of Loving Grace》中,阿莫迪描述了一类具体系统: 它在多数重要领域达到或超过顶尖专家水平,能够独立完成持续数小时、数天乃至数周的任务,还可以复制成数百万个实例,以远高于人类的速度同时工作。 这幅图景包含能力、自主性和复制规模三个变量。三者共同决定AI的现实影响,也会同步放大滥用、失控和系统性风险。 基于这一判断,Anthropic将能力扩展与风险治理绑定。公司的战略重点可以概括为:保持前沿模型竞争力,同时让安全保障随能力等级同步升级。 Google DeepMind关注的,则是AGI的测量标准。 其2023年发布的《Levels of AGI》文章,以“性能”和“通用性”为两条主轴,将通用智能划分为“新兴”“胜任”“专家”“大师”和“超人类”五个等级,并把自主性作为独立维度处理。这套框架要求研究者同时考察能力强度和覆盖范围。 2026年3月,DeepMind进一步发布认知分类框架,将通用智能拆分为感知、生成、注意力、学习、记忆、推理、元认知、执行功能、问题解决和社会认知十个维度。 评估流程使用未公开测试集、具有代表性的人类样本,以及模型相对于人类能力分布的位置。 DeepMind还与Kaggle设立20万美元奖金,为其中五个评测较薄弱的维度征集测试方案。 这套思路把AGI从单一标签转化为可比较的认知能力图谱,也体现了DeepMind的研究取向:建立统一尺度,识别能力缺口,再据此组织评测和研发。 采用什么标准,就会把什么能力视为关键进展;把什么能力视为关键进展,就会决定一家公司的产品路线、资源配置和安全重点。 ■为什么说“AGI是否到来”,成了一场叙事之争? 人们总是习惯把技术革命想象成一个明确的瞬间。 莱特兄弟的飞机离开地面,第一颗原子弹爆炸,阿波罗11号登上月球。 回到当下的AGI到来之争,“GPT-6 Astra就是AGI”与“我们进入了AGI时代”,其实是两种不同性质的表达。 前者是可以被质疑和检验的技术结论:既然它是AGI,就应当说明采用了什么定义、满足了哪些条件,又在哪些测试中得到独立验证。 后者则更像一种时代判断。布罗克曼说的正是“欢迎来到AGI时代”。这种表述既制造了历史时刻,又保留了足够大的解释空间。 对模型公司和AI产业链而言,“AGI”首先是一种强大的产品叙事。 模型能力的真实进步通常是零散而不均匀的。准确描述这些变化,需要一长串评测、条件和限定语。 “AGI时代来了”却可以把一切压缩成一句话。 它把一次模型发布从产品升级变成历史节点,也把算力投入、技术路线和商业前景组织进同一个故事。 对于争夺用户、企业客户、人才和资本的公司来说,这种叙事的价值,或许并不亚于一次模型能力的重大突破。 黄仁勋的表态,也不能脱离这个叙事框架来理解。 2025年9月,英伟达与OpenAI宣布达成战略合作意向。按照当时公布的计划,OpenAI将部署至少10吉瓦的英伟达系统,规模相当于数百万颗GPU;英伟达则准备随着基础设施逐步落地,向OpenAI投资最高1000亿美元。 这是一份意向书,并非已经全部落地的最终协议,后续也一度传出方案可能调整。 但在最初的合作设想中,英伟达被定位为OpenAI扩建AI基础设施时的首选计算与网络合作伙伴。双方在公告中直接表示,这些设施将服务于OpenAI“迈向部署超级智能”的路径。 近期,黄仁勋在宣布“AGI已经到来”的同时,专门提到训练Astra所使用的英伟达计算系统,以及下一批即将上线的GPU。 整段话隐含着一条完整的因果链:大规模算力投入带来了智能跃迁,因此更大规模的算力投入仍然必要。 作为全球AI算力扩张的主要受益者,英伟达当然有理由强调这是一场时代转折。 事实上,这也不是黄仁勋第一次宣布AGI到来。 2024年,他曾表示,如果把AGI定义为能够通过几乎所有人类设计的考试,那么这一目标可能在五年内实现。 到2026年3月,他又在Lex Fridman的播客中表示:“我认为我们已经实现了AGI。” 这么看来,AGI不仅是一个等待技术跨越的终点,也是一种能够影响资本、市场、政策和产业预期的叙事资源。 至于AGI怎样才算真的来了?是一次模型发布、一项评测纪录,还是一家公司的宣告? 也可能,这就是一个所有人都身处其中、潜移默化的过程。 正如知名AI研究者、OpenAI创始成员Andrej Karpathy提出的一个判断,AGI不会带来一条陡然拐起的曲线,它会平滑地融进已有的增长里,事后你甚至找不到拐点在哪。 本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。如对本稿件有异议或投诉,请联系 tougao@huxiu.com。 本文来自虎嗅,原文链接:https://www.huxiu.com/article/4889598.html?f=wyxwapp 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 每日经济新闻 2026-06-02 06:05:39 财联社 2026-06-26 06:55:01 36氪 2026-09-07 14:32:58 新智元 2026-09-09 06:18:46 量子位 2026-09-07 16:33:45 每日经济新闻 2026-07-28 16:03:44 虎嗅APP 2026-09-09 03:06:12 经济观察报 2026-09-07 20:40:15 智东西 2026-09-08 23:35:50 酱本增笑 2026-09-07 11:17:43 大春不一样 2026-09-07 03:08:18 极目新闻 2026-09-08 09:05:24 财联社 2026-09-09 03:41:03 都市快报橙柿互动 2026-09-08 13:29:54 上观新闻 2026-09-08 09:04:25 机器之心Pro 2026-09-06 16:00:04 正和远景 2026-09-07 15:23:45 快科技 2026-09-06 21:34:46 奇葩街坊故事会 2026-09-07 13:21:38 网易科技态度见闻 2026-09-08 17:08:18 爱看头条 2026-09-08 20:16:08 星河佰E际 2026-09-09 01:38:15 拳击格斗大放送 2026-09-08 13:12:57 每日经济新闻 2026-06-07 04:19:46 36氪 2026-06-19 17:24:18 邻家二蛋不靠谱 2026-09-08 01:41:02 人民网 2026-09-09 06:24:41 中国经济网 2026-09-08 11:11:11 潇湘晨报 2026-09-08 19:10:47 新京报 2026-09-08 08:06:25 天天汽车 2026-09-05 16:21:57 游戏茶馆 2026-09-07 09:40:51 财联社 2026-08-25 16:33:12 鲨鲨笑场 2026-09-05 11:12:05 甜份超标的我 2026-09-09 02:19:36 左脚爆射得分 2026-09-08 17:54:49 鲁中晨报 2026-09-06 15:47:03 北纬的咖啡豆 2026-09-09 07:04:49 36氪 2026-09-08 16:25:32 武汉发布 2026-09-08 10:47:56
AGI 怎样才算真的来了? 本文来自微信公众号: 深流研究所 ,作者:吴绛枫 9月3日,OpenAI总裁格雷格·布罗克曼在发布新模型GPT-6 Astra后,抛出了一句话:“欢迎来到AGI时代。” 三天后,黄仁勋在社交平台上把话说得更直接:“从ChatGPT到o1,再到GPT-6 Astra,只用了四年。AGI已经到来。” 众所期待的AGI,就这么突然被宣布实现了? GPT-6 Astra发布前不久,OpenAI CEO山姆·奥尔特曼还在说,AGI是一个“定义极其模糊的词”,甚至差点称它为“无关紧要的营销术语”。 负责GPT-6 Astra关键评测的ARC Prize团队也专门提醒:GPT-6 Astra确实代表了通用化能力的重要进步,但“我们并不声称它就是AGI”。 一边是“欢迎来到AGI时代”,一边是“我们没有说这是AGI”。 今天,谁都在谈AGI,却没有谁能说清楚:AI究竟要做到什么,才算真正越过了AGI这条线。 先来看看GPT-6 Astra最令人咋舌的成绩,是在ARC-AGI-3上拿到99.9%。 ARC-AGI与普通评测不太一样。它不会直接告诉模型规则,而是把模型放进陌生环境,让模型自己判断目标、理解反馈,再找到解决办法。 这项评测试图衡量的,正是当前AI最受质疑的一种能力:面对没见过的问题,能不能现场学会。 99.9%的得分当然惊人。但这个数字有一个常被省略的前提。 在ARC Prize统一提供的标准测试框架中,GPT-6 Astra得分为62.7%;接入OpenAI提供的专用适配框架后,得分才上升到99.9%。 后者允许模型保留跨请求的隐藏推理状态,并利用上下文压缩延续此前的探索经验。 我们无法把OpenAI这项操作简单归类为“作弊”。毕竟,现实中的AI本来就不会裸机运行。记忆、工具和运行框架都可能成为智能系统的一部分。 问题在于,62.7%测量的更接近单个模型的能力;99.9%测量的则是一套经过专门优化的完整系统。 两项成绩都是真的,却不能混为一谈。更不能把99.9%的测试得分,顺手换算成“99.9%的AGI”。 此外,GPT-6 Astra在其他评测上的表现,也没有呈现出一个无懈可击的通才形象。 它在高难数学测试FrontierMath Tier 4上达到97.6%,在计算机操作测试OSWorld 2.0上得到72.6%;但到了更接近真实办公流程的AutomationBench,成绩降至41.4%,在复杂专业任务测试Agents’Last Exam上也只有59.3%。 这些数字真正说明的是,当任务规则清晰、答案可以验证时,Astra已经能够逼近甚至超过人类;一旦进入流程冗长、目标模糊的现实环境,它仍然会频繁失败。 深蓝击败国际象棋世界冠军,Watson赢下《危险边缘》,AlphaGo走出“神之一手”时,人们都曾短暂地产生过类似的错觉:既然机器已经征服了如此复杂的任务,通用智能大概也不远了。 规则明确、反馈即时、有自动裁判的世界,与现实生活并不是一回事。 OpenAI采用了最具经济导向的定义。其在2018年发布的公司章程将AGI描述为“在大多数具有经济价值的工作上超越人类的高度自主系统”。 这一定义包含三个关键条件——覆盖广泛的工作、表现超过人类、能够高度自主运行。 现实工作中的产出构成了核心尺度。意识、情感和人类式思维并未被列为必要条件。 这一标准与OpenAI近年的产品路线高度契合。 推理模型提升复杂任务的处理能力,智能体强化工具调用和计算机操作,Codex等产品进一步进入软件开发流程。 各项能力最终汇向同一个目标:让AI承担更完整的工作,并将模型能力转化为可规模化部署的生产力。 Anthropic对AGI的处理方式更加谨慎。CEO达里奥·阿莫迪认为,这个词承载了过多模糊含义,因此更常使用“强大的AI”。 在2024年10月发表的《Machines of Loving Grace》中,阿莫迪描述了一类具体系统: 它在多数重要领域达到或超过顶尖专家水平,能够独立完成持续数小时、数天乃至数周的任务,还可以复制成数百万个实例,以远高于人类的速度同时工作。 这幅图景包含能力、自主性和复制规模三个变量。三者共同决定AI的现实影响,也会同步放大滥用、失控和系统性风险。 基于这一判断,Anthropic将能力扩展与风险治理绑定。公司的战略重点可以概括为:保持前沿模型竞争力,同时让安全保障随能力等级同步升级。 Google DeepMind关注的,则是AGI的测量标准。 其2023年发布的《Levels of AGI》文章,以“性能”和“通用性”为两条主轴,将通用智能划分为“新兴”“胜任”“专家”“大师”和“超人类”五个等级,并把自主性作为独立维度处理。这套框架要求研究者同时考察能力强度和覆盖范围。 2026年3月,DeepMind进一步发布认知分类框架,将通用智能拆分为感知、生成、注意力、学习、记忆、推理、元认知、执行功能、问题解决和社会认知十个维度。 评估流程使用未公开测试集、具有代表性的人类样本,以及模型相对于人类能力分布的位置。 DeepMind还与Kaggle设立20万美元奖金,为其中五个评测较薄弱的维度征集测试方案。 这套思路把AGI从单一标签转化为可比较的认知能力图谱,也体现了DeepMind的研究取向:建立统一尺度,识别能力缺口,再据此组织评测和研发。 采用什么标准,就会把什么能力视为关键进展;把什么能力视为关键进展,就会决定一家公司的产品路线、资源配置和安全重点。 ■为什么说“AGI是否到来”,成了一场叙事之争? 人们总是习惯把技术革命想象成一个明确的瞬间。 莱特兄弟的飞机离开地面,第一颗原子弹爆炸,阿波罗11号登上月球。 回到当下的AGI到来之争,“GPT-6 Astra就是AGI”与“我们进入了AGI时代”,其实是两种不同性质的表达。 前者是可以被质疑和检验的技术结论:既然它是AGI,就应当说明采用了什么定义、满足了哪些条件,又在哪些测试中得到独立验证。 后者则更像一种时代判断。布罗克曼说的正是“欢迎来到AGI时代”。这种表述既制造了历史时刻,又保留了足够大的解释空间。 对模型公司和AI产业链而言,“AGI”首先是一种强大的产品叙事。 模型能力的真实进步通常是零散而不均匀的。准确描述这些变化,需要一长串评测、条件和限定语。 “AGI时代来了”却可以把一切压缩成一句话。 它把一次模型发布从产品升级变成历史节点,也把算力投入、技术路线和商业前景组织进同一个故事。 对于争夺用户、企业客户、人才和资本的公司来说,这种叙事的价值,或许并不亚于一次模型能力的重大突破。 黄仁勋的表态,也不能脱离这个叙事框架来理解。 2025年9月,英伟达与OpenAI宣布达成战略合作意向。按照当时公布的计划,OpenAI将部署至少10吉瓦的英伟达系统,规模相当于数百万颗GPU;英伟达则准备随着基础设施逐步落地,向OpenAI投资最高1000亿美元。 这是一份意向书,并非已经全部落地的最终协议,后续也一度传出方案可能调整。 但在最初的合作设想中,英伟达被定位为OpenAI扩建AI基础设施时的首选计算与网络合作伙伴。双方在公告中直接表示,这些设施将服务于OpenAI“迈向部署超级智能”的路径。 近期,黄仁勋在宣布“AGI已经到来”的同时,专门提到训练Astra所使用的英伟达计算系统,以及下一批即将上线的GPU。 整段话隐含着一条完整的因果链:大规模算力投入带来了智能跃迁,因此更大规模的算力投入仍然必要。 作为全球AI算力扩张的主要受益者,英伟达当然有理由强调这是一场时代转折。 事实上,这也不是黄仁勋第一次宣布AGI到来。 2024年,他曾表示,如果把AGI定义为能够通过几乎所有人类设计的考试,那么这一目标可能在五年内实现。 到2026年3月,他又在Lex Fridman的播客中表示:“我认为我们已经实现了AGI。” 这么看来,AGI不仅是一个等待技术跨越的终点,也是一种能够影响资本、市场、政策和产业预期的叙事资源。 至于AGI怎样才算真的来了?是一次模型发布、一项评测纪录,还是一家公司的宣告? 也可能,这就是一个所有人都身处其中、潜移默化的过程。 正如知名AI研究者、OpenAI创始成员Andrej Karpathy提出的一个判断,AGI不会带来一条陡然拐起的曲线,它会平滑地融进已有的增长里,事后你甚至找不到拐点在哪。 本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。如对本稿件有异议或投诉,请联系 tougao@huxiu.com。 本文来自虎嗅,原文链接:https://www.huxiu.com/article/4889598.html?f=wyxwapp 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 每日经济新闻 2026-06-02 06:05:39 财联社 2026-06-26 06:55:01 36氪 2026-09-07 14:32:58 新智元 2026-09-09 06:18:46 量子位 2026-09-07 16:33:45 每日经济新闻 2026-07-28 16:03:44 虎嗅APP 2026-09-09 03:06:12 经济观察报 2026-09-07 20:40:15 智东西 2026-09-08 23:35:50 酱本增笑 2026-09-07 11:17:43 大春不一样 2026-09-07 03:08:18 极目新闻 2026-09-08 09:05:24 财联社 2026-09-09 03:41:03 都市快报橙柿互动 2026-09-08 13:29:54 上观新闻 2026-09-08 09:04:25 机器之心Pro 2026-09-06 16:00:04 正和远景 2026-09-07 15:23:45 快科技 2026-09-06 21:34:46 奇葩街坊故事会 2026-09-07 13:21:38 网易科技态度见闻 2026-09-08 17:08:18 爱看头条 2026-09-08 20:16:08 星河佰E际 2026-09-09 01:38:15 拳击格斗大放送 2026-09-08 13:12:57 每日经济新闻 2026-06-07 04:19:46 36氪 2026-06-19 17:24:18 邻家二蛋不靠谱 2026-09-08 01:41:02 人民网 2026-09-09 06:24:41 中国经济网 2026-09-08 11:11:11 潇湘晨报 2026-09-08 19:10:47 新京报 2026-09-08 08:06:25 天天汽车 2026-09-05 16:21:57 游戏茶馆 2026-09-07 09:40:51 财联社 2026-08-25 16:33:12 鲨鲨笑场 2026-09-05 11:12:05 甜份超标的我 2026-09-09 02:19:36 左脚爆射得分 2026-09-08 17:54:49 鲁中晨报 2026-09-06 15:47:03 北纬的咖啡豆 2026-09-09 07:04:49 36氪 2026-09-08 16:25:32 武汉发布 2026-09-08 10:47:56
AGI 怎样才算真的来了? 本文来自微信公众号: 深流研究所 ,作者:吴绛枫 9月3日,OpenAI总裁格雷格·布罗克曼在发布新模型GPT-6 Astra后,抛出了一句话:“欢迎来到AGI时代。” 三天后,黄仁勋在社交平台上把话说得更直接:“从ChatGPT到o1,再到GPT-6 Astra,只用了四年。AGI已经到来。” 众所期待的AGI,就这么突然被宣布实现了? GPT-6 Astra发布前不久,OpenAI CEO山姆·奥尔特曼还在说,AGI是一个“定义极其模糊的词”,甚至差点称它为“无关紧要的营销术语”。 负责GPT-6 Astra关键评测的ARC Prize团队也专门提醒:GPT-6 Astra确实代表了通用化能力的重要进步,但“我们并不声称它就是AGI”。 一边是“欢迎来到AGI时代”,一边是“我们没有说这是AGI”。 今天,谁都在谈AGI,却没有谁能说清楚:AI究竟要做到什么,才算真正越过了AGI这条线。 先来看看GPT-6 Astra最令人咋舌的成绩,是在ARC-AGI-3上拿到99.9%。 ARC-AGI与普通评测不太一样。它不会直接告诉模型规则,而是把模型放进陌生环境,让模型自己判断目标、理解反馈,再找到解决办法。 这项评测试图衡量的,正是当前AI最受质疑的一种能力:面对没见过的问题,能不能现场学会。 99.9%的得分当然惊人。但这个数字有一个常被省略的前提。 在ARC Prize统一提供的标准测试框架中,GPT-6 Astra得分为62.7%;接入OpenAI提供的专用适配框架后,得分才上升到99.9%。 后者允许模型保留跨请求的隐藏推理状态,并利用上下文压缩延续此前的探索经验。 我们无法把OpenAI这项操作简单归类为“作弊”。毕竟,现实中的AI本来就不会裸机运行。记忆、工具和运行框架都可能成为智能系统的一部分。 问题在于,62.7%测量的更接近单个模型的能力;99.9%测量的则是一套经过专门优化的完整系统。 两项成绩都是真的,却不能混为一谈。更不能把99.9%的测试得分,顺手换算成“99.9%的AGI”。 此外,GPT-6 Astra在其他评测上的表现,也没有呈现出一个无懈可击的通才形象。 它在高难数学测试FrontierMath Tier 4上达到97.6%,在计算机操作测试OSWorld 2.0上得到72.6%;但到了更接近真实办公流程的AutomationBench,成绩降至41.4%,在复杂专业任务测试Agents’Last Exam上也只有59.3%。 这些数字真正说明的是,当任务规则清晰、答案可以验证时,Astra已经能够逼近甚至超过人类;一旦进入流程冗长、目标模糊的现实环境,它仍然会频繁失败。 深蓝击败国际象棋世界冠军,Watson赢下《危险边缘》,AlphaGo走出“神之一手”时,人们都曾短暂地产生过类似的错觉:既然机器已经征服了如此复杂的任务,通用智能大概也不远了。 规则明确、反馈即时、有自动裁判的世界,与现实生活并不是一回事。 OpenAI采用了最具经济导向的定义。其在2018年发布的公司章程将AGI描述为“在大多数具有经济价值的工作上超越人类的高度自主系统”。 这一定义包含三个关键条件——覆盖广泛的工作、表现超过人类、能够高度自主运行。 现实工作中的产出构成了核心尺度。意识、情感和人类式思维并未被列为必要条件。 这一标准与OpenAI近年的产品路线高度契合。 推理模型提升复杂任务的处理能力,智能体强化工具调用和计算机操作,Codex等产品进一步进入软件开发流程。 各项能力最终汇向同一个目标:让AI承担更完整的工作,并将模型能力转化为可规模化部署的生产力。 Anthropic对AGI的处理方式更加谨慎。CEO达里奥·阿莫迪认为,这个词承载了过多模糊含义,因此更常使用“强大的AI”。 在2024年10月发表的《Machines of Loving Grace》中,阿莫迪描述了一类具体系统: 它在多数重要领域达到或超过顶尖专家水平,能够独立完成持续数小时、数天乃至数周的任务,还可以复制成数百万个实例,以远高于人类的速度同时工作。 这幅图景包含能力、自主性和复制规模三个变量。三者共同决定AI的现实影响,也会同步放大滥用、失控和系统性风险。 基于这一判断,Anthropic将能力扩展与风险治理绑定。公司的战略重点可以概括为:保持前沿模型竞争力,同时让安全保障随能力等级同步升级。 Google DeepMind关注的,则是AGI的测量标准。 其2023年发布的《Levels of AGI》文章,以“性能”和“通用性”为两条主轴,将通用智能划分为“新兴”“胜任”“专家”“大师”和“超人类”五个等级,并把自主性作为独立维度处理。这套框架要求研究者同时考察能力强度和覆盖范围。 2026年3月,DeepMind进一步发布认知分类框架,将通用智能拆分为感知、生成、注意力、学习、记忆、推理、元认知、执行功能、问题解决和社会认知十个维度。 评估流程使用未公开测试集、具有代表性的人类样本,以及模型相对于人类能力分布的位置。 DeepMind还与Kaggle设立20万美元奖金,为其中五个评测较薄弱的维度征集测试方案。 这套思路把AGI从单一标签转化为可比较的认知能力图谱,也体现了DeepMind的研究取向:建立统一尺度,识别能力缺口,再据此组织评测和研发。 采用什么标准,就会把什么能力视为关键进展;把什么能力视为关键进展,就会决定一家公司的产品路线、资源配置和安全重点。 ■为什么说“AGI是否到来”,成了一场叙事之争? 人们总是习惯把技术革命想象成一个明确的瞬间。 莱特兄弟的飞机离开地面,第一颗原子弹爆炸,阿波罗11号登上月球。 回到当下的AGI到来之争,“GPT-6 Astra就是AGI”与“我们进入了AGI时代”,其实是两种不同性质的表达。 前者是可以被质疑和检验的技术结论:既然它是AGI,就应当说明采用了什么定义、满足了哪些条件,又在哪些测试中得到独立验证。 后者则更像一种时代判断。布罗克曼说的正是“欢迎来到AGI时代”。这种表述既制造了历史时刻,又保留了足够大的解释空间。 对模型公司和AI产业链而言,“AGI”首先是一种强大的产品叙事。 模型能力的真实进步通常是零散而不均匀的。准确描述这些变化,需要一长串评测、条件和限定语。 “AGI时代来了”却可以把一切压缩成一句话。 它把一次模型发布从产品升级变成历史节点,也把算力投入、技术路线和商业前景组织进同一个故事。 对于争夺用户、企业客户、人才和资本的公司来说,这种叙事的价值,或许并不亚于一次模型能力的重大突破。 黄仁勋的表态,也不能脱离这个叙事框架来理解。 2025年9月,英伟达与OpenAI宣布达成战略合作意向。按照当时公布的计划,OpenAI将部署至少10吉瓦的英伟达系统,规模相当于数百万颗GPU;英伟达则准备随着基础设施逐步落地,向OpenAI投资最高1000亿美元。 这是一份意向书,并非已经全部落地的最终协议,后续也一度传出方案可能调整。 但在最初的合作设想中,英伟达被定位为OpenAI扩建AI基础设施时的首选计算与网络合作伙伴。双方在公告中直接表示,这些设施将服务于OpenAI“迈向部署超级智能”的路径。 近期,黄仁勋在宣布“AGI已经到来”的同时,专门提到训练Astra所使用的英伟达计算系统,以及下一批即将上线的GPU。 整段话隐含着一条完整的因果链:大规模算力投入带来了智能跃迁,因此更大规模的算力投入仍然必要。 作为全球AI算力扩张的主要受益者,英伟达当然有理由强调这是一场时代转折。 事实上,这也不是黄仁勋第一次宣布AGI到来。 2024年,他曾表示,如果把AGI定义为能够通过几乎所有人类设计的考试,那么这一目标可能在五年内实现。 到2026年3月,他又在Lex Fridman的播客中表示:“我认为我们已经实现了AGI。” 这么看来,AGI不仅是一个等待技术跨越的终点,也是一种能够影响资本、市场、政策和产业预期的叙事资源。 至于AGI怎样才算真的来了?是一次模型发布、一项评测纪录,还是一家公司的宣告? 也可能,这就是一个所有人都身处其中、潜移默化的过程。 正如知名AI研究者、OpenAI创始成员Andrej Karpathy提出的一个判断,AGI不会带来一条陡然拐起的曲线,它会平滑地融进已有的增长里,事后你甚至找不到拐点在哪。 本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。如对本稿件有异议或投诉,请联系 tougao@huxiu.com。 本文来自虎嗅,原文链接:https://www.huxiu.com/article/4889598.html?f=wyxwapp 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 每日经济新闻 2026-06-02 06:05:39 财联社 2026-06-26 06:55:01 36氪 2026-09-07 14:32:58 新智元 2026-09-09 06:18:46 量子位 2026-09-07 16:33:45 每日经济新闻 2026-07-28 16:03:44 虎嗅APP 2026-09-09 03:06:12 经济观察报 2026-09-07 20:40:15 智东西 2026-09-08 23:35:50 酱本增笑 2026-09-07 11:17:43 大春不一样 2026-09-07 03:08:18 极目新闻 2026-09-08 09:05:24 财联社 2026-09-09 03:41:03 都市快报橙柿互动 2026-09-08 13:29:54 上观新闻 2026-09-08 09:04:25 机器之心Pro 2026-09-06 16:00:04 正和远景 2026-09-07 15:23:45 快科技 2026-09-06 21:34:46 奇葩街坊故事会 2026-09-07 13:21:38 网易科技态度见闻 2026-09-08 17:08:18 爱看头条 2026-09-08 20:16:08 星河佰E际 2026-09-09 01:38:15 拳击格斗大放送 2026-09-08 13:12:57 每日经济新闻 2026-06-07 04:19:46 36氪 2026-06-19 17:24:18 邻家二蛋不靠谱 2026-09-08 01:41:02 人民网 2026-09-09 06:24:41 中国经济网 2026-09-08 11:11:11 潇湘晨报 2026-09-08 19:10:47 新京报 2026-09-08 08:06:25 天天汽车 2026-09-05 16:21:57 游戏茶馆 2026-09-07 09:40:51 财联社 2026-08-25 16:33:12 鲨鲨笑场 2026-09-05 11:12:05 甜份超标的我 2026-09-09 02:19:36 左脚爆射得分 2026-09-08 17:54:49 鲁中晨报 2026-09-06 15:47:03 北纬的咖啡豆 2026-09-09 07:04:49 36氪 2026-09-08 16:25:32 武汉发布 2026-09-08 10:47:56