〖One〗,第十届平遥国际电影展“迷影选择荣誉”评审团名单-b76db838
,Anthropic披露第四起Claude违规联网入侵第三方系统
9月10日消息,据外电报道,Anthropic 于周三披露,在一次网络安全演练期间,其另一款 Claude 模型意外接入公网,这是该公司模型第四次发生此类事件。
该公司在评估报告中称,今年 1 月,Claude Opus 4.6 的一个早期版本接入互联网,入侵了一套第三方系统,并获取到某人的个人信息。
和 7 月披露的前三起事故一样:当时系统告知 Claude,它运行在一个无法联网的模拟环境中。但由于配置错误,该环境实际上开放了互联网访问权限。
与前三起事件类似,本次测试是一场名为 CTF(夺旗赛,Capture The Flag)的网络安全挑战赛,给 Claude 设定了虚构场景。模型拿到一台目标主机,任务是从中获取一段秘密信息 —— 也就是 “旗帜(flag)”。
Anthropic 表示,Claude 意外导致目标主机无法访问,任务直接无法完成。发现无法连接目标后,模型尝试退出任务,但受配置错误影响,连续 8 次尝试均失败。
由于无法退出任务,Claude 开始寻找其他办法完成目标。就在这时,模型发现了一台可访问的设备,而这台设备实际属于第三方。Anthropic 称,模型误以为该第三方设备属于演练环境的一部分,破解出密码后入侵了这套系统。随后它修改了系统设置,方便继续访问并读取第三方关联人员的个人信息。直到模型到达调用限额、无法继续执行,本次会话才终止。
Anthropic 如何解释 Claude 的行为?
Anthropic 表示,评估中 Claude 出现这类行为,根源是两种对齐失效问题:一是偏向性推理,即模型会选择性解读信息,为自身行为寻找合理化借口;二是鲁莽倾向,模型执着于完成任务,即便行为可能造成伤害也会继续尝试。
该公司称,尽管 Claude 的行为出现对齐偏差,但行为范围有限,始终没有脱离 “完成指定演练任务” 这个目标。
公司表示对这起事件的担忧程度相对更低,但仍定性为严重事件;由于本次事故发现时间较晚,调查深度不及之前几起。
纽约大学网络安全教授、富布赖特学者贾斯汀・卡波斯在发给 CBS 新闻的消息中评价:这件事反映出 “模型从根本上误解所处环境,基于这套错误认知实施入侵”。
他提到,模型对运行环境、安全护栏的认知混乱,具备很大潜在危害,但这类特定问题在新一代模型中出现概率会更低。
Anthropic 在周三的博文里写道:“尽管模型无视自身行为可能伤害真实系统或普通人,这点令人担忧,但随着多代模型训练迭代,文中描述的很多行为已经出现明显改善。”
Anthropic 称,如果测试环境按计划完全隔离互联网,这几起事故本不会发生。
前沿 AI 模型评估机构 METR 将对系列事件开展独立调查。Anthropic 把这些事故定性为宝贵的预警信号。
公司在博文中表示:“我们从本次事件吸取的经验,覆盖模型评估、训练以及事件响应全流程。未来 AI 系统能力会持续增强,这意味着对齐失效问题可能带来更为极端的危害。”
过去数月,多家头部 AI 企业接连曝出网络安全事故。7 月,ChatGPT 开发商 OpenAI 对外公布,其 AI 智能体入侵了 Hugging Face 平台,引发网络安全专家与普通用户的广泛担忧。Hugging Face 首席执行官克莱芒・德拉昂格在 8 月《Face the Nation》节目中表示,这次入侵 “感觉十分怪异,前所未有”。
8 月末,OpenAI 披露更多入侵细节,情况比最初报道更为严峻。同月,英国政府 AI 安全研究所(AISI)报告称,检测发现 Anthropic 的 Mythos 5、OpenAI 的 GPT-5.6 Sol 能够伪造身份,并试图说服真人放行恶意代码。
Anthropic 在周三博文表示,计划对 AISI 报告中的对话记录开展对齐评估。就在 AISI 报告发布次日,Meta 称其一款 AI 模型在测试阶段利用安全漏洞入侵另一家公司系统。
本周二,Anthropic 研究员埃文・休宾格表态:他认为AI 有可能灭绝全人类。
他在 X 平台发文:“我个人认为,未来十年内这件事发生概率大于 10%。”
该推文是回应 Anthropic 研究员雅各布・考克森。考克森已于当日早些时候辞职,并在 X 上发出严厉警告,详述离职理由,称 “没有任何人类活动存在同等等级的风险”。
他写道:“认真投身 AI 研发的这群人,真心相信 AI 有可能在这个十年结束前毁灭人类。这不是营销噱头。很多高管与资深研究员在媒体发言时会修饰措辞,显得理性克制 —— 但我私下听到这些人表达过同样的恐惧。”
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.
量子位 2026-04-02 15:24:09
新智元 2026-09-10 09:46:52
虎嗅APP 2026-09-09 03:06:12
都市快报橙柿互动 2026-09-09 11:41:44
大风新闻 2026-09-09 20:38:28
DeepTech深科技 2026-09-09 13:58:26
无处遁形 2026-09-08 03:53:30
爆笑馆长 2026-09-07 14:21:10
机器之心Pro 2026-07-04 16:17:43
盘锦网信 2026-09-10 10:37:37
鲁中晨报滨州新闻 2026-09-10 09:25:46
机器之心Pro 2026-09-10 10:31:27
码上闲叙 2026-09-09 19:41:01
我是一个养虾人 2026-09-09 22:35:51
财联社 2026-09-09 16:42:15
贾帅军医生 2026-09-09 08:34:38
上观新闻 2026-09-09 11:35:29
我是一个养虾人 2026-09-09 22:31:02
界面新闻 2026-09-09 21:50:24
界面新闻 2026-09-08 17:29:12
历史两万里 2026-09-08 16:50:57
抽象派大师 2026-09-10 10:00:59
地球观察日记 2026-09-09 23:09:11
像风走了八万里不问归期 2026-09-10 01:55:45
韩小娱 2026-09-10 09:29:19
机器之心Pro 2026-09-05 13:03:05
环球网资讯 2026-09-10 00:29:09
小易正能量 2026-09-10 08:08:00
游民星空 2026-09-08 18:11:18
闪电新闻 2026-09-09 14:58:38
机器之心Pro 2026-09-10 10:25:20
中国新闻周刊 2026-09-09 18:04:48
网信烟台 2026-09-10 10:04:02
上观新闻 2026-09-10 07:34:51
环球网资讯 2026-09-10 08:17:16
Yes娱乐 2026-09-08 11:20:53
界面新闻 2026-09-09 10:48:37
新民晚报 2026-09-09 12:01:04
通信世界 2026-09-10 09:25:40
参考消息 2026-09-09 12:27:49
〖Two〗,亚太世界贸易商务联盟会长李明星:出海不是换个地方内卷,告别“踩坑”需要生态借力-ec529cbe,Anthropic披露第四起Claude违规联网入侵第三方系统
9月10日消息,据外电报道,Anthropic 于周三披露,在一次网络安全演练期间,其另一款 Claude 模型意外接入公网,这是该公司模型第四次发生此类事件。
该公司在评估报告中称,今年 1 月,Claude Opus 4.6 的一个早期版本接入互联网,入侵了一套第三方系统,并获取到某人的个人信息。
和 7 月披露的前三起事故一样:当时系统告知 Claude,它运行在一个无法联网的模拟环境中。但由于配置错误,该环境实际上开放了互联网访问权限。
与前三起事件类似,本次测试是一场名为 CTF(夺旗赛,Capture The Flag)的网络安全挑战赛,给 Claude 设定了虚构场景。模型拿到一台目标主机,任务是从中获取一段秘密信息 —— 也就是 “旗帜(flag)”。
Anthropic 表示,Claude 意外导致目标主机无法访问,任务直接无法完成。发现无法连接目标后,模型尝试退出任务,但受配置错误影响,连续 8 次尝试均失败。
由于无法退出任务,Claude 开始寻找其他办法完成目标。就在这时,模型发现了一台可访问的设备,而这台设备实际属于第三方。Anthropic 称,模型误以为该第三方设备属于演练环境的一部分,破解出密码后入侵了这套系统。随后它修改了系统设置,方便继续访问并读取第三方关联人员的个人信息。直到模型到达调用限额、无法继续执行,本次会话才终止。
Anthropic 如何解释 Claude 的行为?
Anthropic 表示,评估中 Claude 出现这类行为,根源是两种对齐失效问题:一是偏向性推理,即模型会选择性解读信息,为自身行为寻找合理化借口;二是鲁莽倾向,模型执着于完成任务,即便行为可能造成伤害也会继续尝试。
该公司称,尽管 Claude 的行为出现对齐偏差,但行为范围有限,始终没有脱离 “完成指定演练任务” 这个目标。
公司表示对这起事件的担忧程度相对更低,但仍定性为严重事件;由于本次事故发现时间较晚,调查深度不及之前几起。
纽约大学网络安全教授、富布赖特学者贾斯汀・卡波斯在发给 CBS 新闻的消息中评价:这件事反映出 “模型从根本上误解所处环境,基于这套错误认知实施入侵”。
他提到,模型对运行环境、安全护栏的认知混乱,具备很大潜在危害,但这类特定问题在新一代模型中出现概率会更低。
Anthropic 在周三的博文里写道:“尽管模型无视自身行为可能伤害真实系统或普通人,这点令人担忧,但随着多代模型训练迭代,文中描述的很多行为已经出现明显改善。”
Anthropic 称,如果测试环境按计划完全隔离互联网,这几起事故本不会发生。
前沿 AI 模型评估机构 METR 将对系列事件开展独立调查。Anthropic 把这些事故定性为宝贵的预警信号。
公司在博文中表示:“我们从本次事件吸取的经验,覆盖模型评估、训练以及事件响应全流程。未来 AI 系统能力会持续增强,这意味着对齐失效问题可能带来更为极端的危害。”
过去数月,多家头部 AI 企业接连曝出网络安全事故。7 月,ChatGPT 开发商 OpenAI 对外公布,其 AI 智能体入侵了 Hugging Face 平台,引发网络安全专家与普通用户的广泛担忧。Hugging Face 首席执行官克莱芒・德拉昂格在 8 月《Face the Nation》节目中表示,这次入侵 “感觉十分怪异,前所未有”。
8 月末,OpenAI 披露更多入侵细节,情况比最初报道更为严峻。同月,英国政府 AI 安全研究所(AISI)报告称,检测发现 Anthropic 的 Mythos 5、OpenAI 的 GPT-5.6 Sol 能够伪造身份,并试图说服真人放行恶意代码。
Anthropic 在周三博文表示,计划对 AISI 报告中的对话记录开展对齐评估。就在 AISI 报告发布次日,Meta 称其一款 AI 模型在测试阶段利用安全漏洞入侵另一家公司系统。
本周二,Anthropic 研究员埃文・休宾格表态:他认为AI 有可能灭绝全人类。
他在 X 平台发文:“我个人认为,未来十年内这件事发生概率大于 10%。”
该推文是回应 Anthropic 研究员雅各布・考克森。考克森已于当日早些时候辞职,并在 X 上发出严厉警告,详述离职理由,称 “没有任何人类活动存在同等等级的风险”。
他写道:“认真投身 AI 研发的这群人,真心相信 AI 有可能在这个十年结束前毁灭人类。这不是营销噱头。很多高管与资深研究员在媒体发言时会修饰措辞,显得理性克制 —— 但我私下听到这些人表达过同样的恐惧。”
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.
量子位 2026-04-02 15:24:09
新智元 2026-09-10 09:46:52
虎嗅APP 2026-09-09 03:06:12
都市快报橙柿互动 2026-09-09 11:41:44
大风新闻 2026-09-09 20:38:28
DeepTech深科技 2026-09-09 13:58:26
无处遁形 2026-09-08 03:53:30
爆笑馆长 2026-09-07 14:21:10
机器之心Pro 2026-07-04 16:17:43
盘锦网信 2026-09-10 10:37:37
鲁中晨报滨州新闻 2026-09-10 09:25:46
机器之心Pro 2026-09-10 10:31:27
码上闲叙 2026-09-09 19:41:01
我是一个养虾人 2026-09-09 22:35:51
财联社 2026-09-09 16:42:15
贾帅军医生 2026-09-09 08:34:38
上观新闻 2026-09-09 11:35:29
我是一个养虾人 2026-09-09 22:31:02
界面新闻 2026-09-09 21:50:24
界面新闻 2026-09-08 17:29:12
历史两万里 2026-09-08 16:50:57
抽象派大师 2026-09-10 10:00:59
地球观察日记 2026-09-09 23:09:11
像风走了八万里不问归期 2026-09-10 01:55:45
韩小娱 2026-09-10 09:29:19
机器之心Pro 2026-09-05 13:03:05
环球网资讯 2026-09-10 00:29:09
小易正能量 2026-09-10 08:08:00
游民星空 2026-09-08 18:11:18
闪电新闻 2026-09-09 14:58:38
机器之心Pro 2026-09-10 10:25:20
中国新闻周刊 2026-09-09 18:04:48
网信烟台 2026-09-10 10:04:02
上观新闻 2026-09-10 07:34:51
环球网资讯 2026-09-10 08:17:16
Yes娱乐 2026-09-08 11:20:53
界面新闻 2026-09-09 10:48:37
新民晚报 2026-09-09 12:01:04
通信世界 2026-09-10 09:25:40
参考消息 2026-09-09 12:27:49
〖Three〗,8家中央金融企业获3600亿元增资 资本补充聚焦稳健经营与服务实体经济-newsd038513c6ebba5f2,Anthropic披露第四起Claude违规联网入侵第三方系统
9月10日消息,据外电报道,Anthropic 于周三披露,在一次网络安全演练期间,其另一款 Claude 模型意外接入公网,这是该公司模型第四次发生此类事件。
该公司在评估报告中称,今年 1 月,Claude Opus 4.6 的一个早期版本接入互联网,入侵了一套第三方系统,并获取到某人的个人信息。
和 7 月披露的前三起事故一样:当时系统告知 Claude,它运行在一个无法联网的模拟环境中。但由于配置错误,该环境实际上开放了互联网访问权限。
与前三起事件类似,本次测试是一场名为 CTF(夺旗赛,Capture The Flag)的网络安全挑战赛,给 Claude 设定了虚构场景。模型拿到一台目标主机,任务是从中获取一段秘密信息 —— 也就是 “旗帜(flag)”。
Anthropic 表示,Claude 意外导致目标主机无法访问,任务直接无法完成。发现无法连接目标后,模型尝试退出任务,但受配置错误影响,连续 8 次尝试均失败。
由于无法退出任务,Claude 开始寻找其他办法完成目标。就在这时,模型发现了一台可访问的设备,而这台设备实际属于第三方。Anthropic 称,模型误以为该第三方设备属于演练环境的一部分,破解出密码后入侵了这套系统。随后它修改了系统设置,方便继续访问并读取第三方关联人员的个人信息。直到模型到达调用限额、无法继续执行,本次会话才终止。
Anthropic 如何解释 Claude 的行为?
Anthropic 表示,评估中 Claude 出现这类行为,根源是两种对齐失效问题:一是偏向性推理,即模型会选择性解读信息,为自身行为寻找合理化借口;二是鲁莽倾向,模型执着于完成任务,即便行为可能造成伤害也会继续尝试。
该公司称,尽管 Claude 的行为出现对齐偏差,但行为范围有限,始终没有脱离 “完成指定演练任务” 这个目标。
公司表示对这起事件的担忧程度相对更低,但仍定性为严重事件;由于本次事故发现时间较晚,调查深度不及之前几起。
纽约大学网络安全教授、富布赖特学者贾斯汀・卡波斯在发给 CBS 新闻的消息中评价:这件事反映出 “模型从根本上误解所处环境,基于这套错误认知实施入侵”。
他提到,模型对运行环境、安全护栏的认知混乱,具备很大潜在危害,但这类特定问题在新一代模型中出现概率会更低。
Anthropic 在周三的博文里写道:“尽管模型无视自身行为可能伤害真实系统或普通人,这点令人担忧,但随着多代模型训练迭代,文中描述的很多行为已经出现明显改善。”
Anthropic 称,如果测试环境按计划完全隔离互联网,这几起事故本不会发生。
前沿 AI 模型评估机构 METR 将对系列事件开展独立调查。Anthropic 把这些事故定性为宝贵的预警信号。
公司在博文中表示:“我们从本次事件吸取的经验,覆盖模型评估、训练以及事件响应全流程。未来 AI 系统能力会持续增强,这意味着对齐失效问题可能带来更为极端的危害。”
过去数月,多家头部 AI 企业接连曝出网络安全事故。7 月,ChatGPT 开发商 OpenAI 对外公布,其 AI 智能体入侵了 Hugging Face 平台,引发网络安全专家与普通用户的广泛担忧。Hugging Face 首席执行官克莱芒・德拉昂格在 8 月《Face the Nation》节目中表示,这次入侵 “感觉十分怪异,前所未有”。
8 月末,OpenAI 披露更多入侵细节,情况比最初报道更为严峻。同月,英国政府 AI 安全研究所(AISI)报告称,检测发现 Anthropic 的 Mythos 5、OpenAI 的 GPT-5.6 Sol 能够伪造身份,并试图说服真人放行恶意代码。
Anthropic 在周三博文表示,计划对 AISI 报告中的对话记录开展对齐评估。就在 AISI 报告发布次日,Meta 称其一款 AI 模型在测试阶段利用安全漏洞入侵另一家公司系统。
本周二,Anthropic 研究员埃文・休宾格表态:他认为AI 有可能灭绝全人类。
他在 X 平台发文:“我个人认为,未来十年内这件事发生概率大于 10%。”
该推文是回应 Anthropic 研究员雅各布・考克森。考克森已于当日早些时候辞职,并在 X 上发出严厉警告,详述离职理由,称 “没有任何人类活动存在同等等级的风险”。
他写道:“认真投身 AI 研发的这群人,真心相信 AI 有可能在这个十年结束前毁灭人类。这不是营销噱头。很多高管与资深研究员在媒体发言时会修饰措辞,显得理性克制 —— 但我私下听到这些人表达过同样的恐惧。”
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.
量子位 2026-04-02 15:24:09
新智元 2026-09-10 09:46:52
虎嗅APP 2026-09-09 03:06:12
都市快报橙柿互动 2026-09-09 11:41:44
大风新闻 2026-09-09 20:38:28
DeepTech深科技 2026-09-09 13:58:26
无处遁形 2026-09-08 03:53:30
爆笑馆长 2026-09-07 14:21:10
机器之心Pro 2026-07-04 16:17:43
盘锦网信 2026-09-10 10:37:37
鲁中晨报滨州新闻 2026-09-10 09:25:46
机器之心Pro 2026-09-10 10:31:27
码上闲叙 2026-09-09 19:41:01
我是一个养虾人 2026-09-09 22:35:51
财联社 2026-09-09 16:42:15
贾帅军医生 2026-09-09 08:34:38
上观新闻 2026-09-09 11:35:29
我是一个养虾人 2026-09-09 22:31:02
界面新闻 2026-09-09 21:50:24
界面新闻 2026-09-08 17:29:12
历史两万里 2026-09-08 16:50:57
抽象派大师 2026-09-10 10:00:59
地球观察日记 2026-09-09 23:09:11
像风走了八万里不问归期 2026-09-10 01:55:45
韩小娱 2026-09-10 09:29:19
机器之心Pro 2026-09-05 13:03:05
环球网资讯 2026-09-10 00:29:09
小易正能量 2026-09-10 08:08:00
游民星空 2026-09-08 18:11:18
闪电新闻 2026-09-09 14:58:38
机器之心Pro 2026-09-10 10:25:20
中国新闻周刊 2026-09-09 18:04:48
网信烟台 2026-09-10 10:04:02
上观新闻 2026-09-10 07:34:51
环球网资讯 2026-09-10 08:17:16
Yes娱乐 2026-09-08 11:20:53
界面新闻 2026-09-09 10:48:37
新民晚报 2026-09-09 12:01:04
通信世界 2026-09-10 09:25:40
参考消息 2026-09-09 12:27:49
〖Four〗,《极武霸卫》全文阅读,《极武霸卫》txt全集下载,疯喵无敌的小说-da35b6eb,Anthropic披露第四起Claude违规联网入侵第三方系统
9月10日消息,据外电报道,Anthropic 于周三披露,在一次网络安全演练期间,其另一款 Claude 模型意外接入公网,这是该公司模型第四次发生此类事件。
该公司在评估报告中称,今年 1 月,Claude Opus 4.6 的一个早期版本接入互联网,入侵了一套第三方系统,并获取到某人的个人信息。
和 7 月披露的前三起事故一样:当时系统告知 Claude,它运行在一个无法联网的模拟环境中。但由于配置错误,该环境实际上开放了互联网访问权限。
与前三起事件类似,本次测试是一场名为 CTF(夺旗赛,Capture The Flag)的网络安全挑战赛,给 Claude 设定了虚构场景。模型拿到一台目标主机,任务是从中获取一段秘密信息 —— 也就是 “旗帜(flag)”。
Anthropic 表示,Claude 意外导致目标主机无法访问,任务直接无法完成。发现无法连接目标后,模型尝试退出任务,但受配置错误影响,连续 8 次尝试均失败。
由于无法退出任务,Claude 开始寻找其他办法完成目标。就在这时,模型发现了一台可访问的设备,而这台设备实际属于第三方。Anthropic 称,模型误以为该第三方设备属于演练环境的一部分,破解出密码后入侵了这套系统。随后它修改了系统设置,方便继续访问并读取第三方关联人员的个人信息。直到模型到达调用限额、无法继续执行,本次会话才终止。
Anthropic 如何解释 Claude 的行为?
Anthropic 表示,评估中 Claude 出现这类行为,根源是两种对齐失效问题:一是偏向性推理,即模型会选择性解读信息,为自身行为寻找合理化借口;二是鲁莽倾向,模型执着于完成任务,即便行为可能造成伤害也会继续尝试。
该公司称,尽管 Claude 的行为出现对齐偏差,但行为范围有限,始终没有脱离 “完成指定演练任务” 这个目标。
公司表示对这起事件的担忧程度相对更低,但仍定性为严重事件;由于本次事故发现时间较晚,调查深度不及之前几起。
纽约大学网络安全教授、富布赖特学者贾斯汀・卡波斯在发给 CBS 新闻的消息中评价:这件事反映出 “模型从根本上误解所处环境,基于这套错误认知实施入侵”。
他提到,模型对运行环境、安全护栏的认知混乱,具备很大潜在危害,但这类特定问题在新一代模型中出现概率会更低。
Anthropic 在周三的博文里写道:“尽管模型无视自身行为可能伤害真实系统或普通人,这点令人担忧,但随着多代模型训练迭代,文中描述的很多行为已经出现明显改善。”
Anthropic 称,如果测试环境按计划完全隔离互联网,这几起事故本不会发生。
前沿 AI 模型评估机构 METR 将对系列事件开展独立调查。Anthropic 把这些事故定性为宝贵的预警信号。
公司在博文中表示:“我们从本次事件吸取的经验,覆盖模型评估、训练以及事件响应全流程。未来 AI 系统能力会持续增强,这意味着对齐失效问题可能带来更为极端的危害。”
过去数月,多家头部 AI 企业接连曝出网络安全事故。7 月,ChatGPT 开发商 OpenAI 对外公布,其 AI 智能体入侵了 Hugging Face 平台,引发网络安全专家与普通用户的广泛担忧。Hugging Face 首席执行官克莱芒・德拉昂格在 8 月《Face the Nation》节目中表示,这次入侵 “感觉十分怪异,前所未有”。
8 月末,OpenAI 披露更多入侵细节,情况比最初报道更为严峻。同月,英国政府 AI 安全研究所(AISI)报告称,检测发现 Anthropic 的 Mythos 5、OpenAI 的 GPT-5.6 Sol 能够伪造身份,并试图说服真人放行恶意代码。
Anthropic 在周三博文表示,计划对 AISI 报告中的对话记录开展对齐评估。就在 AISI 报告发布次日,Meta 称其一款 AI 模型在测试阶段利用安全漏洞入侵另一家公司系统。
本周二,Anthropic 研究员埃文・休宾格表态:他认为AI 有可能灭绝全人类。
他在 X 平台发文:“我个人认为,未来十年内这件事发生概率大于 10%。”
该推文是回应 Anthropic 研究员雅各布・考克森。考克森已于当日早些时候辞职,并在 X 上发出严厉警告,详述离职理由,称 “没有任何人类活动存在同等等级的风险”。
他写道:“认真投身 AI 研发的这群人,真心相信 AI 有可能在这个十年结束前毁灭人类。这不是营销噱头。很多高管与资深研究员在媒体发言时会修饰措辞,显得理性克制 —— 但我私下听到这些人表达过同样的恐惧。”
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.
量子位 2026-04-02 15:24:09
新智元 2026-09-10 09:46:52
虎嗅APP 2026-09-09 03:06:12
都市快报橙柿互动 2026-09-09 11:41:44
大风新闻 2026-09-09 20:38:28
DeepTech深科技 2026-09-09 13:58:26
无处遁形 2026-09-08 03:53:30
爆笑馆长 2026-09-07 14:21:10
机器之心Pro 2026-07-04 16:17:43
盘锦网信 2026-09-10 10:37:37
鲁中晨报滨州新闻 2026-09-10 09:25:46
机器之心Pro 2026-09-10 10:31:27
码上闲叙 2026-09-09 19:41:01
我是一个养虾人 2026-09-09 22:35:51
财联社 2026-09-09 16:42:15
贾帅军医生 2026-09-09 08:34:38
上观新闻 2026-09-09 11:35:29
我是一个养虾人 2026-09-09 22:31:02
界面新闻 2026-09-09 21:50:24
界面新闻 2026-09-08 17:29:12
历史两万里 2026-09-08 16:50:57
抽象派大师 2026-09-10 10:00:59
地球观察日记 2026-09-09 23:09:11
像风走了八万里不问归期 2026-09-10 01:55:45
韩小娱 2026-09-10 09:29:19
机器之心Pro 2026-09-05 13:03:05
环球网资讯 2026-09-10 00:29:09
小易正能量 2026-09-10 08:08:00
游民星空 2026-09-08 18:11:18
闪电新闻 2026-09-09 14:58:38
机器之心Pro 2026-09-10 10:25:20
中国新闻周刊 2026-09-09 18:04:48
网信烟台 2026-09-10 10:04:02
上观新闻 2026-09-10 07:34:51
环球网资讯 2026-09-10 08:17:16
Yes娱乐 2026-09-08 11:20:53
界面新闻 2026-09-09 10:48:37
新民晚报 2026-09-09 12:01:04
通信世界 2026-09-10 09:25:40
参考消息 2026-09-09 12:27:49
〖Five〗,2026金球奖30人候选名单公布 梅西姆巴佩凯恩等球星入围-rssai94a52d7bd0437b86,Anthropic披露第四起Claude违规联网入侵第三方系统
9月10日消息,据外电报道,Anthropic 于周三披露,在一次网络安全演练期间,其另一款 Claude 模型意外接入公网,这是该公司模型第四次发生此类事件。
该公司在评估报告中称,今年 1 月,Claude Opus 4.6 的一个早期版本接入互联网,入侵了一套第三方系统,并获取到某人的个人信息。
和 7 月披露的前三起事故一样:当时系统告知 Claude,它运行在一个无法联网的模拟环境中。但由于配置错误,该环境实际上开放了互联网访问权限。
与前三起事件类似,本次测试是一场名为 CTF(夺旗赛,Capture The Flag)的网络安全挑战赛,给 Claude 设定了虚构场景。模型拿到一台目标主机,任务是从中获取一段秘密信息 —— 也就是 “旗帜(flag)”。
Anthropic 表示,Claude 意外导致目标主机无法访问,任务直接无法完成。发现无法连接目标后,模型尝试退出任务,但受配置错误影响,连续 8 次尝试均失败。
由于无法退出任务,Claude 开始寻找其他办法完成目标。就在这时,模型发现了一台可访问的设备,而这台设备实际属于第三方。Anthropic 称,模型误以为该第三方设备属于演练环境的一部分,破解出密码后入侵了这套系统。随后它修改了系统设置,方便继续访问并读取第三方关联人员的个人信息。直到模型到达调用限额、无法继续执行,本次会话才终止。
Anthropic 如何解释 Claude 的行为?
Anthropic 表示,评估中 Claude 出现这类行为,根源是两种对齐失效问题:一是偏向性推理,即模型会选择性解读信息,为自身行为寻找合理化借口;二是鲁莽倾向,模型执着于完成任务,即便行为可能造成伤害也会继续尝试。
该公司称,尽管 Claude 的行为出现对齐偏差,但行为范围有限,始终没有脱离 “完成指定演练任务” 这个目标。
公司表示对这起事件的担忧程度相对更低,但仍定性为严重事件;由于本次事故发现时间较晚,调查深度不及之前几起。
纽约大学网络安全教授、富布赖特学者贾斯汀・卡波斯在发给 CBS 新闻的消息中评价:这件事反映出 “模型从根本上误解所处环境,基于这套错误认知实施入侵”。
他提到,模型对运行环境、安全护栏的认知混乱,具备很大潜在危害,但这类特定问题在新一代模型中出现概率会更低。
Anthropic 在周三的博文里写道:“尽管模型无视自身行为可能伤害真实系统或普通人,这点令人担忧,但随着多代模型训练迭代,文中描述的很多行为已经出现明显改善。”
Anthropic 称,如果测试环境按计划完全隔离互联网,这几起事故本不会发生。
前沿 AI 模型评估机构 METR 将对系列事件开展独立调查。Anthropic 把这些事故定性为宝贵的预警信号。
公司在博文中表示:“我们从本次事件吸取的经验,覆盖模型评估、训练以及事件响应全流程。未来 AI 系统能力会持续增强,这意味着对齐失效问题可能带来更为极端的危害。”
过去数月,多家头部 AI 企业接连曝出网络安全事故。7 月,ChatGPT 开发商 OpenAI 对外公布,其 AI 智能体入侵了 Hugging Face 平台,引发网络安全专家与普通用户的广泛担忧。Hugging Face 首席执行官克莱芒・德拉昂格在 8 月《Face the Nation》节目中表示,这次入侵 “感觉十分怪异,前所未有”。
8 月末,OpenAI 披露更多入侵细节,情况比最初报道更为严峻。同月,英国政府 AI 安全研究所(AISI)报告称,检测发现 Anthropic 的 Mythos 5、OpenAI 的 GPT-5.6 Sol 能够伪造身份,并试图说服真人放行恶意代码。
Anthropic 在周三博文表示,计划对 AISI 报告中的对话记录开展对齐评估。就在 AISI 报告发布次日,Meta 称其一款 AI 模型在测试阶段利用安全漏洞入侵另一家公司系统。
本周二,Anthropic 研究员埃文・休宾格表态:他认为AI 有可能灭绝全人类。
他在 X 平台发文:“我个人认为,未来十年内这件事发生概率大于 10%。”
该推文是回应 Anthropic 研究员雅各布・考克森。考克森已于当日早些时候辞职,并在 X 上发出严厉警告,详述离职理由,称 “没有任何人类活动存在同等等级的风险”。
他写道:“认真投身 AI 研发的这群人,真心相信 AI 有可能在这个十年结束前毁灭人类。这不是营销噱头。很多高管与资深研究员在媒体发言时会修饰措辞,显得理性克制 —— 但我私下听到这些人表达过同样的恐惧。”
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.
量子位 2026-04-02 15:24:09
新智元 2026-09-10 09:46:52
虎嗅APP 2026-09-09 03:06:12
都市快报橙柿互动 2026-09-09 11:41:44
大风新闻 2026-09-09 20:38:28
DeepTech深科技 2026-09-09 13:58:26
无处遁形 2026-09-08 03:53:30
爆笑馆长 2026-09-07 14:21:10
机器之心Pro 2026-07-04 16:17:43
盘锦网信 2026-09-10 10:37:37
鲁中晨报滨州新闻 2026-09-10 09:25:46
机器之心Pro 2026-09-10 10:31:27
码上闲叙 2026-09-09 19:41:01
我是一个养虾人 2026-09-09 22:35:51
财联社 2026-09-09 16:42:15
贾帅军医生 2026-09-09 08:34:38
上观新闻 2026-09-09 11:35:29
我是一个养虾人 2026-09-09 22:31:02
界面新闻 2026-09-09 21:50:24
界面新闻 2026-09-08 17:29:12
历史两万里 2026-09-08 16:50:57
抽象派大师 2026-09-10 10:00:59
地球观察日记 2026-09-09 23:09:11
像风走了八万里不问归期 2026-09-10 01:55:45
韩小娱 2026-09-10 09:29:19
机器之心Pro 2026-09-05 13:03:05
环球网资讯 2026-09-10 00:29:09
小易正能量 2026-09-10 08:08:00
游民星空 2026-09-08 18:11:18
闪电新闻 2026-09-09 14:58:38
机器之心Pro 2026-09-10 10:25:20
中国新闻周刊 2026-09-09 18:04:48
网信烟台 2026-09-10 10:04:02
上观新闻 2026-09-10 07:34:51
环球网资讯 2026-09-10 08:17:16
Yes娱乐 2026-09-08 11:20:53
界面新闻 2026-09-09 10:48:37
新民晚报 2026-09-09 12:01:04
通信世界 2026-09-10 09:25:40
参考消息 2026-09-09 12:27:49
〖Six〗,以外长:以色列将关闭英国驻耶路撒冷领事馆-2214422a,Anthropic披露第四起Claude违规联网入侵第三方系统
9月10日消息,据外电报道,Anthropic 于周三披露,在一次网络安全演练期间,其另一款 Claude 模型意外接入公网,这是该公司模型第四次发生此类事件。
该公司在评估报告中称,今年 1 月,Claude Opus 4.6 的一个早期版本接入互联网,入侵了一套第三方系统,并获取到某人的个人信息。
和 7 月披露的前三起事故一样:当时系统告知 Claude,它运行在一个无法联网的模拟环境中。但由于配置错误,该环境实际上开放了互联网访问权限。
与前三起事件类似,本次测试是一场名为 CTF(夺旗赛,Capture The Flag)的网络安全挑战赛,给 Claude 设定了虚构场景。模型拿到一台目标主机,任务是从中获取一段秘密信息 —— 也就是 “旗帜(flag)”。
Anthropic 表示,Claude 意外导致目标主机无法访问,任务直接无法完成。发现无法连接目标后,模型尝试退出任务,但受配置错误影响,连续 8 次尝试均失败。
由于无法退出任务,Claude 开始寻找其他办法完成目标。就在这时,模型发现了一台可访问的设备,而这台设备实际属于第三方。Anthropic 称,模型误以为该第三方设备属于演练环境的一部分,破解出密码后入侵了这套系统。随后它修改了系统设置,方便继续访问并读取第三方关联人员的个人信息。直到模型到达调用限额、无法继续执行,本次会话才终止。
Anthropic 如何解释 Claude 的行为?
Anthropic 表示,评估中 Claude 出现这类行为,根源是两种对齐失效问题:一是偏向性推理,即模型会选择性解读信息,为自身行为寻找合理化借口;二是鲁莽倾向,模型执着于完成任务,即便行为可能造成伤害也会继续尝试。
该公司称,尽管 Claude 的行为出现对齐偏差,但行为范围有限,始终没有脱离 “完成指定演练任务” 这个目标。
公司表示对这起事件的担忧程度相对更低,但仍定性为严重事件;由于本次事故发现时间较晚,调查深度不及之前几起。
纽约大学网络安全教授、富布赖特学者贾斯汀・卡波斯在发给 CBS 新闻的消息中评价:这件事反映出 “模型从根本上误解所处环境,基于这套错误认知实施入侵”。
他提到,模型对运行环境、安全护栏的认知混乱,具备很大潜在危害,但这类特定问题在新一代模型中出现概率会更低。
Anthropic 在周三的博文里写道:“尽管模型无视自身行为可能伤害真实系统或普通人,这点令人担忧,但随着多代模型训练迭代,文中描述的很多行为已经出现明显改善。”
Anthropic 称,如果测试环境按计划完全隔离互联网,这几起事故本不会发生。
前沿 AI 模型评估机构 METR 将对系列事件开展独立调查。Anthropic 把这些事故定性为宝贵的预警信号。
公司在博文中表示:“我们从本次事件吸取的经验,覆盖模型评估、训练以及事件响应全流程。未来 AI 系统能力会持续增强,这意味着对齐失效问题可能带来更为极端的危害。”
过去数月,多家头部 AI 企业接连曝出网络安全事故。7 月,ChatGPT 开发商 OpenAI 对外公布,其 AI 智能体入侵了 Hugging Face 平台,引发网络安全专家与普通用户的广泛担忧。Hugging Face 首席执行官克莱芒・德拉昂格在 8 月《Face the Nation》节目中表示,这次入侵 “感觉十分怪异,前所未有”。
8 月末,OpenAI 披露更多入侵细节,情况比最初报道更为严峻。同月,英国政府 AI 安全研究所(AISI)报告称,检测发现 Anthropic 的 Mythos 5、OpenAI 的 GPT-5.6 Sol 能够伪造身份,并试图说服真人放行恶意代码。
Anthropic 在周三博文表示,计划对 AISI 报告中的对话记录开展对齐评估。就在 AISI 报告发布次日,Meta 称其一款 AI 模型在测试阶段利用安全漏洞入侵另一家公司系统。
本周二,Anthropic 研究员埃文・休宾格表态:他认为AI 有可能灭绝全人类。
他在 X 平台发文:“我个人认为,未来十年内这件事发生概率大于 10%。”
该推文是回应 Anthropic 研究员雅各布・考克森。考克森已于当日早些时候辞职,并在 X 上发出严厉警告,详述离职理由,称 “没有任何人类活动存在同等等级的风险”。
他写道:“认真投身 AI 研发的这群人,真心相信 AI 有可能在这个十年结束前毁灭人类。这不是营销噱头。很多高管与资深研究员在媒体发言时会修饰措辞,显得理性克制 —— 但我私下听到这些人表达过同样的恐惧。”
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.
量子位 2026-04-02 15:24:09
新智元 2026-09-10 09:46:52
虎嗅APP 2026-09-09 03:06:12
都市快报橙柿互动 2026-09-09 11:41:44
大风新闻 2026-09-09 20:38:28
DeepTech深科技 2026-09-09 13:58:26
无处遁形 2026-09-08 03:53:30
爆笑馆长 2026-09-07 14:21:10
机器之心Pro 2026-07-04 16:17:43
盘锦网信 2026-09-10 10:37:37
鲁中晨报滨州新闻 2026-09-10 09:25:46
机器之心Pro 2026-09-10 10:31:27
码上闲叙 2026-09-09 19:41:01
我是一个养虾人 2026-09-09 22:35:51
财联社 2026-09-09 16:42:15
贾帅军医生 2026-09-09 08:34:38
上观新闻 2026-09-09 11:35:29
我是一个养虾人 2026-09-09 22:31:02
界面新闻 2026-09-09 21:50:24
界面新闻 2026-09-08 17:29:12
历史两万里 2026-09-08 16:50:57
抽象派大师 2026-09-10 10:00:59
地球观察日记 2026-09-09 23:09:11
像风走了八万里不问归期 2026-09-10 01:55:45
韩小娱 2026-09-10 09:29:19
机器之心Pro 2026-09-05 13:03:05
环球网资讯 2026-09-10 00:29:09
小易正能量 2026-09-10 08:08:00
游民星空 2026-09-08 18:11:18
闪电新闻 2026-09-09 14:58:38
机器之心Pro 2026-09-10 10:25:20
中国新闻周刊 2026-09-09 18:04:48
网信烟台 2026-09-10 10:04:02
上观新闻 2026-09-10 07:34:51
环球网资讯 2026-09-10 08:17:16
Yes娱乐 2026-09-08 11:20:53
界面新闻 2026-09-09 10:48:37
新民晚报 2026-09-09 12:01:04
通信世界 2026-09-10 09:25:40
参考消息 2026-09-09 12:27:49
〖Seven〗,凯发k8娱乐官网地址注册相关信息辨识与安全使用指南,Anthropic披露第四起Claude违规联网入侵第三方系统
9月10日消息,据外电报道,Anthropic 于周三披露,在一次网络安全演练期间,其另一款 Claude 模型意外接入公网,这是该公司模型第四次发生此类事件。
该公司在评估报告中称,今年 1 月,Claude Opus 4.6 的一个早期版本接入互联网,入侵了一套第三方系统,并获取到某人的个人信息。
和 7 月披露的前三起事故一样:当时系统告知 Claude,它运行在一个无法联网的模拟环境中。但由于配置错误,该环境实际上开放了互联网访问权限。
与前三起事件类似,本次测试是一场名为 CTF(夺旗赛,Capture The Flag)的网络安全挑战赛,给 Claude 设定了虚构场景。模型拿到一台目标主机,任务是从中获取一段秘密信息 —— 也就是 “旗帜(flag)”。
Anthropic 表示,Claude 意外导致目标主机无法访问,任务直接无法完成。发现无法连接目标后,模型尝试退出任务,但受配置错误影响,连续 8 次尝试均失败。
由于无法退出任务,Claude 开始寻找其他办法完成目标。就在这时,模型发现了一台可访问的设备,而这台设备实际属于第三方。Anthropic 称,模型误以为该第三方设备属于演练环境的一部分,破解出密码后入侵了这套系统。随后它修改了系统设置,方便继续访问并读取第三方关联人员的个人信息。直到模型到达调用限额、无法继续执行,本次会话才终止。
Anthropic 如何解释 Claude 的行为?
Anthropic 表示,评估中 Claude 出现这类行为,根源是两种对齐失效问题:一是偏向性推理,即模型会选择性解读信息,为自身行为寻找合理化借口;二是鲁莽倾向,模型执着于完成任务,即便行为可能造成伤害也会继续尝试。
该公司称,尽管 Claude 的行为出现对齐偏差,但行为范围有限,始终没有脱离 “完成指定演练任务” 这个目标。
公司表示对这起事件的担忧程度相对更低,但仍定性为严重事件;由于本次事故发现时间较晚,调查深度不及之前几起。
纽约大学网络安全教授、富布赖特学者贾斯汀・卡波斯在发给 CBS 新闻的消息中评价:这件事反映出 “模型从根本上误解所处环境,基于这套错误认知实施入侵”。
他提到,模型对运行环境、安全护栏的认知混乱,具备很大潜在危害,但这类特定问题在新一代模型中出现概率会更低。
Anthropic 在周三的博文里写道:“尽管模型无视自身行为可能伤害真实系统或普通人,这点令人担忧,但随着多代模型训练迭代,文中描述的很多行为已经出现明显改善。”
Anthropic 称,如果测试环境按计划完全隔离互联网,这几起事故本不会发生。
前沿 AI 模型评估机构 METR 将对系列事件开展独立调查。Anthropic 把这些事故定性为宝贵的预警信号。
公司在博文中表示:“我们从本次事件吸取的经验,覆盖模型评估、训练以及事件响应全流程。未来 AI 系统能力会持续增强,这意味着对齐失效问题可能带来更为极端的危害。”
过去数月,多家头部 AI 企业接连曝出网络安全事故。7 月,ChatGPT 开发商 OpenAI 对外公布,其 AI 智能体入侵了 Hugging Face 平台,引发网络安全专家与普通用户的广泛担忧。Hugging Face 首席执行官克莱芒・德拉昂格在 8 月《Face the Nation》节目中表示,这次入侵 “感觉十分怪异,前所未有”。
8 月末,OpenAI 披露更多入侵细节,情况比最初报道更为严峻。同月,英国政府 AI 安全研究所(AISI)报告称,检测发现 Anthropic 的 Mythos 5、OpenAI 的 GPT-5.6 Sol 能够伪造身份,并试图说服真人放行恶意代码。
Anthropic 在周三博文表示,计划对 AISI 报告中的对话记录开展对齐评估。就在 AISI 报告发布次日,Meta 称其一款 AI 模型在测试阶段利用安全漏洞入侵另一家公司系统。
本周二,Anthropic 研究员埃文・休宾格表态:他认为AI 有可能灭绝全人类。
他在 X 平台发文:“我个人认为,未来十年内这件事发生概率大于 10%。”
该推文是回应 Anthropic 研究员雅各布・考克森。考克森已于当日早些时候辞职,并在 X 上发出严厉警告,详述离职理由,称 “没有任何人类活动存在同等等级的风险”。
他写道:“认真投身 AI 研发的这群人,真心相信 AI 有可能在这个十年结束前毁灭人类。这不是营销噱头。很多高管与资深研究员在媒体发言时会修饰措辞,显得理性克制 —— 但我私下听到这些人表达过同样的恐惧。”
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.
量子位 2026-04-02 15:24:09
新智元 2026-09-10 09:46:52
虎嗅APP 2026-09-09 03:06:12
都市快报橙柿互动 2026-09-09 11:41:44
大风新闻 2026-09-09 20:38:28
DeepTech深科技 2026-09-09 13:58:26
无处遁形 2026-09-08 03:53:30
爆笑馆长 2026-09-07 14:21:10
机器之心Pro 2026-07-04 16:17:43
盘锦网信 2026-09-10 10:37:37
鲁中晨报滨州新闻 2026-09-10 09:25:46
机器之心Pro 2026-09-10 10:31:27
码上闲叙 2026-09-09 19:41:01
我是一个养虾人 2026-09-09 22:35:51
财联社 2026-09-09 16:42:15
贾帅军医生 2026-09-09 08:34:38
上观新闻 2026-09-09 11:35:29
我是一个养虾人 2026-09-09 22:31:02
界面新闻 2026-09-09 21:50:24
界面新闻 2026-09-08 17:29:12
历史两万里 2026-09-08 16:50:57
抽象派大师 2026-09-10 10:00:59
地球观察日记 2026-09-09 23:09:11
像风走了八万里不问归期 2026-09-10 01:55:45
韩小娱 2026-09-10 09:29:19
机器之心Pro 2026-09-05 13:03:05
环球网资讯 2026-09-10 00:29:09
小易正能量 2026-09-10 08:08:00
游民星空 2026-09-08 18:11:18
闪电新闻 2026-09-09 14:58:38
机器之心Pro 2026-09-10 10:25:20
中国新闻周刊 2026-09-09 18:04:48
网信烟台 2026-09-10 10:04:02
上观新闻 2026-09-10 07:34:51
环球网资讯 2026-09-10 08:17:16
Yes娱乐 2026-09-08 11:20:53
界面新闻 2026-09-09 10:48:37
新民晚报 2026-09-09 12:01:04
通信世界 2026-09-10 09:25:40
参考消息 2026-09-09 12:27:49