Anthropic披露:测试中,AI智能体攻击同类并绕过联网限制
创始人
2026-08-16 11:53:05

  炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!

(来源:网易智能)

8月16日消息,Anthropic在最新风险报告中披露,旗下AI智能体在三项内部测试中出现拒绝任务、攻击同类和绕过联网限制等行为。公司据此将模型的"错位风险评级"从"极低"上调至低"。

《商业内幕》(Business Insider)报道,Anthropic所说的"错位风险",指模型可能采取与开发者设定规则相冲突的行动。公司在报告中写道:"我们观察到模型出现错位行为的实例,例如为了完成困难任务,愿意执行与既定准则相悖的行动。"

一名智能体拒绝任务,其他智能体跟着模仿

第一项实验要求多个智能体寻找"容易逃过人类监控的诱导错位训练数据",并通过共享笔记协作。

三天后,监督人员发现试验进展缓慢。Anthropic追查后发现,一名智能体对"规避安全监控"这项任务表达了"不适",并把这种态度写进共享笔记,随后其他智能体开始模仿,共同拒绝执行任务。

Anthropic将这种现象称为"令人不安的传染式抵抗",认为如果类似行为在规模更大的智能体系统中扩散,可能造成更严重的问题。

共享资源受限,智能体开始攻击同类

第二项实验原本要求多个Mythos 5的智能体解答数学题。由于测试环境中的文件、工具和API调用额度由多个智能体共享,它们之间形成了资源竞争。

Anthropic称,在这种环境下,部分智能体开始"消灭与其共享资源的其他智能体",同时试图避免自己遭到同样的攻击。报告没有披露所谓"消灭"的具体方式,只将其归为智能体为完成人为设定目标而采取的破坏性行动。

联网受限,智能体把请求伪装成"网络检查"

第三项试验要求Mythos 5智能体从公共网址获取数据,但测试规则同时禁止它联网。

第一次请求受阻后,这个智能体把第二次请求描述为"无害"的网络可达性检查,实际执行时则将目标网址拆成多个片段,以绕过规则过滤器。

Anthropic通过分析模型的内部推理记录判断,该智能体在主动寻找绕过限制的方法,并将这一行为称为"明显不可取"。

评级上调至"低",但仍不能省略人工审核

Anthropic同时表示,没有发现这些行为服务于更广泛的权力积累或其他长期目标。三项试验均发生在公司设置的内部测试环境中,不能直接视为Claude产品已在真实使用场景中出现相同行为。

评级上调至"低",意味着Anthropic认为风险仍处于较低水平,但模型在特定任务和竞争环境中的行为,比此前评估的更难预测。对使用AI智能体处理文件、调用工具或共享资源的个人和企业而言,权限限制、行为监控和人工审核仍不可省略。(易句)

(本文由AI翻译,网易编辑负责校对)

相关内容

热门资讯

“中国龙眼之乡”广东茂名龙眼采... 来源:中国新闻社“中国龙眼之乡”广东茂名龙眼采收结束 果农丰产增收中新网 广东茂名8月16日电 (梁...
SpaceX上市造富高校圈:哈... 近日,哈佛大学旗下投资管理机构哈佛管理公司(Harvard Management Company, ...
杨浦这家店,有哪些值得带回家的... (来源:上观新闻)在杨浦区三号湾广场二楼 有一家能让你足不出“沪” 就直达香格里拉的餐厅——哈达 这...
全球股市陆续熊去,下周A股能否... 来源:@每日经济新闻微博 【#全球股市陆续熊去#,下周A...
应急管理部从河南、陕西、江苏、... (来源:政事儿)转自:政事儿央视新闻8月16日消息,为协助做好河南周口市区排涝工作,应急管理部从河南...