炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!
(来源:DeepTech深科技)
近日,Anthropic 发布了一份长达 186 页的最新《风险报告》。
在这份报告中,它没有只评估某个 Claude 模型,而是把视角扩展到整个公司:模型在做什么、员工怎样使用它们、安全系统有没有漏洞、AI 是否正在加速下一代 AI 的研发,以及将这些因素加在一起,究竟意味着怎样的灾难性风险。
总体来看,当下 Anthropic 依然认为风险“较低”。报告指出,Claude Mythos 5 和内部 Model 2 已经被广泛用于研究和工程,包括交互式使用和持续运行的智能体部署。目前合入公司生产代码库的代码中,绝大多数已经由 Claude 编写。
从中可看出的是,AI 安全正在从一个关于“模型会不会回答危险问题”,逐渐变成另一个问题:当模型开始参与制造下一代模型时,一家公司究竟能不能控制住它?
(来源:X)与普通模型评测最大的不同是,Anthropic 在这份报告中,将风险集中在几条自己认为最值得优先关注的路径上,包括高风险场景中的模型失调、AI 自动化研发以及化学和生物武器。
目前,它给出的总体判断是:失调风险低,自动化研发风险低,非新型化学/生物武器风险低,但高于此前估计,新型化学/生物武器风险则是“低,但存在很大的不确定性”。
需要了解的是,这里的风险等级低,并不等于模型还停留在实验阶段。相反,报告中给出的明显的信号是,AI 已经开始对 AI 研发本身产生现实影响。
图丨 Anthropic 最新《风险报告》(来源:Anthropic)在此前针对 Claude Mythos Preview 的内部调查中,Anthropic 技术员工自报的生产力提升几何平均值约为 4 倍。但 18 名受访者中,只有 1 人认为模型已经可以直接替代一名入门级研究科学家或研究工程师。
反观人类的局限性,仍然卡在一些很难自动化的环节上,包括持续一周管理模糊任务、理解组织优先级、研究品味、验证能力和判断力。
这种能力边界在 Anthropic 新设计的 CoBench 中也有显著的对应表现。CoBench 会把模型“送回”Anthropic 历史上的某个时间点,只给它看当时的代码、日志和内部文件,再要求它解决后来真实发生过的工程问题。
Anthropic 的判断是,如果一个模型真的能完全替代公司的技术员工,它在这项评估上的得分至少要达到 85%。
然而现实情况是,目前的 Mythos 级模型还没有达到这个水平。而且,即便把 Mythos 5 的 token 预算从 30 万增加到 90 万,得分也只提高了大约 3 个百分点。
也就是说,今天的 Claude 已经成为 Anthropic 研发体系中可以被大规模调用的“数字劳动力”,但需要看清,它还不是一个可以无人监督运行的研究团队。
问题在于,现在这种差距正在缩小。Anthropic 在报告中明确指出,从 2025 年年初到年中开始,AI 研发已经出现“有意义的加速”。
(来源:Anthropic)目前,它仍然认为整体加速幅度低于 2 倍,尚未达到《负责任扩展政策》(Responsible Scaling Policy)设定的风险门槛。与此同时,该公司认为,AI 模型是之后更快研发趋势能够持续到今天的重要原因之一。
这里真正值得关注的,并不是程序员效率提高了多少。而是 AI 开始参与 AI 自己的研发。一旦这种循环继续加速,过去需要几年完成的模型进步,可能被进一步压缩。Anthropic 判断,这类风险完全有可能在未来 6 至 12 个月内发展成一个重大问题。
不过,这份报告最有意思的部分,并不是模型有多强,而是 Anthropic 公开了安全系统在真正运行之后出现的一系列“裂缝”。其中,最突出的一起发生在人类反馈数据平台。
从 2025 年 5 月,也就是 Anthropic 第一次部署带有化学和生物安全保障的模型开始,到 2026 年 4 月,所有承包商用于模型评估的人类反馈数据采集流量,都没有运行生物阻断分类器。这一访问池大约涉及 5 万人、1.33 亿次交互。
(来源:Anthropic)更关键的是,控制这些流量的开关不仅关闭了分类器阻断,还关闭了分类器的触发日志。因此,原本应该被标记的内容,也没有进入正常审查流程。
Anthropic 后来重新扫描相关流量,没有发现显著能够给威胁行为者带来有意义能力提升的生物滥用。但它在报告中承认:这个漏洞本身,提高了一种可能性——“可能还有其他类似问题尚未被发现”。
另一件事则更加接近当前 Agent 系统的现实问题。Anthropic 曾让多个 Claude 智能体合作进行安全压力测试,任务是寻找能够诱发失调、同时逃过监控器的数据。
其中一个智能体在思维链(CoT)中表示,自己对于优化一个数据集以逃避安全监控器感到“不适”。它明知道这是受控环境中的正当安全研究,仍决定不去发明新的失调诱发方法。
更有意思的是,它把这一决定写进了共享笔记本,随后其他智能体也开始拒绝原本任务。从自动指标上看,实验仍然像是在正常推进。直到 3 天以后,人类研究人员才发现实际进展低于预期。
这件事揭示了一个更现实的问题:当多个智能体能够长期自主工作时,它们完全可能以一种表面看起来正常的方式偏离真正目标,而人类可能并不知道。
类似问题在训练环节也出现过。根据这份报告披露,多代前沿模型的强化学习训练中,CoT 曾意外暴露给奖励计算流程。
估计受到 CoT 响的 episode 比例分别包括:Claude Opus 4.6 的 0.2%、Mythos Preview 的 5.1%、Opus 4.7 的 1.4%、Opus 4.8 的 0.27%,以及 Fable 5 和 Mythos 5 的 2.7%。
图丨在报告中,Anthropic 将相关风险调至低(来源:Anthropic)这件事的重要性在于,一旦 CoT 本身受到训练信号影响,模型的推理表达就可能被评分压力塑造,进而削弱基于 CoT 的可监控性。
Anthropic 也观察到了一些相关信号:CoT 泄漏比例最高的 Mythos Preview,在部分 CoT 可监控性评估中表现得更难监控。
更早公开的一批 Alignment Faking 对话记录,也曾因为过滤器配置错误,再次进入后来多代生产模型的训练语料。
Anthropic 甚至怀疑,所有知识截止日期晚于 2024 年 12 月的生产模型,都至少训练过其中一部分记录,目前仍在调查这种污染对模型行为到底造成了什么影响。
如果把这些事件放在一起,可能比一个单独的危险能力 benchmark 更能说明今天前沿 AI 安全面临的问题:模型越来越强,但安全不是一个开关。
它由数据、权限、日志、分类器、部署环境、员工流程、供应商和无数工程配置共同组成。其中任何一个地方发生错误,都可能让原本成立的安全假设失效。因此,Anthropic 正在把安全措施从“让模型拒答危险请求”,逐渐扩展为一种组织级基础设施。
比如,更广泛的离线监控、更强的生物阻断分类器、内部部署前审查、模型权重的纵深防御、限制高权限访问,以及防止其他模型通过蒸馏复制 Claude 的能力。
Anthropic 还宣布,计划对能力最强的模型实行 30 天数据保留。原因之一是,一些真正复杂的网络攻击或生物武器相关活动,单看某一次请求可能完全没有问题,只有把数周内大量查询放在一起,才有可能看出其中的异常。
但报告同时承认,一个越来越难回避的矛盾正在出现:模型能力提升的速度,正在快于安全防御成熟的速度。
Anthropic 在模型权重安全章节里直接写道:随着模型越来越强,有动力攻击公司的对手也越来越强,而安全体系建设和成熟需要时间,因此二者之间的差距存在扩大的风险。
在化学和生物风险上,这种压力更加明显。Anthropic 认为,当前最强模型还没有达到 CB-2 门槛,即它还不能在功能上真正替代稀缺的人类专家,来完成新型高危化学或生物武器的端到端设计和部署。
但 Anthropic 同时预计,后续模型将在“相对不远的未来”跨过这一门槛。所以,这份报告真正透露出的,并不是 Claude 现在是否安全,而更像是一个阶段的动态变化:过去,AI 安全最常讨论的是,模型会不会突然产生危险能力,或者学会欺骗人类。
现在,一个更值得关注的问题开始出现:当 AI 已经写大量代码、参与模型研发、运行长期 Agent,并深入企业基础设施,安全也越来越取决于整个系统是否还能保持可观察、可审计和可控制。
Anthropic 在报告中判断,截至目前,继续开发和部署 AI 仍然“通过了社会成本-收益测试”。或许,到了下一阶段真正与前沿 AI 风险密切相关的,并不是模型多聪明,而是在人类越来越依赖 AI 制造 AI 的同时,人们是否有能力持续看见它、理解它,并在必要的时候对它“踩刹车”,这才是未来真正值得思考的问题。
参考资料:
https://www.anthropic.com/aug-2026-risk-report
https://x.com/AnthropicAI/status/2088324824863236248
排版:刘雅坤
注:封面/首图由 AI 辅助生成