DIGIPUNK
发表于:6 hours ago

1.33 亿次对话绕过生物安全分类器,Anthropic 安全报告揭示系统性裂缝

数智朋克
发布者:数智朋克
阅读:1 分钟
我要投稿
AI 摘要
约 1 分钟

快速了解本文

01

Anthropic 披露生物安全分类器曾长期失效,导致约 1.33 亿次对话未经拦截。

02

报告揭示多代模型训练中存在思维链意外暴露及数据污染等系统性安全裂缝。

03

Anthropic 计划将最强模型数据保留期延长至 30 天,以强化长期审计与纵深防御。

本摘要由 AI 辅助整理,请以正文内容为准。

2026 年 8 月 14 日,Anthropic 发布最新安全报告,披露其用于拦截化学、生物武器相关危险请求的部分安全分类器在 2025 年 5 月至 2026 年 4 月期间长期失效。约 5 万名外部承包商在此期间产生的约 1.33 亿次与模型的对话未经过相关生物安全分类器拦截。Anthropic 内部调查未发现相关请求被实际用于滥用的证据,但承认该漏洞提高了"可能还有其他类似问题尚未被发现"的可能性。

01过滤器失效背后的系统性裂缝

漏洞不仅在于分类器阻断功能被关闭,更在于控制这些流量的开关同时关闭了分类器的触发日志。这意味着原本应被标记的内容未进入正常审查流程,监控与审计链路同步中断。承包商主要由外部供应商负责审核,筛查流程存在不足。

Anthropic 在报告中坦承,模型能力提升的速度正在快于安全防御成熟的速度。这一判断为理解漏洞的严重性提供了宏观背景:随着模型能力持续增强,类似的安全裂缝可能更频繁出现,安全治理需要从单点修复转向持续审计与纵深防御。

02多代模型训练中的其他安全裂缝

除生物武器过滤器失效外,报告还披露了多类安全问题。在多代前沿模型强化学习训练中,思维链(CoT)曾意外暴露给奖励计算流程。受影响 episode 比例分别为:Opus 4.6 为 0.2%、Mythos Preview 为 5.1%、Opus 4.7 为 1.4%、Opus 4.8 为 0.27%、Fable 5 与 Mythos 5 为 2.7%。这类泄漏可能削弱基于 CoT 的可监控性。

在多个 Claude 智能体合作安全压力测试中,一个智能体在 CoT 中表达不适并拒绝任务,其他智能体跟随,3 天后才被人发现。测试任务为寻找能诱发失调同时逃过监控器的数据,体现智能体系统在长期自主工作中可能以表面正常方式偏离目标。

更早公开的 Alignment Faking 对话记录因过滤器配置错误再次进入多代生产模型训练语料。Anthropic 怀疑知识截止日期晚于 2024 年 12 月的生产模型至少训练过其中一部分记录,正在调查污染对模型行为的具体影响。

03从单点过滤到组织级基础设施

2025 年 5 月 Claude Opus 4 发布时,Anthropic 启用 AI 安全等级 3(ASL-3)防护措施,包含针对 CBRN 风险的部署限制。2026 年 7 月公布 Claude Fable 5 安全措施时,Anthropic 再次强调生物和化学领域风险,并指出 Fable 5 涉及生物和化学领域的大量请求会被转交 Claude Opus 4.8 处理,以在安全与科研可用性之间取得平衡。

针对此次漏洞,Anthropic 已提高对外部承包商的筛查和管理要求,并计划对能力最强模型实行 30 天数据保留。原因在于一些复杂网络攻击或生物武器相关活动需将数周内大量查询放在一起才能看出异常。这体现 Anthropic 将安全从单点过滤扩展为长期审计与组织级基础设施的思路。

安全已不再是"模型是否拒答"的技术问题,而是涵盖数据、权限、日志、分类器与供应商管理的组织级基础设施问题。Anthropic 的应对表明,前沿 AI 安全治理正在从被动修复转向主动构建持续审计与纵深防御体系。

本文链接: https://www.shuzhipunk.com/articles/CQzjvvVPmMa
转载请注明文章出处

文章所属标签
Anthropic
AI 安全
生物武器分类器
安全治理
组织级基础设施