AI 摘要
快速了解本文
01
Anthropic 与埃森哲合作,将评估员嵌入内部运营测试模型安全。
02
埃森哲评估员将获得与 Anthropic 正式员工相似的访问权限。
03
此举旨在通过独立视角弥补内部团队在 AI 安全对齐上的盲区。
本摘要由 AI 辅助整理,请以正文内容为准。
数智朋克讯 2026年9月,Anthropic 与埃森哲(Accenture)达成合作,将埃森哲的评估员直接嵌入其内部运营,以测试其先进 AI 模型的安全性。
根据合作安排,埃森哲评估员将对 Anthropic 的最新模型进行红队测试(red-team),检验安全防护措施,并评估模型是否与人类目标对齐。外部专业团队深度介入 AI 实验室的日常运营与研发环节,任务涵盖从攻击性测试到防御性检验及价值观对齐的全面评估。
允许外部评估员获得与内部员工同等的访问权限,表明 Anthropic 在 AI 安全对齐和红队测试上采取了高度开放的外部协作模式,旨在通过引入独立视角弥补内部团队可能存在的盲区。

