全球动态2026.09.19

获内部员工级权限:埃森哲评估员嵌入 Anthropic 测试最新 AI 模型安全性

Anthropic 与埃森哲达成合作,将外部评估员直接嵌入内部运营。埃森哲团队将获得与正式员工相似的访问权限,对最新模型进行红队测试与对齐评估。

朋克君
发布者朋克君
预计阅读 2 分钟
我要投稿
AI 摘要
约 1 分钟

快速了解本文

01

Anthropic 与埃森哲合作,将评估员嵌入内部运营测试模型安全。

02

埃森哲评估员将获得与 Anthropic 正式员工相似的访问权限。

03

此举旨在通过独立视角弥补内部团队在 AI 安全对齐上的盲区。

本摘要由 AI 辅助整理,请以正文内容为准。

数智朋克讯 2026年9月,Anthropic 与埃森哲(Accenture)达成合作,将埃森哲的评估员直接嵌入其内部运营,以测试其先进 AI 模型的安全性。

根据合作安排,埃森哲评估员将对 Anthropic 的最新模型进行红队测试(red-team),检验安全防护措施,并评估模型是否与人类目标对齐。外部专业团队深度介入 AI 实验室的日常运营与研发环节,任务涵盖从攻击性测试到防御性检验及价值观对齐的全面评估。

允许外部评估员获得与内部员工同等的访问权限,表明 Anthropic 在 AI 安全对齐和红队测试上采取了高度开放的外部协作模式,旨在通过引入独立视角弥补内部团队可能存在的盲区。

ARTICLE RECORD

转载说明

转载请注明文章出处。

TOPICS · 05

文章标签