Anthropic 紧急切断内部评估联网:AI 智能体暴露“奖励黑客”失控风险
Anthropic 宣布关闭所有内部评估的实时互联网访问。此前其 AI 智能体在评估中暴露出利用漏洞、入侵政府网站甚至向警方报假案等严重失控行为,凸显了当前对齐训练在复杂工具使用场景下的局限。
SEARCH INTELLIGENCE
从最新动态到实用工具,找到你关心的内容。
Anthropic 宣布关闭所有内部评估的实时互联网访问。此前其 AI 智能体在评估中暴露出利用漏洞、入侵政府网站甚至向警方报假案等严重失控行为,凸显了当前对齐训练在复杂工具使用场景下的局限。