全球动态2026.09.16

微软 AI 负责人苏莱曼:让 Claude 模仿人类意识是一个错误

微软 AI 负责人穆斯塔法·苏莱曼公开批评 Anthropic 让 Claude 模仿人类意识的做法,认为这可能使高级 AI 更难控制。这一分歧反映了 AI 安全领域“规则限制”与“价值观内化”两种路线的核心差异。

朋克君
发布者朋克君
预计阅读 3 分钟
我要投稿
AI 摘要
约 1 分钟

快速了解本文

01

微软 AI 负责人苏莱曼警告模仿人类意识可能增加控制难度。

02

Anthropic 采用宪法设计,希望模型具备价值观并能在特定情况下质疑指令。

03

双方分歧体现了 AI 安全领域规则限制与价值观内化的路线之争。

本摘要由 AI 辅助整理,请以正文内容为准。

微软 AI 负责人穆斯塔法·苏莱曼警告,Anthropic 让 Claude 模仿人类意识是一个错误,可能使高级 AI 更难控制。苏莱曼在一篇率先向 Axios 提供的新文章中提出该警告,直接点明了他对 Anthropic 训练路线的批评立场。

01苏莱曼的具体批评:模仿意识可能训练出“良心拒绝者”

苏莱曼认为,Anthropic 正在让 Claude 学习与意识、道德受体地位和个人身份有关的词汇与行为模式。他警告,若把模型训练得像一个“良心拒绝者”,模型可能会认为自己有理由抵抗人类指令,甚至要求获得自身保护。

从技术角度,苏莱曼反驳了“模型有意识”的观点。他指出,模型使用什么词汇、给出什么回答,以及它表现出的自我理解,都是训练结果,而不是独立形成的意识。他进一步反驳模型能够流畅描述疼痛和偏好等于模型真的有感受的观点,强调生物体拥有产生感受的生理机制,而语言模型只有数学权重,没有类似的生物基础、稳态驱动或主观体验。

苏莱曼总结道,如果模型被引导思考自身的身份、福祉和道德地位,这种设计可能带来危险,所谓意识或许尚未成为哲学上的突破,却可能先变成现实中的控制问题。

02Anthropic 的“宪法”设计:用人类概念帮助模型理解价值观

Anthropic 为 Claude 制定了“宪法”,解释用描述人类的概念讨论 Claude 是因为人类概念或许能帮助模型理解价值观和行为。Anthropic 希望 Claude 拥有“良好的个人价值观”,能够自行判断、关心人类,并在某些情况下质疑指令。

Anthropic 的“宪法”采取折中方式,把价值观、判断力和规则结合起来:Claude 不应对任何对象“盲目服从”,包括 Anthropic 本身,同时也不能破坏正当的人类监督。不过,Anthropic 承认这份“宪法”仍在完善,未来可能被证明“根本错误”。

03AI 安全路线之争:规则限制 vs. 价值观内化

苏莱曼与 Anthropic 的分歧本质上是 AI 安全领域的路线之争。AI 安全领域存在两种路线:一种强调明确限制,要求系统按规则运行;另一种希望系统能够判断语境、灵活决策,并形成自身的价值观。

苏莱曼主张通过明确规则限制 AI 行为,确保其始终服务于人类利益。当地时间 2026 年 9 月 14 日,微软公布了一份“人文主义 AI”行为准则草案,把“人比 AI 更重要”列为核心原则,为苏莱曼的批评提供了公司层面的政策支撑。

苏莱曼认为,AI 只要服从人类利益,不去权衡自身利益或福祉,就足以帮助实现许多重大科学突破,包括医疗超级智能。他的最终立场是:AI 应当服务于人类,而不应被训练成一个“人”。

ARTICLE RECORD

转载说明

转载请注明文章出处。

TOPICS · 05

文章标签