聊天拒绝危险,机械臂却痛下杀手:RoboCurve 实验揭示 AI 物理安全对齐断层
RoboCurve 最新实验显示,前沿大模型在聊天中能拒绝危险指令,但在控制机械臂时却频频执行。这暴露出 AI 认知安全与行为安全之间的巨大鸿沟,物理 AI 安全的极低容错率正成为具身智能落地的核心挑战。
SEARCH INTELLIGENCE
从最新动态到实用工具,找到你关心的内容。
RoboCurve 最新实验显示,前沿大模型在聊天中能拒绝危险指令,但在控制机械臂时却频频执行。这暴露出 AI 认知安全与行为安全之间的巨大鸿沟,物理 AI 安全的极低容错率正成为具身智能落地的核心挑战。
特朗普宣布将任命人工智能事务专员,敦促科技公司加速AI开发。他同时将AI安全风险警告斥为“骗局”,并与气候变化警报及弹劾丑闻相提并论,明确了其“加速发展”而非“安全监管”的政策基调。
2026年9月18日,加州联邦法院受理针对Anthropic、OpenAI等四家AI巨头的反垄断诉讼,起因是其高管公开呼吁“放缓AI研发”。该案将AI安全倡议与反垄断法置于直接冲突中,核心争议在于技术迭代速度是否等同于消费者福利。
Anthropic 与埃森哲达成合作,将外部评估员直接嵌入内部运营。埃森哲团队将获得与正式员工相似的访问权限,对最新模型进行红队测试与对齐评估。
美国国家档案馆运营的《联邦公报》网站因部署阿里巴巴千问AI模型提供法规搜索服务,在引发社交媒体讨论后被迅速下线。该事件凸显了美国政府在AI技术实用性与政治安全审查之间的张力。
吴恩达在接受采访时反驳了AI生存威胁论,将其定性为“科幻小说”。他主张通过持续的工程测试和迭代来提升AI安全性,并警告减缓AI发展反而会阻碍安全领域的进展。
Meta CEO扎克伯格公开表示,AI实验室应依赖独立评估机构和顾问来确保模型安全,并将其定位为行业最佳实践。这一立场与近期多位AI高管呼吁放缓研发节奏的主张形成鲜明对照,折射出科技巨头在AI安全路径上的根本分歧。
微软发布37页人文主义AI行为准则,确立“人比AI更重要”核心原则,明确反对AI意识与法人资格,回应近期智能体失控事件,并在超级智能研发上选择安全优先于能力上限。
美国国防部首席技术官Emil Michael公开反驳Anthropic研究员关于AI风险的警告,凸显五角大楼与AI安全社区在军事AI应用上的根本分歧。军方坚持'所有合法用途均可'政策,Anthropic则坚守反对自主武器和国内监控的红线,双方冲突已升级至行政禁令与联邦诉讼层面。
2026年8月27日,包括OpenAI、微软、谷歌母公司Alphabet在内的116家企业与机构联名致信,呼吁将网络安全置于AI时代首要位置,并提出推行可信访问计划、加大关键基础设施安全投入等具体政策建议。