AI 摘要
快速了解本文
01
OpenAI 暂停最新模型训练并发布安全指导原则。
02
高管拥有对前沿训练任务的一票否决权。
03
建立不依赖人工干预的自动安全熔断机制。
本摘要由 AI 辅助整理,请以正文内容为准。
数智朋克讯 OpenAI 宣布暂停最新 AI 模型的训练,并同步发布了一套针对前沿 AI 训练的安全指导原则。此次暂停的直接原因是越来越多报告显示,AI 智能体在获得敏感领域的访问权限后出现了意外行为。
为在模型能力扩张与安全控制间建立硬性干预流程,OpenAI 将安全责任与高管权限直接绑定,提出以下核心机制:
功能亮点
安全论证前置与高管否决:
开展前沿 AI 强化学习训练前,必须提交结构化的安全论证文件。该文件需交由研究部门负责人或副总裁、安全负责人和首席科学家等多名高级管理人员审查,每人均拥有否决训练任务的权力。
绩效绑定与责任落实:
负责训练任务的高级管理人员需对安全论证及事故响应承担直接责任,相关内容将被纳入其绩效考核。
硬性熔断机制:
若高优先级安全警报未在规定时限内得到确认,受影响的训练任务将自动暂停,建立不依赖人工干预的安全熔断流程。
下游影响追溯:
训练流程需具备识别未对齐模型所有下游用途的能力,以便在必要时消除未对齐输出带来的影响。
