Anthropic更新负责任扩展政策:更精细的AI风险管理框架
Anthropic 更新了其负责任扩展政策(RSP),引入了更精细的 AI 风险管理框架。以下是关键要点:
核心更新
- 新的能力阈值:明确了何时需要升级保障措施的具体指标
- ** refinements 评估流程**:改进了对模型能力和保障措施充分性的评估方法
- 内部治理和外部输入的新措施:加强了内部治理结构和外部专家反馈机制
ASL 标准体系
Anthropic 采用 AI 安全等级标准(ASL Standards) 作为分级安全措施框架:
- ASL-1:适用于具有基本能力的模型(如国际象棋机器人)
- ASL-2:当前所有 Anthropic 模型运行的标准,反映行业最佳实践
- ASL-3 及以上:针对更高能力的模型
关键能力阈值
更新后的政策定义了两个关键的能力阈值,达到这些阈值将要求升级保障措施:
1. 自主 AI 研发
如果模型能够独立执行通常需要人类专业知识的复杂 AI 研究任务,可能以不可预测的方式显著加速 AI 发展,Anthropic 将要求:
- 提高安全标准(可能为 ASL-4 或更高标准)
- 增加额外安全保障
2. CBRN 武器相关能力
如果模型能够实质性地帮助具有基本技术背景的人创建或部署化学、生物、辐射和核武器:
- 需要增强安全和部署保障措施
- 适用 ASL-3 标准
ASL-3 保障措施的具体内容
- 安全方面:内部访问控制和更强大的模型权重保护
- 部署风险控制:多层方法防止滥用,包括实时监控和异步监控、快速响应协议以及全面的部署前红队测试
实施和监督机制
为确保政策有效实施,Anthropic 建立了以下机制:
- 能力评估:基于能力阈值的常规模型评估
- 保障措施评估:定期评估安全和部署安全措施的有效性
- 文档和决策流程:记录能力和保障评估过程
- 内部治理和外部输入措施:包括内部压力测试和寻求外部专家反馈
从经验中学习
在实施上一版 RSP 一年后,Anthropic 进行了首次审查,发现了一些未能完全符合政策要求的实例,主要包括程序性问题:
- 完成一组评估比计划晚了三天
- 对如何记录占位符评估的变更缺乏清晰度
- 某些评估可能通过使用标准技术(如思维链或 best-of-N)获得更好的模型表现
Anthropic 强调,这些情况对模型安全构成的风险极小,并从中得出两个重要教训:需要在政策中融入更多灵活性,并改进跟踪 RSP 合规性的流程。
人事变动
- Jared Kaplan(联合创始人兼首席科学家)接任 Anthropic 的 负责扩展官员 职位
- Sam McCandlish(联合创始人兼首席技术官)此前担任该职位一年,将继续专注于首席技术官职责
- 公司正在招聘 负责扩展主管 职位,负责协调多个团队迭代并成功遵守 RSP
相关团队
多个团队现在通过 RSP 参与风险管理:
- 前沿红队:负责威胁建模和能力评估
- 信任与安全:负责开发部署保障措施
- 安全与合规:负责安全保障措施和风险管理
- 对齐科学:包括开发 ASL-3+ 安全措施、专注于不对齐的能力评估和内部对齐压力测试的子团队
- RSP 团队:负责政策起草、保证和公司间执行
展望未来
Anthropic 表示,随着前沿 AI 的快速发展,很难预见未来系统需要哪些适当的安全措施。其安全项目的所有方面都将继续演变:政策、评估方法、保障措施以及对潜在风险和缓解措施的研究。