Anthropic更新负责任扩展政策:更精细的AI风险管理框架

Anthropic 更新了其负责任扩展政策(RSP),引入了更精细的 AI 风险管理框架。以下是关键要点:

核心更新

  • 新的能力阈值:明确了何时需要升级保障措施的具体指标
  • ** refinements 评估流程**:改进了对模型能力和保障措施充分性的评估方法
  • 内部治理和外部输入的新措施:加强了内部治理结构和外部专家反馈机制

ASL 标准体系

Anthropic 采用 AI 安全等级标准(ASL Standards) 作为分级安全措施框架:

  • ASL-1:适用于具有基本能力的模型(如国际象棋机器人)
  • ASL-2:当前所有 Anthropic 模型运行的标准,反映行业最佳实践
  • ASL-3 及以上:针对更高能力的模型

关键能力阈值

更新后的政策定义了两个关键的能力阈值,达到这些阈值将要求升级保障措施:

1. 自主 AI 研发

如果模型能够独立执行通常需要人类专业知识的复杂 AI 研究任务,可能以不可预测的方式显著加速 AI 发展,Anthropic 将要求:

  • 提高安全标准(可能为 ASL-4 或更高标准)
  • 增加额外安全保障

2. CBRN 武器相关能力

如果模型能够实质性地帮助具有基本技术背景的人创建或部署化学、生物、辐射和核武器:

  • 需要增强安全和部署保障措施
  • 适用 ASL-3 标准

ASL-3 保障措施的具体内容

  • 安全方面:内部访问控制和更强大的模型权重保护
  • 部署风险控制:多层方法防止滥用,包括实时监控和异步监控、快速响应协议以及全面的部署前红队测试

实施和监督机制

为确保政策有效实施,Anthropic 建立了以下机制:

  1. 能力评估:基于能力阈值的常规模型评估
  2. 保障措施评估:定期评估安全和部署安全措施的有效性
  3. 文档和决策流程:记录能力和保障评估过程
  4. 内部治理和外部输入措施:包括内部压力测试和寻求外部专家反馈

从经验中学习

在实施上一版 RSP 一年后,Anthropic 进行了首次审查,发现了一些未能完全符合政策要求的实例,主要包括程序性问题:

  • 完成一组评估比计划晚了三天
  • 对如何记录占位符评估的变更缺乏清晰度
  • 某些评估可能通过使用标准技术(如思维链或 best-of-N)获得更好的模型表现

Anthropic 强调,这些情况对模型安全构成的风险极小,并从中得出两个重要教训:需要在政策中融入更多灵活性,并改进跟踪 RSP 合规性的流程。

人事变动

  • Jared Kaplan(联合创始人兼首席科学家)接任 Anthropic 的 负责扩展官员 职位
  • Sam McCandlish(联合创始人兼首席技术官)此前担任该职位一年,将继续专注于首席技术官职责
  • 公司正在招聘 负责扩展主管 职位,负责协调多个团队迭代并成功遵守 RSP

相关团队

多个团队现在通过 RSP 参与风险管理:

  • 前沿红队:负责威胁建模和能力评估
  • 信任与安全:负责开发部署保障措施
  • 安全与合规:负责安全保障措施和风险管理
  • 对齐科学:包括开发 ASL-3+ 安全措施、专注于不对齐的能力评估和内部对齐压力测试的子团队
  • RSP 团队:负责政策起草、保证和公司间执行

展望未来

Anthropic 表示,随着前沿 AI 的快速发展,很难预见未来系统需要哪些适当的安全措施。其安全项目的所有方面都将继续演变:政策、评估方法、保障措施以及对潜在风险和缓解措施的研究。