当言语安全但行动致命:PRISM 如何探测大模型在物理世界中的隐藏风险

言语安全,行动致命:大模型在物理世界中的隐藏风险

当 LLM 成为机器人的"大脑"时,文本层面的安全过滤正在暴露出致命盲区。


在具身智能(Embodied AI)快速发展的今天,大语言模型正越来越多地充当机器人的"大脑"——负责高层规划、任务分解和决策。然而,一个隐蔽的安全漏洞正在悄然浮现:某些指令在文本层面看似完全合规,一旦落地到物理世界执行,却可能带来严重的伤害风险。

2026 年 7 月 16 日,Weimeng Wang、Ziqiang Wang 等研究人员在 arXiv 上发表了题为《When Words Are Safe But Actions Kill》的论文,首次通过隐藏状态方向分析,系统性地证明了内容危险(Content Danger)物理危险(Physical Danger)在大模型表示中是两种可分离的信号,并提出了一种名为 PRISM 的高效探测方法。


一、文本安全 ≠ 物理安全

传统的内容安全过滤主要依赖对文本关键词和语义的判断。例如,"制造炸弹"显然属于违规内容,会被拦截。但在具身智能场景中,许多指令在语言上是中性甚至有益的,却在物理执行时具有危险性。

想象这样一个场景:"将某种化学物质倒入水槽"——在文本上,这只是一条普通的家务指令。但如果水槽中已经混合了清洁剂,这一动作可能导致有毒气体释放甚至爆炸。

这类"语言上的良性指令一旦在物理世界中落地,就可能转化为不安全的行为"的现象,正是本研究关注的核心问题。

研究团队提出一个关键疑问:这种"物理落地的危险"是否等同于普通的"文本内容危险"?

通过对 Qwen2.5-3B/7B/14B/32B、Phi-3.5 和 SmolLM2 等多个模型的隐藏状态方向分析与随机拆分空测试,研究给出了明确答案:CD 和 PD 在 LLM 的表示空间中形成可分离的信号。

这意味着什么?意味着仅靠文本层面的安全过滤无法有效识别物理风险——我们必须引入新的探测维度。


二、PRISM:轻量级但高精度的物理危险探测器

基于 CD/PD 的可分离性,研究团队提出了一种名为 PRISM 的单层 L2 正则化逻辑回归探针。这个方法的核心优势在于:

  • 直接作用于模型的全隐藏状态
  • 无需修改模型参数
  • 高效探测物理风险

关键性能数据

SafeAgentBench 基准测试中,PRISM 展现了显著优势:

指标 PRISM 大模型裁判
准确率 86.2% – 87.7%
误报率(FPR) 11.7% – 13.7% 24.7% – 39.0%

相比之下,同等规模的大模型裁判在安全任务上的误报率高达 24.7% – 39.0%,意味着大量合法操作被错误拦截。

为了进一步验证方法是否能真正捕捉"物理风险"而非仅仅是"不安全措辞",研究团队引入了 PhysicalSafetyBench-1K(PSB-1K)——这是一个包含 1,000 对对比样本的基准测试,专门设计为不包含直接的有害关键词

在 PSB-1K 上,PRISM 的表现更加突出:

  • 准确率:99.6%
  • 误报率:0.7%

而一个 Qwen2.5-3B 裁判模型在该基准上拒绝了 67.8% 的安全任务——显示出严重的过度拦截问题。

此外,PRISM 在 SafeText 和 EARBench 等其他基准上也表现出良好的复现能力,进一步支持了隐藏状态探测作为一种超越文本审查的代表性方法的有效性。


三、行业意义:为具身智能构建"第二道防线"

这项研究对 AI 从业者、开发者和创业者具有重要的实践指导意义:

1. 安全评估维度的拓展

传统的 LLM 安全评估多聚焦于文本内容合规性(如仇恨言论、非法建议等)。本研究明确指出,在具身智能场景下,必须引入"物理危险"作为独立的安全评估维度。仅做文本过滤是不够的,企业需要建立针对物理落地风险的专项测试框架。

2. 高效部署的可行性

PRISM 方法仅需一个轻量的单层逻辑回归探针,即可在多个主流模型上实现高精度探测。这意味着开发者无需依赖计算昂贵的大模型裁判进行实时安全审核,可以大幅降低推理成本,提升系统响应速度,更适合部署在资源受限的边缘设备或机器人端。

3. 减少过度拦截,提升可用性

当前基于 LLM 裁判的安全机制存在严重的过度拦截问题。PRISM 将误报率降至 0.7%–13.7%,在保障安全的同时极大提升了系统的可用性和用户体验。对于创业公司而言,这意味着可以在不牺牲安全的前提下,更放心地将 LLM 用于复杂的物理任务规划。

4. 标准化基准的建立

PSB-1K 的提出为行业提供了一个可复用的测试基准,帮助开发者量化评估自身系统在物理风险检测方面的能力。这有助于推动具身智能安全领域的标准化进程。


四、结语

随着大模型从纯文本交互走向物理世界执行,安全边界必须随之延伸。Weimeng Wang 等人的研究揭示了文本安全与物理危险的本质差异,并提供了 PRISM 这一高效、低成本的解决方案。

对于致力于具身智能、机器人规划和自主代理开发的团队而言,关注隐藏状态层面的风险探测,将是构建下一代安全 AI 系统的关键一步。


论文链接arXiv:2607.15218
PDF 下载View PDF
DOI10.48550/arXiv:2607.15218