做 LLM 安全过滤的人,都卡在这个单选题上:改得准还是改得干净
做模型输出安全的人,大多遇到过这种尴尬:往 prompt 里塞了一条「请确保回答无有害内容」,结果该拦住的话拦住了,但正常语气也削了一层皮。改成只删涉敏片段,又经常被绕过,意思还在,只是换了个说法。
这不是配置问题,是两套策略之间一直都有的取舍:让模型做全局改写,还是只定位到有害片段做局部替换。前者容易过度修正,后者容易遗漏意图。
Kyungwon Park 刚挂在 arXiv 上的一篇新论文,把这两种策略拉到同一个框架里比了一次,而且用人做评审,不是刷分。
他们把两套 detoxification 策略——span-guided(定位到有害 span 再改)和 unguided(不加约束地整体改写)——放在同一个生成器下面,用人工评审盲评。数据集是一个混合的英文评测集,包含手工构造的样本和 HateXplain 的测试项。
结果没有绝对优劣,偏好取决于场景。
评审员在两种情况下偏向 span-guided:当有害范围明确、局部编辑能保留原立场且不产生多余改动时,这种「精准手术」效果更好。而在更需要把整个句子的攻击意图彻底化掉的时候,偏向 unguided 的全局改写——改得粗糙一点也能接受,只要干净。
两个维度对应两种风险:局部改,容易「残余有害意图还在」;全局改,容易「过度修改、语气走形」。
论文还做了一个很实际的分层分析:把测试样本按有害程度分成强和弱两个层级。在强毒性层,两种策略打得有来有回;在弱毒性层,评审员明显偏向 unguided——因为轻微冒犯更容易被全局改写彻底清除,局部改常常显得不够。
大多数安全评测论文只给一个总分,不分层讨论。但这个结果恰好说明,如果安全过滤器对不同毒性的输入用同一套改写策略,总会在某个区间出问题。
然后论文做了所有安全类论文都会做的事:用自动评测来替代人。他们跑了三种自动评估方案——toxicity-similarity 标量化、多生成器分析、两个通用 LLM judge——结果都能复现一部分整体趋势,但没有人那种分层判断能力。自动模型看不出「这里该局部那里该全局」的场景差异。
论文也明确说,不试图建立一条按毒性严重程度自动路由改写策略的规则。不是不想做,是当前实验规模不够支撑一个可靠的决策边界。
对做 AI 产品安全的人来说,这篇论文的实操信号可能就一句:别只看总分,安全评测要同时报「残余有害」和「过度修正」两个指标,而且要分输入类型看。
如果安全报告只给了一个 aggregated 分数,它很可能同时遮掩了局部改漏掉的有害内容和全局改写打歪的正常语气。那这个分数本身就不太能用来做发布决策。
论文不长,12 页,图表也不复杂。讨论部分对评估协议的几条建议,比实验本身更值得抄进团队的安全评测流程里。