小模型就够了:改写AI文本不用再写prompt,InMyStyle用LoRA做到了
AI改完的稿子读一遍,句子是通顺了,但味儿不对——一看就知道是AI写的。为了去这个味儿,开始在prompt里加「请模仿我的文风」,效果看运气,每改一次就得写一遍。更麻烦的是那些写到一半的内部文档、带数据的邮件,不想传上任何云去做风格适配。
这就是InMyStyle想解决的问题。论文7月底挂到arXiv上,作者Antorweep Chakravorty。思路不复杂,拿已有的文档,用本地的辅助LLM构造训练数据——把原文和AI改写版本配成一对。然后在这批配对数据上用LoRA微调一个小模型,最小0.5B参数,最大到7B。微调完以后,任何AI改过的文字丢进去,它自动按训练好的风格重写一遍,推理时不需要写任何prompt。系统还做了长度感知的生成预算和自动分块,能处理不同长度的输入。全程本地跑,不上云。
论文在219对科学论文语料上做了评估。结果挺有意思:不管基座模型是0.5B还是7B,用贪心解码或采样解码,一个复合评分都停在0.69左右(满分1)。在这个任务上,模型大到一定程度就饱和了——再往上堆参数,质量没有明显变好。这大概就是标题「Small Is Enough」的意思。
还有个我没想到的发现。论文用五个LLM裁判做了400次评分,对比InMyStyle输出和原始的AI改写输入。InMyStyle改写后的感知AI度平均低了20%以上。而且,InMyStyle内部用的模型越小,这个AI感分数反而越低——7B模型改出来的文字,裁判觉得比0.5B版本更「AI味儿」。跟直觉反着来,但细想一下,大模型确实可能自带更明显的「模型口音」。
也得说清楚边界。0.69这个复合评分具体包含哪些指标,摘要里没展开。评估基于科学论文语料,日常写作、邮件、即时消息是不是同样适用,论文没有直接回答。LoRA适配器需要用户先有一定量的文档做训练数据,写得少的人或刚起步的项目可能不太能用。「风格」本身也是个很难量化的东西,用一个评分加一个感知AI度来度量,只能说明一部分问题。
但这件事的方向我确实喜欢。它反过来让模型学人的语言——用最小的模型、最轻量的微调方式、在本地跑完。原文在arXiv上搜2607.29238就能找到。我准备把手头几篇改过的技术方案拿类似思路跑一遍看看,后面有结果再来补。
相关链接
- 论文页面:https://arxiv.org/abs/2607.29238