Liquid AI 发了个 2.6B 小模型,声称"在 Agent 任务上吊打 4 倍体量的模型"
Liquid AI 发了个 2.6B 小模型,号称在 Agent 任务上吊打 4 倍体量的模型
LFM2.5-2.6B 最近在 Hugging Face 上线。2.69B 参数,128K 上下文,后训练针对 Agent 场景。
在 Apple M5 Max 上跑 220 tok/s,AMD Ryzen CPU 上 113 tok/s,内存占用不到 2.5 GB。一个能跑 Agent 的模型塞进笔记本甚至手机,对开发者意味着什么后面再说。
架构是 30 层混合结构——22 个 double-gated short convolution block,8 个 GQA 层。不是传统纯 Transformer,用卷积块做局部特征提取,GQA 处理长程依赖。这样设计是为了在保持推理效率的同时还能处理长上下文。
训练预算 34 万亿 token,词表 128K,支持 16 种语言。后训练分四步:两次 SFT、领域教师蒸馏、多域在线蒸馏,最后是 agentic reinforcement learning。
agentic RL 是这次的重点。Liquid AI 把模型放在主流 Agent 框架里直接训练,让它暴露在这些框架的工具、系统提示和交互模式之中。目的是让模型学会在这些框架里干活,不只是对话回答问题。
性能方面,官方列了 15 个 benchmark 的对比数据。
IFStruct 上 LFM2.5-2.6B 拿到 85.49,高于 Qwen3.5-9B 的 78.50。ToolSandbox 77.83,BrowseComp+ 26.89,AIME25 51.87。官方称它在工具调用、指令遵循和多步 Agent 任务上"competitive with models 4x larger",不过具体哪个 benchmark 上实现了"4x",材料里没细说。
官方也明确标注了短板——"not recommended for agentic coding and knowledge-heavy tasks"。主战场是结构化 Agent 工作流,不是代码生成,也不是知识问答。
部署形态有四种:原生 checkpoint(给 Transformers、vLLM、SGLang 用)、GGUF(llama.cpp 和 CPU 推理)、ONNX(跨平台硬件加速)、MLX(Apple Silicon 专属)。
场景挺清晰。
比如需要调用多个工具、读取文件、访问外部 API 的 Agent 工作流,放在本地跑,不用每次调用发请求到云端。隐私数据不出设备,响应延迟从网络往返变成本地推理时间,成本从按 token 计费变成一次性硬件投入。
220 tok/s 相当于每秒生成 200 多个字。一个 Agent 可以连续调用多个工具、处理多轮交互,不会卡到用户明显感知延迟。113 tok/s 在 CPU 上也能用,量化后内存控制在 2.5 GB 以内,MacBook Air 就能跑。
模型有明确的适用范围。代码生成、需要大量领域知识的任务、需要实时联网搜索的场景(除非自己接工具),都不太适合。但需要一个能在本地跑、能调用工具、能处理长上下文的 Agent 模型,2.6B 参数规模是很合理的起点。
Liquid AI 的做法是把模型做小,把 Agent 能力做深,然后让它能在端侧跑起来。这和市面上很多"越大越好"的思路不太一样。Agent 场景下,部署的灵活性和响应速度,有时候比模型本身的绝对能力更重要。
这个判断是否成立,还需要更多真实场景验证。把 2.6B 模型塞进手机跑到 220 tok/s,本身已经是一个值得关注的技术成果。
相关链接