给 12 个 Agent 出了套调参考题,结果:能干活,但干得糙
调参这件事,做过机器学习的人都有体感:跑实验、看曲线、改学习率、再跑、再看 loss 是不是又炸了……很烦,很耗时,而且很多时候调的是一股说不清的经验感。这两年 LLM Agent 能写代码、能搜论文、能做数据分析,我就一直好奇一个事——它能不能替人干这个更烦人的活?
最近 arxiv 上挂了一篇论文,标题叫《AgentHPOBench: A Benchmark For Evaluating LLM Agents as Sequential Hyperparameter Optimizers》,7 月 31 日提交的。看名字就知道,这是专门测 Agent 调参能力的。论文做了 30 个可执行的机器学习任务,覆盖 7 个研究方向,拉来 12 个主流 Agent 和传统调参方法一起测了一遍。
AgentHPOBench 的设计思路是:每个任务都给一个已经跑完的 baseline 结果,Agent 像研究员一样,观察历史配置、指标和日志,再提下一组参数。调参本来就是多轮顺序干预,不是一次定胜负。这个 benchmark 测的是 Agent 能不能根据实验证据一步步逼近更好的配置。
论文原话是:current agents exhibit measurable experimental optimization ability across domains, but still face clear limitations。Agent 确实能调,不是瞎蒙,但短板也很清楚。三个硬伤——持续迭代优化不行,调几轮就调不动了;复杂日志诊断不行,日志一乱它就懵;稳步逼近参考性能不行,有时候改好了又改回去,或者在一个次优解附近打转。
现在市面上 Agent 的演示大多是「一次搞定」的场景——写个脚本、画个图、做个原型。但科研和工程里大量工作是「反复改、逐步逼近」的精细活,调参是典型代表。AgentHPOBench 戳的是一个盲区:Agent 能理解单次任务,但在需要持续跟踪实验历史、从日志里抠信号、做多步决策的场景下,表现就降级了。
Agent 更适合做「候选推荐」或「初筛配置」——跑几组参数看看趋势是可以的,但把最终调优全交给它,风险不小。真正精细的收尾,还是得人盯着 loss 曲线做判断。这个场景本身难:连人类调参高手都不多,何况是刚学会看日志的 Agent。
论文在 arXiv 上可以查看和下载,ID 是 2607.29626。感兴趣的可以拉下来在自己常用的 Agent 上跑跑,看看自己用的 Agent 属于哪种:是能调、能调好、还是调着调着就放飞了。我打算把手头那个写周报的 Agent 丢进去试试——调参这个 dirty work 它要是真能干好,我就给它涨工资。