LLM 干办公室杂活,比人便宜但还没干利索

在公司里推过 AI Agent 的人,一定被问过这个问题:这玩意儿比请人干到底划算不划算?算力账单和人工工资放一起比,答案从来不是非黑即白。

最近 arXiv 上出现了一个 benchmark,正面刚的就是这个事。OmegaUse-OfficeVal,一个评估 LLM Agent 在办公套件场景里长任务完成能力的基准,最大的特点是每个任务都绑了两个经济信号:人工耗时任务价格代理——让 AI 和人直接比性价比。

100 个办公室真实活儿

这 100 个任务是从一线从业者的真实办公需求里提炼出来的,走了一遍隐私脱敏。平均每个任务一个人要做 2.32 小时——不是「帮我写一封邮件」那种秒级请求,而是跨表格、文档、幻灯片的串行工作流,够折腾。

每个任务都配了细粒度的评分表,researchers 还写了基于代码的自动验证器来做 stable evaluation。如果测评只能靠人工判,Scale 起来就是噩梦——这些任务确实复杂到这个程度。

便宜、快,但还没到位

论文评估了几个前沿 LLM,同时做了人类基线。结论是:所有参评的 LLM 在成本上都远低于人类,速度也更快,但交付质量还没追上人。

「成本远低于人类」对应那句老话:AI 不会抱怨加班,按 Token 算确实比时薪便宜。但「交付质量没追上」才是最要命的部分。办公室里那些擦屁股的细节——表格格式不对、公式引用偏了一位、PPT 排版穿模——LLM 代理还是会翻车。换实习生干,至少能把要改的地方指出来;Agent 翻了车,有时候还得翻一遍日志才能定位问题。

一个值得记住的数据

平均每任务 2.32 小时人力的复杂度级。这不是客服回复或简单分类,这是正经 office work。如果哪个 Agent 声称能搞定这类任务,要看它是在什么 benchmark 上测的、任务是不是真的有多步依赖、有没有经济账来兜底评估。

OmegaUse-OfficeVal 的代码和数据集已经全开源了,项目网站是 https://omegause-officeval.github.io。想自己跑一下看看 Agent 翻车现场的人,可以直接动手。

最后说一个保留意见。这个 benchmark 目前测的是「交付质量」对标人类,但在真实办公室场景里,「快且便宜但偶尔出错」和「慢且贵但稳定不出错」哪个更划算,取决于组织的容错率和人工复核成本。这个换算式子,paper 给了前半段,后半段得自己填。