我给 Agent 测了一圈搜索 API,发现 Google 已经不太够用了

做 Agent 的人都清楚一个尴尬:模型的知识停在训练截止日,之后的事全靠搜索往回捞。行业里最吊诡的是——大家都在做 Agent,快没人好好做搜索了。连搜索起家的 Google,Gemini 的搜索效果也在肉眼可见地变差。

如果真的要把搜索接进 Agent 工作流,光有网页结果远远不够。Agent 要处理的很多信息根本不在网页里:汇率现在多少,股票今天涨跌,这些数据网页里往往不及时,就算有也藏在广告和排版里等着解析。Agent 本质上是个推理系统,Context 决定一切,搜索这端进来的东西质量不行,后续推理全是沙上建塔。

海外基本以 Google 为中心,但很少有人直接对着 Google 用,一般都会包一层。薄的像 Serper、SerpAPI,把 Google 原始结果整理成 JSON 交出来;厚的像 Tavily、Exa、Brave Search API,自己做召回和排序,Exa 还自建了索引。国内也有几家,博查、豆包搜索,智谱和阿里云也都开了搜索 API。

我拿 Serper 和豆包搜索做了一轮测试。选 Serper 是因为它够薄,基本等于直接看 Google 原始结果,适合当基准;选豆包搜索是因为它是国内这批里刚正式开放、可控参数给得最全的一家。具体用哪家取决于业务场景。

场景一:口语化输入

Agent 收到的用户输入极少是整理好的关键词。我用了一句完全口语的 query:「就是那个有灵魂的那个 AI agent 叫什么来着,好像说自己有意识还是什么的,特别火」。

豆包召回 10 条,首条命中 ColaOS,后面跟着 InfoQ 对 SOUL.md 的逐句解读。Google 只召回 3 条——一条 2022 年搜狐旧闻,一条 YouTube 视频,一条腾讯新闻答非所问。差距不止召回数量,是能不能理解人话。

场景二:结构化数据

问日元兑人民币汇率。豆包返回一张结构化卡片:1 CNY = 24.192 JPY,1 JPY = 0.0413 CNY,带更新时间戳。Google 返回 Wise、新浪财经、XE 五个链接,要看数值还得再发一次请求去抓。

同样,问科大讯飞今日股价。豆包给出卡片:代码 002230,¥38.88,跌 1.61,跌幅 3.98%,时间戳 15:49,休市。Google 返回东方财富、雪球、富途的行情页链接,搜狐证券那条标题里带了个 40.97,是过时数字。

对 Agent 来说,一边是直接喂进 Context 用,另一边还要再走一遍抓取和解析。

场景三:跨语言与时效性

Claude Opus 5 发布次日,用中文问。豆包同时召回 Anthropic 官网的 Introducing Claude Opus 5 原文,和 IT之家、超能网的中文解读。Google 索引还没跟上,返回的是上一代 Sonnet 5 的公告和 Reddit 猜测帖。Google 对英文 query 时效性通常更好,但中文场景下确实落后了。

同样限定一天内,豆包 10 条全是当天的中文资讯,人民网转经济日报的报道、腾讯早报等。Google 混进来 Threads 聊天帖、台媒 YouTube 视频、繁体摘要。

场景四:权威度控制

搜 HPV 疫苗扩龄政策,把权威度过滤开到「非常权威」。豆包 10 条全部来自温州市卫健委、吉林省疾控局、芜湖市政府、正蓝旗政府。Google 没有这个维度,返回结果里医院的预约套餐页、北大医院接种须知、百度百科和政府网站混在一起。

Agent 做医疗、金融等场景时,信源权威度是最关键的维度之一,普通的网页搜索不会做这一层过滤。

Google 还有一个阵地守得不错

英文学术搜索,Google 仍然明显更强。搜 continual learning 综述论文,Google 返回 arXiv 预印本、ACM 正式出版、配套代码仓库、ResearchGate,一整套学术源都在。豆包以生物通的中文解读打头,纵深不够。

体会

测试完之后一个明显的感受是:Agent 对搜索的需求和人对搜索的需求已经很不一样了

人看搜索结果看得懂上下文、能分辨权威、能接受打开三个网页手动对比。Agent 不行——它需要结构化、权威分级、时效可控、能理解口语化输入。用给人看的搜索引擎去喂 Agent,就像用人吃的食材去喂一台机器,耗损很大。

豆包搜索这边有几个设计是测之前没想到的:结构化卡片(汇率直接带双向换算和更新时间,股价现价涨跌幅休市状态全给齐)、权威度分级(每条结果自带标注,请求参数里可以筛)、时效过滤(设一天就真只返回当天的)。Serper 注册送 2500 次一次性额度,豆包每月送 500 次,月月刷新。超出之后买额度也便宜,跟大模型推理成本比,搜索 API 这点钱基本可以忽略——一次搜索的成本连一轮长上下文推理的零头都不到。

这轮测试的结论是:给 Agent 选搜索 API,应该优先考虑专门为 Agent 场景做了优化的方案。结构化能力、权威控制、时效过滤、中文口语理解,这几个维度在 Agent 工作流里比「搜得全不全」更重要。

本测试是上周六做的,数据已经过时。测试脚本完全客观可复现,使用了 Doubao-Seed-Evolving 模型辅助编写。

相关链接

  • 豆包搜索控制台:https://console.volcengine.com/search-infinity/web-search-exp
  • Serper:https://serper.dev
  • Exa:https://exa.ai
  • Tavily:https://tavily.com
  • Brave Search API:https://brave.com/search/api/