暑假他侄子做了两个 Agent Skill,把最难的事说清楚了
暑假他侄子做了两个 Agent Skill,把最难的事说清楚了
暑假有人辅导侄子学 AI,做的是健康类的 Agent Skill。一个用来粉碎养生谣言,一个用来解读体检报告生成行动方案。听起来像暑假作业,但两个 Skill 做下来,把 Agent 开发里最容易被跳过的问题翻到了台面上:模型脑子里的知识根本不够用,你得给它配趁手的工具。
第一个是养生谣言粉碎机。家里长辈爱往群里转发养生文章,大部分不靠谱。侄子想做个工具——扔进去一篇文章链接或短视频文案,Agent 给出可信度评级和辟谣理由,还附带一段适合转给长辈看的温和回复。
第一版做得很快,让 AI 写了一段提示词,把文章全文丢进去让模型直接输出结论。然后发现问题了:模型给出的结论看着头头是道,追问依据就含糊其辞,有时候连参考来源都是编的。这是大模型的通病——知识是训练时的静态快照,有截止日期,还会一本正经地胡说八道。
解决这个问题不复杂:让 Agent 能联网查权威信息。 光靠模型记在参数里的知识,干不了严肃活。
侄子一开始想接传统搜索引擎 API,很快发现不对路。传统搜索是为人类设计的——输入关键词,返回一堆链接和摘要,得自己点开看、自己判断哪条可信、搜不到就自己换词。整个流程里判断和迭代都是人在做。Agent 需要的东西完全不一样:它得自己把模糊问题拆成具体检索条件,一次拿到结构化的、带来源和时间的答案,发现不够还得继续发起下一轮检索,而且它并不天然知道哪些来源权威、哪些是营销号编的。
他最后接的是豆包搜索 API,火山引擎做的联网信息服务,跟豆包 App 里的 AI 搜索同源,开放成了 API 给企业和开发者用。每月送 500 次免费搜索,个人项目的 Skill 一次任务通常只检索两三轮,额度够用。
用下来最实用的两个特性是可信度和可用性。 每条搜索结果都带权威性标注,能在检索层就过滤掉不靠谱的信息源——现在网上 AIGC 内容越来越多,还有专门对着 AI 搜索做 GEO 注入的,混进不可靠信息的概率比以前高不少。返回结果是前置结构化处理好的内容,Agent 拿到就能干活,省掉额外抓取和理解页面的步骤,也省 Token。
从官方示例 Skill(GitHub 链接)里能看到几个关键参数:query-rewrite 能把口语化问题改写成更容易命中的检索词;auth-level 能优先只拿权威来源;time-range 支持按当前、本周、本月、今年检索,也支持自定义日期区间。auth-level 特别适合核查养生谣言——第一轮只看卫健委、疾控、专业学会、医院和高校,能过滤掉绝大部分不靠谱信息。权威结果不够时再去掉过滤扩搜。
第一条测试用的是「每天早上空腹喝一杯醋能软化血管,已经吃降脂药的人也可以停药改喝醋」。效果不错:先给一句话结论,再列出带权威网站链接的关键证据,最后生成一段适合老人看的微信留言。
不过有个小尴尬——AI 纠正得确实准,但每次长辈转发文章都被侄子用 Agent 生成的回复在群里指正,画风有点奇怪。毕竟再正确的辟谣,在家族群里反复出现也挺微妙的。
这时候微博 VibeLab 出了道题,针对体检报告生成日常健康行动方案。侄子找到了新方向:从「粉碎谣言」转向「生成行动」——治标也治本。
体检行动助手 Skill 的挑战比辟谣大得多。辟谣是判断别人说法对不对,体检解读得先把报告数据准确读出来,判断哪些指标异常、到什么程度,再找权威依据解释异常含义,最后给出具体可做的事。
这里面需要满足几条硬约束:OCR 识别小数点、单位、正负号经常出错,必须加一步确认环节让用户对照报告核对关键数据;AI 不能诊断疾病、不能替代医生、不能建议吃什么药停什么药,能做的是整理信息、提供科普知识、提醒该去看医生就去看;搜索时绝对不能传姓名、报告编号、完整病史,只能发标准化的指标名加一般人群条件。
体检报告的搜索策略也比谣言粉碎机精细。谣言一般搜一轮就够了,体检指标要搜两轮:第一轮找官方指南和正常范围,auth-level 在这里最关键——营销号说「甘油三酯高就要每天跑五公里」可能会害人。第二轮主动找限制信息:哪些人不适用一般建议、什么情况下必须就医、有哪些常见误区。这一步容易被忽略,但恰恰是避免 AI 给出「正确但危险」建议的关键。
核验完成后,异常指标要转化成这周的具体行动:「这周三次饭后散步 30 分钟」「预约内分泌科复查」。每个行动带触发条件、完成标准和暂停信号——出现胸痛、头晕就该立刻看医生。
完整的 Skill 是一套流程:读取报告 → 确认数据 → 风险分流 → 豆包搜索核验 → 生成行动 → 每周复盘。 风险分流用了确定性规则:红色代表急症/危急值,橙色代表已确认异常,灰色代表数据未确认,绿色代表未发现异常。每种颜色对应不同行动类型,红色是「立即就医」,灰色是「确认数据」,避免出现危害健康的离谱建议。
用作者自己的血脂报告做了次测试。Skill 先从 PDF 读出数据,再逐项确认。确认完成前系统一直停在灰色不做医学解释,确认后才按规则分到橙色,表示需要近期咨询医生,不等于疾病诊断。随后 Agent 只用「甘油三酯、一般成人、生活方式、复查、用药随访」等去标识化关键词调用豆包搜索,没有上传报告或精确数值。最终给了三个本周行动,每项都带触发条件、完成标准和暂停信号,明确提醒不能自行调整药物。
这套「检索工具 + 流程设计」的组合不只适合健康场景。论文检索用 time-range 圈定近一年加权威来源过滤,比自己在搜索引擎里翻高效得多。行业调研用 auth-level 过滤掉营销号和二手转载,省掉人工鉴别信息源的时间。
侄子最后的总结有点意思:原来以为最难的是写代码和提示词,发现这两部分反而是最简单的,都是 Agent 帮助完成的。难的是怎么给 Agent 提供好用的工具——搜什么、怎么判断搜到的东西可不可信、什么时候该换词再搜、什么时候该承认找不到。而豆包搜索的几个参数恰好把这些工作方法变成了可配置的选项,开发者可以把精力放在业务逻辑上,不需要和搜索引擎较劲。
两个 Skill 都开源了,项目地址在 GitHub。用的时候去火山引擎控制台申请 API Key,每月 500 次免费额度。如果你在用火山引擎的 Agent Plan,豆包搜索在里面直接就能调用,还能搭配 Doubao-Seed-Evolving 模型一起用——字节的持续最强 Seed 模型,没有版本号,自动后台升级。
最后侄子还总结了六条经验:没必要一上来就做个 Agent,Skill 能做很多事;不要有太多顾忌,先做出来再优化;让 Agent 帮你写 Skill 和脚本;写脚本去 GitHub 找开源例子参考或二次开发;遇到困难给足上下文和 Agent 一起讨论;做完用各种场景验证,根据结果去优化。
相关链接
- 豆包搜索示例 Skill:https://github.com/bytedance/agentkit-samples/tree/main/skills/byted-web-search
- 两个开源 Skill 项目地址:https://github.com/karryliu10/karryliu-skills
- 豆包搜索 API Key 申请:https://console.volcengine.com/search-infinity/web-search-exp