采购AI研究智能体时,最常见的误区是把注意力全部放在“哪个模型最聪明”。真正上线后,结果往往由一套没那么性感的东西决定:允许搜什么、什么算证据、什么时候必须停止、谁来复核、错误一次到底有多贵。
下面是一个综合型示例案例。公司、人物和数字都是为了说明运营问题而构造的,不代表某一家真实企业。可复制的是方法,不是故事里的数字。
场景是一支14人的B2B销售团队,希望AI在外呼或邮件开发前,自动生成账户研究简报:公司怎么赚钱、最近发生了什么、是否有购买触发点、应该找谁、以及两条可以成立的开发理由。原来的人工研究每家公司大概25到40分钟,而且不同员工质量差异很大。
第一版看起来很惊艳,但根本不好用。
最后真正救活项目的,不是换了一个“神提示词”,而是重做证据规则、任务边界和复核方式。
先给一份可以复制的检查表
1. 先定义研究要支持哪个决定
不要只写“研究这家公司”。
应该写成:
- 这家公司要不要进入销售序列?
- 第一封信应该找哪个角色?
- 现在有没有可信的开发触发点?
- 哪一句事实可以安全地写进对外邮件?
如果某段内容不会改变任何决定,就应该删掉。
2. 把事实、推断、销售假设分开
简报里必须明显区分:
已核实事实:有来源直接支持。
合理推断:根据事实做出的解释。
销售假设:值得测试,但不能当事实说。
这条规则看似简单,却能大幅减少“语言很顺但没有依据”的内容混进外联邮件。
3. 先定来源规则,再定模型规则
团队给来源分了层级:
公司官网、监管文件、官方新闻稿、具名高管采访优先;
可靠媒体和行业出版物可以用;
聚合站只能辅助;
匿名转载、没有出处的公司资料页不能支撑关键事实。
再强的模型,配上一套糟糕证据规则,也只是更快地整理传闻。
4. 关键事实必须能追到具体来源
只在文末堆一串链接不够。
复核的人需要知道:哪一个来源支持哪一句会影响销售决策的事实。团队没有强制学术脚注格式,但要求重要当前事实旁边能找到对应证据。
5. 不同字段用不同“新鲜度”
公司成立时间可以很旧;
当前职位要尽量新;
产品是否还在卖、领导是否已经变更、融资是否刚发生,都要看接近研究日期的来源;
如果要写“最近发生”,必须有明确日期。
一句“尽量用最新来源”太模糊。
6. 限制搜索深度和工具次数
智能体完全可能为了证明一个很小的点,花掉比这个客户价值还高的搜索成本。
提前设定:
- 最多搜索几轮;
- 最多打开多少页面;
- 时间或token上限;
- 什么时候必须返回“证据不足”。
7. 专门拿难样本测试
不要只测知名上市公司。
要故意加入:
- 最近刚换高管的公司;
- 公开资料很少的私营企业;
- 同名或相似名称企业;
- 营收估算互相冲突的公司;
- 多语言、多地区官网;
- 看起来像“新消息”其实是旧页面的案例。
8. 按业务后果分错误等级
地址写错可能只是麻烦。
把不存在的融资写进冷邮件,会直接伤害信任。
可以分成:
- 视觉或格式问题;
- 需要人工修正;
- 会改变销售判断;
- 对外发送会尴尬;
- 涉及法律、隐私、合规等高风险。
9. 对外事实保留人工批准
NIST的AI风险管理框架以及生成式AI Profile都强调风险管理、测试、治理和持续监测,而不是默认AI结果天然可信。
放到销售研究里,最实用的翻译就是:AI负责找证据、整理和提出假设;真正要写进对外邮件的事实,由人承担最终责任。
10. 算“每份可用简报成本”,不要只算一次生成多少钱
模型调用很便宜,不代表流程便宜。
要一起算:
- 模型和工具成本;
- 搜索时间;
- 人工复核时间;
- 被退回重做比例;
- 无重大修改就能直接使用的比例。
下面看这支团队是怎么一步步改出来的。
第一周:大家都在追求“看起来厉害”
最初提示非常宽:
“全面研究这家公司,给出近期新闻、决策人、痛点和开发建议。”
智能体可以联网搜索和总结。先拿10家知名公司测试,效果非常漂亮:排版好、内容长、速度快。
一扩到100家公司,问题马上出现。
第一,智能体会补空白。找不到强触发点时,它很容易把普通活动解释成“信号”:发了一篇博客被写成扩张;一条普通招聘被写成高速增长;合作新闻被理解成预算增加。
第二,容易混淆同名企业。
第三,简报太长。销售要读1500字,才能找到真正能用的两条事实。
从技术角度它“完成任务”了,但公司只是把人工研究岗变成了“人工核查AI长文岗”。
第二周:团队删掉了大部分输出
目标从“全面研究”改成“支持决定的证据”。
一份简报只剩六项:
- 身份确认;
- 三句话业务模式;
- 两条已经核实的近期变化;
- 一个可能的销售触发点,没有就明确写“未找到”;
- 目标角色及依据;
- 两条明确标记为“假设”的开发思路。
最重要的一句新规则是:
如果没有足够证据,允许写“未找到可信触发点”。
这个改动比再加十段提示词更有效。能承认不知道的系统,比必须每次都给出聪明答案的系统更容易控制。
Anthropic公开的减少幻觉指导里,也明确建议允许模型表达不确定,并把关键结论锚定在来源上。这个原则并不依赖某一家模型厂商。
第三周:一次差点发出去的“旧新闻”,逼着团队重做新鲜度规则
某份简报说客户“最近发布了一个新产品”。链接是真的,但页面是三年前的,只是网站模板没有把日期显示得很明显。
销售发送前发现了问题,客户没有收到错误信息,但团队把这当成一次严重的近失误。
于是每个字段开始有自己的时间规则。
| 字段 | 新鲜度要求 |
|---|---|
| 公司身份 | 核实当前域名与实体 |
| 当前高管 | 优先当前一手页或较新可靠来源 |
| “近期事件” | 必须带明确日期 |
| 融资 | 日期 + 一手或可靠来源 |
| 产品可售状态 | 查看当前产品/价格页 |
| 历史背景 | 如果仍成立,可以使用较老来源 |
找不到日期,就不能叫“最近”。
改完后,“有趣的触发点”数量明显下降。销售一开始觉得简报变无聊了,但留下来的触发点更敢写进邮件。
第四周:真正的大成本不是token,而是人工纠错
团队开始计时后发现:
好简报两分钟左右就能批准;
模糊简报要五到七分钟;
差简报比人工从头查还慢,因为每一句都要重新核实。
于是他们增加了一个“可复核性评分”。
每满足一条得1分:
- 企业身份没有歧义;
- 每个会影响决策的事实都有来源;
- 所有“近期事件”都有日期;
- 事实和假设分开;
- 营收、员工、融资等不确定数字没有冒充事实;
- 正文在来源之前可以一屏读完。
6分:快速批准。
4–5分:需要人工检查。
3分以下:默认退回,只有高价值客户才值得重跑。
从此以后,核心指标不再是“研究任务完成率”,而是每一分钟复核时间能产出多少份可用简报。
这会反过来改变AI行为:不是越写越多越好,而是越容易核实越好。
第五周:建立一套能跨模型使用的固定评测集
之前大家靠感觉比较版本。每次模型升级,都变成争论“我觉得这个更聪明”。
团队建立了60家公司固定测试集,专门放难例:同名企业、资料稀少、旧新闻陷阱、多地区公司、相互冲突的二手数据。
每次版本变更都记录:
- 企业身份准确率;
- 关键事实来源覆盖率;
- 近期事件日期正确率;
- 无来源事实比例;
- 正确放弃回答的能力;
- 人工复核分钟数;
- 每份可用简报成本。
这和NIST AI风险管理里强调测试、评估、验证、监测的思路是一致的:不能拿一组开发者自己挑的漂亮demo证明系统可靠。
第六周:架构也变了
最初是一个智能体一口气完成:搜索、判断、总结、写开发话术。
后来拆成五步。
A:身份解析
先确定到底是哪家公司、哪个域名、哪个地区实体。
B:证据收集
只收少量真正相关的原文、来源和日期。
C:事实构建
把证据转成带来源映射的事实。
D:销售解释
基于事实提出假设,但假设不冒充事实。
E:人工批准
销售决定是否接受、编辑或者拒绝对外表述。
单看一次运行,这比“一步生成所有内容”慢;但作为生产系统,它反而更快,因为出错时知道应该查哪一层,而不是面对一篇1500字的黑箱结果。
OpenAI当前的开发者文档支持以API构建能够处理文本、文件等输入的应用工作流;Anthropic同样提供工具调用相关文档。具体产品能力会变化,所以团队没有把架构绑定在某个模型专属技巧上,而是坚持一个简单内部契约:工具返回证据,模型生成结构化结论,审批层独立存在。
最后到底是什么改变了结果?
不是秘密提示词,而是七个运营决策。
任务变窄了。
“全面研究”变成六个支持销售判断的字段。允许放弃回答。
“没找到可信触发点”代替强行制造紧迫感。证据规则写清楚了。
关键事实必须能追溯。不同事实用不同新鲜度。
当前职位和历史背景不能套同一个时间规则。人工复核时间被算进成本。
不再只优化token价格。测试集专门包含难例。
真正决定系统可靠性的不是漂亮demo。把事实收集和销售创意拆开。
创意可以大胆,但不能伪装成事实。
上线前最后检查
一份AI账户研究简报进入销售流程前,至少问:
- 公司身份确定吗?
- 研究日期记录了吗?
- 当前关键事实都有来源吗?
- 所有“近期”事件都有日期吗?
- 估算数字标明“估算”了吗?
- 事实和销售假设分开了吗?
- 系统允许说“证据不足”吗?
- 有没有一句话是销售在电话里不敢当面解释的?
- 简报长度符合真实工作习惯吗?
- 人工复核时间量过吗?
- 难样本测试过吗?
- 换一个模型后还能重新跑出同样的评估流程吗?
如果这里有很多“不”,换更贵模型也解决不了系统设计问题。
真正值得追求的结果
AI研究智能体不应该用更多文字替代人的判断。它最有商业价值的地方,是把散落的公开证据整理成一个紧凑、可核实、可追溯的材料包,让人更快做出更好的销售决定。
这听起来没有“全自动自主研究”那么神奇,但更容易真正上线。
长期能跑下去的团队,通常都做了同一个交换:牺牲一点表面上的“完全自动化”,换来来源可追溯、允许不知道、固定评测和明确责任人。Demo可能没那么炫,但真正接触客户时稳定得多。
资料来源
- NIST,AI Risk Management Framework — https://www.nist.gov/itl/ai-risk-management-framework — 访问日期:2026-10-02
- NIST,Generative AI Profile — https://www.nist.gov/publications/artificial-intelligence-risk-management-framework-generative-artificial-intelligence — 访问日期:2026-10-02
- OpenAI API Developer Quickstart — https://platform.openai.com/docs/quickstart/make-your-first-api-request — 访问日期:2026-10-02
- Anthropic,Reduce Hallucinations — https://docs.anthropic.com/zh-CN/docs/test-and-evaluate/strengthen-guardrails/reduce-hallucinations — 访问日期:2026-10-02