采购AI研究智能体时,最常见的误区是把注意力全部放在“哪个模型最聪明”。真正上线后,结果往往由一套没那么性感的东西决定:允许搜什么、什么算证据、什么时候必须停止、谁来复核、错误一次到底有多贵。

下面是一个综合型示例案例。公司、人物和数字都是为了说明运营问题而构造的,不代表某一家真实企业。可复制的是方法,不是故事里的数字。

场景是一支14人的B2B销售团队,希望AI在外呼或邮件开发前,自动生成账户研究简报:公司怎么赚钱、最近发生了什么、是否有购买触发点、应该找谁、以及两条可以成立的开发理由。原来的人工研究每家公司大概25到40分钟,而且不同员工质量差异很大。

第一版看起来很惊艳,但根本不好用。

最后真正救活项目的,不是换了一个“神提示词”,而是重做证据规则、任务边界和复核方式。

先给一份可以复制的检查表

1. 先定义研究要支持哪个决定

不要只写“研究这家公司”。

应该写成:

  • 这家公司要不要进入销售序列?
  • 第一封信应该找哪个角色?
  • 现在有没有可信的开发触发点?
  • 哪一句事实可以安全地写进对外邮件?

如果某段内容不会改变任何决定,就应该删掉。

2. 把事实、推断、销售假设分开

简报里必须明显区分:

已核实事实:有来源直接支持。
合理推断:根据事实做出的解释。
销售假设:值得测试,但不能当事实说。

这条规则看似简单,却能大幅减少“语言很顺但没有依据”的内容混进外联邮件。

3. 先定来源规则,再定模型规则

团队给来源分了层级:

公司官网、监管文件、官方新闻稿、具名高管采访优先;
可靠媒体和行业出版物可以用;
聚合站只能辅助;
匿名转载、没有出处的公司资料页不能支撑关键事实。

再强的模型,配上一套糟糕证据规则,也只是更快地整理传闻。

4. 关键事实必须能追到具体来源

只在文末堆一串链接不够。

复核的人需要知道:哪一个来源支持哪一句会影响销售决策的事实。团队没有强制学术脚注格式,但要求重要当前事实旁边能找到对应证据。

5. 不同字段用不同“新鲜度”

公司成立时间可以很旧;
当前职位要尽量新;
产品是否还在卖、领导是否已经变更、融资是否刚发生,都要看接近研究日期的来源;
如果要写“最近发生”,必须有明确日期。

一句“尽量用最新来源”太模糊。

6. 限制搜索深度和工具次数

智能体完全可能为了证明一个很小的点,花掉比这个客户价值还高的搜索成本。

提前设定:

  • 最多搜索几轮;
  • 最多打开多少页面;
  • 时间或token上限;
  • 什么时候必须返回“证据不足”。

7. 专门拿难样本测试

不要只测知名上市公司。

要故意加入:

  • 最近刚换高管的公司;
  • 公开资料很少的私营企业;
  • 同名或相似名称企业;
  • 营收估算互相冲突的公司;
  • 多语言、多地区官网;
  • 看起来像“新消息”其实是旧页面的案例。

8. 按业务后果分错误等级

地址写错可能只是麻烦。
把不存在的融资写进冷邮件,会直接伤害信任。

可以分成:

  • 视觉或格式问题;
  • 需要人工修正;
  • 会改变销售判断;
  • 对外发送会尴尬;
  • 涉及法律、隐私、合规等高风险。

9. 对外事实保留人工批准

NIST的AI风险管理框架以及生成式AI Profile都强调风险管理、测试、治理和持续监测,而不是默认AI结果天然可信。

放到销售研究里,最实用的翻译就是:AI负责找证据、整理和提出假设;真正要写进对外邮件的事实,由人承担最终责任。

10. 算“每份可用简报成本”,不要只算一次生成多少钱

模型调用很便宜,不代表流程便宜。

要一起算:

  • 模型和工具成本;
  • 搜索时间;
  • 人工复核时间;
  • 被退回重做比例;
  • 无重大修改就能直接使用的比例。

下面看这支团队是怎么一步步改出来的。

第一周:大家都在追求“看起来厉害”

最初提示非常宽:

“全面研究这家公司,给出近期新闻、决策人、痛点和开发建议。”

智能体可以联网搜索和总结。先拿10家知名公司测试,效果非常漂亮:排版好、内容长、速度快。

一扩到100家公司,问题马上出现。

第一,智能体会补空白。找不到强触发点时,它很容易把普通活动解释成“信号”:发了一篇博客被写成扩张;一条普通招聘被写成高速增长;合作新闻被理解成预算增加。

第二,容易混淆同名企业。

第三,简报太长。销售要读1500字,才能找到真正能用的两条事实。

从技术角度它“完成任务”了,但公司只是把人工研究岗变成了“人工核查AI长文岗”。

第二周:团队删掉了大部分输出

目标从“全面研究”改成“支持决定的证据”。

一份简报只剩六项:

  1. 身份确认;
  2. 三句话业务模式;
  3. 两条已经核实的近期变化;
  4. 一个可能的销售触发点,没有就明确写“未找到”;
  5. 目标角色及依据;
  6. 两条明确标记为“假设”的开发思路。

最重要的一句新规则是:

如果没有足够证据,允许写“未找到可信触发点”。

这个改动比再加十段提示词更有效。能承认不知道的系统,比必须每次都给出聪明答案的系统更容易控制。

Anthropic公开的减少幻觉指导里,也明确建议允许模型表达不确定,并把关键结论锚定在来源上。这个原则并不依赖某一家模型厂商。

第三周:一次差点发出去的“旧新闻”,逼着团队重做新鲜度规则

某份简报说客户“最近发布了一个新产品”。链接是真的,但页面是三年前的,只是网站模板没有把日期显示得很明显。

销售发送前发现了问题,客户没有收到错误信息,但团队把这当成一次严重的近失误。

于是每个字段开始有自己的时间规则。

字段 新鲜度要求
公司身份 核实当前域名与实体
当前高管 优先当前一手页或较新可靠来源
“近期事件” 必须带明确日期
融资 日期 + 一手或可靠来源
产品可售状态 查看当前产品/价格页
历史背景 如果仍成立,可以使用较老来源

找不到日期,就不能叫“最近”。

改完后,“有趣的触发点”数量明显下降。销售一开始觉得简报变无聊了,但留下来的触发点更敢写进邮件。

第四周:真正的大成本不是token,而是人工纠错

团队开始计时后发现:

好简报两分钟左右就能批准;
模糊简报要五到七分钟;
差简报比人工从头查还慢,因为每一句都要重新核实。

于是他们增加了一个“可复核性评分”。

每满足一条得1分:

  • 企业身份没有歧义;
  • 每个会影响决策的事实都有来源;
  • 所有“近期事件”都有日期;
  • 事实和假设分开;
  • 营收、员工、融资等不确定数字没有冒充事实;
  • 正文在来源之前可以一屏读完。

6分:快速批准。
4–5分:需要人工检查。
3分以下:默认退回,只有高价值客户才值得重跑。

从此以后,核心指标不再是“研究任务完成率”,而是每一分钟复核时间能产出多少份可用简报。

这会反过来改变AI行为:不是越写越多越好,而是越容易核实越好。

第五周:建立一套能跨模型使用的固定评测集

之前大家靠感觉比较版本。每次模型升级,都变成争论“我觉得这个更聪明”。

团队建立了60家公司固定测试集,专门放难例:同名企业、资料稀少、旧新闻陷阱、多地区公司、相互冲突的二手数据。

每次版本变更都记录:

  • 企业身份准确率;
  • 关键事实来源覆盖率;
  • 近期事件日期正确率;
  • 无来源事实比例;
  • 正确放弃回答的能力;
  • 人工复核分钟数;
  • 每份可用简报成本。

这和NIST AI风险管理里强调测试、评估、验证、监测的思路是一致的:不能拿一组开发者自己挑的漂亮demo证明系统可靠。

第六周:架构也变了

最初是一个智能体一口气完成:搜索、判断、总结、写开发话术。

后来拆成五步。

A:身份解析
先确定到底是哪家公司、哪个域名、哪个地区实体。

B:证据收集
只收少量真正相关的原文、来源和日期。

C:事实构建
把证据转成带来源映射的事实。

D:销售解释
基于事实提出假设,但假设不冒充事实。

E:人工批准
销售决定是否接受、编辑或者拒绝对外表述。

单看一次运行,这比“一步生成所有内容”慢;但作为生产系统,它反而更快,因为出错时知道应该查哪一层,而不是面对一篇1500字的黑箱结果。

OpenAI当前的开发者文档支持以API构建能够处理文本、文件等输入的应用工作流;Anthropic同样提供工具调用相关文档。具体产品能力会变化,所以团队没有把架构绑定在某个模型专属技巧上,而是坚持一个简单内部契约:工具返回证据,模型生成结构化结论,审批层独立存在。

最后到底是什么改变了结果?

不是秘密提示词,而是七个运营决策。

  1. 任务变窄了。
    “全面研究”变成六个支持销售判断的字段。

  2. 允许放弃回答。
    “没找到可信触发点”代替强行制造紧迫感。

  3. 证据规则写清楚了。
    关键事实必须能追溯。

  4. 不同事实用不同新鲜度。
    当前职位和历史背景不能套同一个时间规则。

  5. 人工复核时间被算进成本。
    不再只优化token价格。

  6. 测试集专门包含难例。
    真正决定系统可靠性的不是漂亮demo。

  7. 把事实收集和销售创意拆开。
    创意可以大胆,但不能伪装成事实。

上线前最后检查

一份AI账户研究简报进入销售流程前,至少问:

  • 公司身份确定吗?
  • 研究日期记录了吗?
  • 当前关键事实都有来源吗?
  • 所有“近期”事件都有日期吗?
  • 估算数字标明“估算”了吗?
  • 事实和销售假设分开了吗?
  • 系统允许说“证据不足”吗?
  • 有没有一句话是销售在电话里不敢当面解释的?
  • 简报长度符合真实工作习惯吗?
  • 人工复核时间量过吗?
  • 难样本测试过吗?
  • 换一个模型后还能重新跑出同样的评估流程吗?

如果这里有很多“不”,换更贵模型也解决不了系统设计问题。

真正值得追求的结果

AI研究智能体不应该用更多文字替代人的判断。它最有商业价值的地方,是把散落的公开证据整理成一个紧凑、可核实、可追溯的材料包,让人更快做出更好的销售决定。

这听起来没有“全自动自主研究”那么神奇,但更容易真正上线。

长期能跑下去的团队,通常都做了同一个交换:牺牲一点表面上的“完全自动化”,换来来源可追溯、允许不知道、固定评测和明确责任人。Demo可能没那么炫,但真正接触客户时稳定得多。

资料来源

相关阅读