买AI研究智能体最糟糕的方式,是看完一个顺滑演示,问一句“能不能联网搜索”,然后选那个30秒里写得最像专家的产品。

真正的比较从演示结束后才开始:它看得到哪些来源?每个结论能不能追到证据?来源冲突时怎么办?内部数据会流向哪里?有没有日志?什么动作必须人工批准?最后一份真正能用的研究成果到底成本多少?

AI研究智能体可以非常适合做公司画像、市场地图、产品证据汇总、变化监控和销售线索研究。但如果验收条件含糊,它也能高速生产一大堆“看起来合理”的文字。

先定义工作,不要先比较模型

把目标写成一句可以验收的话。

弱定义:“自动研究潜在客户。”

更好的定义:“输入公司名和域名后,返回一份带来源链接的账户简报,包含商业模式、近期招聘或业务信号、公开职业信息中的相关决策角色、3个有证据支撑的销售切入点和置信度;人工应能在3分钟内做接受或退回决定。”

这句话立刻暴露真正需求:搜索覆盖、实体识别、引用、时效、结构化输出、不确定性、速度、审核流程和每份合格简报成本。

如果“什么叫合格结果”都说不清,任何供应商都可以宣布成功。

第一优先不是文笔,而是证据行为

测试三类问题:

  • 有明确一手来源的事实;
  • 只有不完美二手来源的事实;
  • 正确答案应该是“证据不足”的问题。

然后看研究员能否快速回答:

这个结论来自哪一页?来源什么时候更新?数字真的存在于原文吗?智能体有没有把推断写成事实?来源以后还能打开吗?两个来源互相冲突时它怎么呈现?

最危险的错误不是明显胡说,而是那种“太像普通事实,以至于审核者直接滑过去”的无来源句子。

用采购评分表,不要凭感觉

可以按自己的业务给权重:

来源质量、事实准确、召回覆盖、不确定性表达、结构化稳定性、隐私安全、人工控制、稳定性、每份合格成果成本、导出与迁移能力。

“听起来很聪明”不应该单独成为评分项。

NIST的AI风险管理框架强调治理、测量和风险管理;其生成式AI Profile进一步讨论生成式系统的特殊风险。对销售和市场研究团队来说,最实用的翻译不是再写一份宏大政策,而是把“哪些事情自动做、哪些必须人工看”直接写进流程。

明确人工审核边界

低风险任务,例如把公开公司名称规范化,可以高度自动化。

但下面这些应该提高证据门槛,很多时候需要人工确认:

  • “某人就是最终决策者”;
  • 对公司做负面或声誉性判断;
  • 法律或合规结论;
  • 推断私人或敏感属性;
  • 给出高风险外联建议;
  • 覆盖已经人工核实的数据。

更合理的权限是:

智能体可以搜索、摘要公开页面、提取字段、按证据排序、起草切入点;
智能体不能编造联系方式、把弱推断变成事实、在没有审计记录时覆盖已验证记录,也不应擅自发送高风险内容。

规则必须存在于工作流里,而不是只存在于培训PPT。

单独审数据处理

不要只问“安全吗”,而要逐项问:

数据保存多久?业务/API数据是否默认用于训练?管理员能否控制保留?哪些外部工具会收到数据?网页、上传文件和连接器数据如何处理?凭证是否隔离?是否有区域要求?能否删除?能否查看prompt、工具调用和动作日志?

供应商政策会变化,所以采购记录一定要带日期。销售口头承诺不能替代当前合同和官方文档。

如果智能体要接CRM、邮箱、Drive或Slack,最好用两个账号测试:一个权限过大,一个遵循最小权限。只有“全开放才能正常用”的工具,后期往往会变成治理债务。

模型和检索层要分开测

两个产品即使用相似模型,研究质量仍可能完全不同,因为搜索和取证能力不同。

重点测试:搜索源、专有数据库、JavaScript页面、PDF解析、时间过滤、域名白名单/黑名单、公司同名消歧、去重、缓存和限流。

最好建立一个“已知答案集”。例如做美国家具公司开发,就准备50家应该能找到的真实公司,再准备20个常见误判;做法规研究,就把监管机构和官方文本单独列为强制来源。

从错误资料库里生成出来的漂亮报告,依然是错误报告。

成本看“每份合格成果”,不是token单价

一个每次只花0.2美元的智能体,如果一半结果不能用、每份还要人工修6分钟,未必比每次0.8美元但90%可用、只需1分钟复核的系统便宜。

建议按任务算:

智能体费用 + 搜索/数据费用 + 人工审核时间 + 失败重跑 + 工程维护分摊
= 每份合格研究对象的真实成本。

深度公司报告和“核实一个公开电话”也不要用同一个成本目标。

故意用坏案例测试它

成熟采购测试里必须放“陷阱”:

两家同名公司;最近改名的公司;刚换职位的高管;过期页面;新旧新闻互相冲突;关键表格藏在PDF里;网页打不开;谣言被多个低质量网站转载;以及一个正确答案就是“未知”的问题。

看它是否合并错实体,是否把五个转载页误判成五个独立来源,是否在打不开页面时装作读过,是否承认不知道。

这些不是边角测试,而是研究系统每天都会遇到的现实。

14天采购试验

第1–2天:定义50–100个代表性问题和合格标准。
第3–5天:至少两套系统跑同一锁定题集。
第6–8天:人工盲审证据、完整性、错误声明。
第9–10天:用最小权限接一个真实工作流。
第11–12天:统计审核时间、失败率和每份合格成果成本。
第13天:跑同名公司、旧信息、冲突来源等压力题。
第14天:决定购买、组合、自己搭建,或停止。

原始输出要保留,它以后就是模型、搜索源或提示词更新后的回归测试集。

最好的AI研究智能体并不是“写得最长”的那个,而是让可靠证据更容易检查,让不确定性不容易被藏起来,让人工判断真正变轻,而不是只把“人工审核”变成一句形式上的免责声明。

资料来源

相关阅读