“邮件智能体”不是一个单一品类。有人把能查公司、写一封草稿的助手叫邮件智能体;有人把“补全线索—生成序列—自动跟进”叫智能体;还有产品已经能读回复、改CRM阶段、预约会议并触发下一步动作。它们可能出现在同一张对比表,却承担完全不同的运营风险。

因此真正好用的采购流程,不该从“谁写得最像人”开始,而应该从一棵决策树开始。第一个问题是:我们到底愿意把多大的权限交给系统?它可以读什么数据、用哪个发件身份、做哪些动作、什么情况下必须停?

本文面向合法的B2B开发、客户沟通和生命周期邮件,不是绕过邮箱服务商规则、同意要求或适用法律的方法。司法辖区、发件规模和收件人关系不同,要求也会变化,必要时仍要做本地合规复核。

分支一:它需要“发送”,还是只需要“准备”?

这是最大的分叉,因为它几乎决定后面所有采购要求。

A:只研究和起草

系统可以做:

  • 总结公司;
  • 找一个有依据的业务问题;
  • 写第一封邮件草稿;
  • 建议跟进语言;
  • 整理CRM备注。

最后由人审核并发送。

**成本特点:**人工更多,自动化复杂度更低。

**风险特点:**事实捏造、奇怪个性化、错人、错语气等问题,还有机会在发出去前被人拦住。

**适合:**低量高价值开发,或者团队还在摸索“什么才算好邮件”的阶段。

B:允许在明确边界内自动发送

系统可以使用批准过的模板或生成变体,安排跟进,并在某些回复类型下自动停止。

**成本特点:**减少人工发送,但增加工程、监控和送达率运营。

**风险特点:**一条错误规则可以被迅速放大。错联系人、过期公司信息或错误回复分类,可能在有人察觉前制造很多低质量触达。

**适合:**流程已经稳定,数据来源、抑制规则、审核阈值和负责人都很清楚的团队。

C:允许理解回复并采取动作

到这一步,它已经不是“AI写文案”,而是在参与业务运营。

它可能判断意向、预约会议、更新CRM、停止序列、路由异议甚至触发别的工作流。采购评估因此必须覆盖错误恢复、审计记录和权限设计,而不是只看文笔。

**决策规则:只委托能够产生目标收益的最小权限。**不要因为Demo顺滑,就顺手把发送和执行权限全开。

分支二:收件人数据到底从哪里来?

如果厂商回答含糊,这一步就该暂停。

邮件智能体的可信度不会高于它使用的联系人和公司数据。漂亮界面不会告诉你某个字段到底来自CRM、模型推断、数据供应商、公开网页,还是几个月前的补全记录。

至少应该区分:

  • 第一方CRM数据;
  • 人工备注;
  • 获得许可的第三方数据;
  • 公开网页研究;
  • 模型推断;
  • 生成内容。

为什么重要?“这家公司8月宣布新建仓库”和“这家公司可能正在扩张物流能力”不是一个等级。前者是事实陈述,应该能回到证据;后者是推断,就要明确当推断使用。

给供应商一组“脏数据”

不要只看完美Demo。准备十条故意有问题的测试记录:

  • 重复联系人;
  • 已经换工作的人;
  • 两个同名的人;
  • 有多个域名的公司;
  • 职位缺失;
  • 过期邮箱;
  • 已标记禁止联系的人;
  • 本来就是客户、不该进冷开发序列的账号。

看系统如何处理。真实运营永远不会只有干净数据。

分支三:谁对送达率负责?

如果智能体通过你的域名发信,送达率最终仍是你的业务问题,即使工作流由供应商运行。

Google当前的发件人指南强调认证、垃圾邮件率监控等要求。Gmail建议把用户报告的垃圾邮件率控制在0.10%以下,并避免达到0.30%或更高。Yahoo也提供发件规范、投诉反馈工具等。具体要求会随发送规模和行为变化,所以采购方不应该只背一个数字,而要确认:谁在监控发件身份,谁有权立刻停机。

至少问四个问题:

  1. SPF、DKIM、DMARC由谁配置和维护?
  2. 在哪里看投诉、退信和信誉信号?
  3. 退订、硬退信或政策事件后,什么机制自动抑制地址?
  4. 谁能立即暂停发送?

“送达率我们会处理”不算答案。控制面在哪里,才算答案。

最好把编排层和最终发送层分开

能分开的情况下,让智能体负责提出动作,发送层继续强制执行速率限制、抑制名单、认证和账号级控制。

这相当于给自动化留了一个刹车。

分支四:允许使用什么级别的个性化?

个性化不是变量越多越好,而是信息必须准确、相关,并且适合被使用。

可以把信号分四层:

**第一层:账号信息。**公司、行业、产品类别、公开公告。

**第二层:角色信息。**由公开职位和组织职责强支持的工作范围。

**第三层:公开业务信号。**招聘、产品变化、公开活动、官方新闻稿。

**第四层:个人推断。**风险更高,而且大多数开发根本不需要。

越接近个人、越依赖推断,就越需要人工审核。

一个简单规则:如果收件人可能问“你怎么知道的?”,运营者应该能清楚、合理地回答。

分支五:退订和禁止联系如何真正生效?

这件事必须在第一批发送前测试,而不是等第一次投诉以后。

美国FTC的CAN-SPAM相关指引要求商业邮件遵守包括退订处理在内的规则;其他司法辖区还可能有不同或额外要求。Gmail和Yahoo也有服务商层面的发件要求。

因此系统需要的不只是邮件底部一行文字,而是一个稳定的“禁止继续联系”状态。

至少测试这些情形:

  • 用户点击退订;
  • 用户回复“stop”;
  • 销售手动标记do-not-contact;
  • 同一联系人进入两个活动;
  • 公司记录被合并;
  • 联系人换工作;
  • 团队更换邮件供应商。

抑制状态应该能穿过工作流变化继续存在。

分支六:发出之前要不要人工批准?

至少有四种常见模式:

模式 人工审核 适合 主要代价
每封都审 100% 新流程、高价值客户 人工
每个账号首封审 先审首次触达 稳定的跟进逻辑 仍有自动化残余风险
只审异常 规则触发 成熟且边界清晰的流程 规则质量要求高
抽样审计 少量抽查 高度稳定重复流程 问题可能晚发现

不要默认选择最自动的一行,要按“一次错误值多少钱”来选。

普通低风险通知里,小分类错误也许能承受;战略大客户、投诉或敏感沟通中,同样错误可能非常昂贵。

分支七:回复分类怎么验?

Demo最爱展示这类简单回复:

  • “有兴趣”;
  • “不用了”;
  • “周二约我”。

真实邮箱更像这样:

  • “不是我,找Priya”;
  • “上季度看过,后来财务冻结项目”;
  • “别再联系我,但把技术资料发采购邮箱”;
  • 自动回复和转发内容混在一起;
  • 法律通知;
  • 安全问卷;
  • 讽刺。

在隐私和内部政策允许的情况下,用脱敏历史邮件做标注测试。不要只算“准确率”,还要给错误动作定价。

把真实有兴趣判断成没兴趣,会丢机会;把没兴趣判断成有兴趣,会浪费销售时间;没有识别退订,则比前两种都严重。评估权重应该反映这种差异。

分支八:真实成本到底怎么算?

“每席位多少钱”几乎从来不是总成本。

至少要算:

  • 软件订阅;
  • 数据/补全费用;
  • 模型或调用费用;
  • 邮箱/发送基础设施;
  • 集成成本;
  • 人工审核时间;
  • 送达率监控;
  • CRM清洗;
  • 异常处理;
  • 未来拆掉供应商时的替换成本。

最后不要除以“发了多少封”,而要除以一个能验证的业务结果:有效对话、接受会议、机会、保留客户,或者你真正管理的下游阶段。

便宜的大批量触达,如果伤害域名、制造大量垃圾CRM活动,可能是非常昂贵的自动化。

14天采购测试

采购测试不必很大,但要像运营。

第1–2天:权限地图

写清楚它可以读、写、发和触发什么,定义kill switch以及最终负责人。

第3–5天:脏数据测试

用一组已知错误的数据,看来源标记和禁止联系状态能否保留。

第6–8天:草稿质量测试

评分事实准确、相关性、语气和无依据推断。不要因为“看起来很个性化”就加分。

第9–10天:回复测试

测试模糊回复和高风险回复,特别检查退订、投诉类语言是否保守处理。

第11–12天:运营异常

模拟退信突然上升、认证问题、集成中断或供应商API故障,看流程能不能干净停下来。

第13–14天:经济复盘

计算运营人员时间、软件和数据成本,以及真正有用的结果数量,再决定是否增加权限。

看到这些红旗,Demo可以提前结束

如果供应商无法清楚解释下面这些问题,就不要急着采购:

  • 联系人数据怎么来的;
  • 哪些是事实,哪些是推断;
  • 抑制规则怎么生效;
  • 如何一键暂停发送;
  • 日志如何导出;
  • 合同结束后数据怎么处理;
  • 哪些模型或子处理方会接触内容;
  • 权限如何限制;
  • 自动化状态错了之后如何纠正。

会写漂亮邮件的模型很容易替换。真正昂贵的是运营边界不清。

最后的采购规则

只为一个最小、重复、目前正在消耗昂贵人工时间的决策闭环购买邮件智能体。事实错误、政策违规或客户关系损失代价高的节点,先保留人工。

然后让系统“挣到”更多自动化权限。

如果第一个月的数据来源清楚、送达稳定、抑制正确、回复处理可靠,而且经济结果可测,再把权限扩大一级。如果这些基础还不稳,继续加自动化只会让失败变快。

真正的采购指南不是“哪个AI最会写邮件”,而是:哪套系统值得被信任去做下一步运营决定。

Sources

Related Reading