最容易写、也最没价值的邮件智能体案例通常是:

“AI写了更多邮件,团队省了很多时间,回复率提高了。”

真正困难的部分恰恰被这句话藏掉了。

真正值得复盘的问题是:哪些工作应该消失,哪些判断必须继续由人负责,以及自动化越多以后,哪些控制反而要变得更严格。

下面是一个面向小型B2B服务公司的虚构综合案例。公司、邮件量、回复率和运营结果都是示例,不代表真实客户业绩。重点是展示一条可以迁移的方法:怎样让邮件智能体承担重复劳动,同时不让它无边界地接管客户关系。

起点不是“我们需要AI”

这支团队有4个共享邮箱和3名销售。

线索来自:

  • 官网表单;
  • 老客户介绍;
  • 线下活动名单;
  • 已有客户的扩展需求;
  • 正在推进的商机。

真正的问题不是没人会写邮件,而是跟进非常不稳定:

  • 新咨询有时要等大半个工作日;
  • 两个人偶尔会同时回复同一个客户;
  • 大量简单问题占用资深销售时间;
  • 销售一忙,后续跟进就断掉;
  • CRM记录不完整;
  • “不要再联系我”分散在多个地方。

最初有人建议:“把所有邮箱接给智能体,让它自动跟进。”

这个方案被否决。

团队把项目拆成三个更窄的任务:

  1. 对入站邮件分类,并提取结构化信息;
  2. 基于已批准信息起草首次回复与后续跟进;
  3. 只有在明确权限规则通过时,才允许自动发送低风险邮件。

这一步缩小范围,本身就是第一个真正的效率提升,因为系统终于可以被逐层验证。

基线看的是工作队列,不是漂亮的AI指标

团队先用四周记录最简单的基线。

下面都是示例数字:

指标 基线
每周新增商业对话 180
每周到期的已有线索跟进 260
工作时间内首次回复中位数 3.8小时
需要资深销售判断的线程 32%
按期完成的后续跟进 61%
4周内重复/冲突联系 6次

团队没有一开始就看“模型用了多少Token”“Prompt延迟多少”“AI准确率多少”。

这些可以是工程指标,但业务问题是:回复慢、跟进漏、职责不清、控制不一致。

决策一:先自动分类,不先自动发送

第一个正式流程只做三件事:

读取新邮件、尽可能匹配CRM里的身份、然后分到六个路由:

  • 新销售咨询;
  • 已有商机;
  • 客户/服务问题;
  • 账单/账户;
  • 退订/禁止联系;
  • 未知或高风险。

输出结构化字段和一个简短理由。

不向外发送任何邮件。

第一周,人工不断纠正分类并记录为什么错。

很快团队发现:多数错误不是语言理解不够好,而是系统缺少CRM上下文。

比如一个老客户询问“新门店”,只看邮件文字很像新销售线索;一旦补上客户身份和历史项目,它其实应该进入已有客户扩展流程。

于是团队没有继续往Prompt里堆更多规则,而是先修上下文检索。

这形成了一条后来反复使用的规则:

信息缺失的问题,先修信息层,不要用更多指令去假装弥补。

决策二:每个草稿都必须能看见“依据”

分类稳定后,智能体开始起草邮件。

销售审核草稿时,可以同时看到:

  • 收件人和账户;
  • 为什么触发这封邮件;
  • 用了哪些已批准产品/服务事实;
  • 最近一次相关互动;
  • 这是入站、已有关系跟进,还是全新开发;
  • 抑制状态;
  • 模板/政策版本;
  • 建议的下一步动作。

如果草稿出现知识库里找不到的事实性承诺,系统不允许“聪明地补全”,而是直接标记人工审核。

这让审核快了很多。

销售不再逐字校对文笔,而是在判断:这个动作的业务上下文是不是正确。

决策三:已有关系和冷商业开发必须分开

这一步同时影响发送信誉和合规。

客户刚刚主动要了报价以后收到预期中的跟进,和向一个新找到的地址发送商业开发邮件,在运营上根本不是同一种邮件。

团队因此拆成两条路径。

已有关系/入站路径

  • 允许更高程度自动化;
  • 可使用当前线程与CRM上下文;
  • 有明确响应时限;
  • 价格、法律、付款、异常承诺必须升级人工。

全新开发路径

  • 名单来源检查更严格;
  • 初期发送量更低;
  • 必须过抑制名单;
  • 需要地区与公司政策检查;
  • 试点阶段保留人工审批;
  • 单独监控发送者健康。

对于美国商业邮件,团队把FTC的CAN-SPAM指南放进合规清单;对于邮箱服务商要求,则直接链接Google和Yahoo的当前发送者文档,而不是依赖内部某个旧版“经验截图”。

分开以后还有一个很实际的好处:如果开发邮件影响信誉,可以只停开发路径,不影响客服和已有客户邮件。

决策四:抑制名单从Excel升级成真正的服务

项目开始前,“不要再联系我”可能存在于:

  • 营销平台;
  • CRM备注;
  • 某个销售的私人邮箱;
  • 一个共享表格。

自动化一旦扩量,这种状态就非常危险。

团队最后建立了一个所有外发流程共用的抑制检查,统一吸收:

  • 退订事件;
  • 人工Do Not Contact;
  • hard bounce;
  • 可获得的垃圾邮件/投诉反馈;
  • 法务或账户级排除。

智能体永远没有“忽略抑制”的权限。

Google和Yahoo当前发送资料都强调相关批量/订阅邮件的退订与发送者信誉控制;Yahoo的Complaint Feedback Loop还可以为符合条件的DKIM域名返回投诉报告。

这些信号不再只是月度营销报告,而是直接变成系统控制输入。

决策五:自动发送按“邮件类别”开放,不按一个总开关开放

经过几周只起草、不自动发以后,团队并没有突然打开“全部自动发送”。

它只批准了少数类别。

可以有限自动发送

  • 官网咨询确认;
  • 客户明确要求会议后的预约链接跟进;
  • 补充缺失的非敏感项目信息;
  • 符合规则的在途报价提醒。

仍需人工批准

  • 新冷开发;
  • 非标准报价;
  • 折扣谈判;
  • 合同或法律文字;
  • 付款争议;
  • 安全或受监管的承诺;
  • 高价值/VIP账户;
  • 分类器自己都不确定的线程。

这样做的核心不是“保守”,而是把事故影响范围压小。

第一次看上去很成功,但团队没有接受

在这个虚构试点里,人工工作量很快下降。

假设看板出现:

  • 首次回复中位数从3.8小时降到22分钟;
  • 按期跟进从61%提高到91%;
  • 草稿采纳率约78%。

这些数字看起来非常漂亮。

但抽样质检发现一个问题:部分跟进邮件事实完全正确,商业上却很弱。

智能体会重复客户已经知道的内容,然后用一句通用的“是否想进一步了解?”结尾,并没有真正推进商机。

团队没有把Prompt改成“更有说服力”。

它重新定义了任务。

每个跟进线程必须处于下面某个明确状态:

  • 等客户补资料;
  • 等内部动作;
  • 报价已发送;
  • 等待预约;
  • 暂无下一步;
  • 禁止联系。

邮件必须推动这个状态,否则宁可不发。

结果是无意义邮件减少,人工采纳反而提高。

这个结论有点反直觉:

更好的自动化,有时候意味着少发邮件。

第二个问题来自发送者健康

新开发试点使用了独立且经过批准的发送路径。

扩大一点量以后,其中一个名单来源的投诉和退信信号开始恶化。

团队没有让智能体“改改主题行继续发”。

它暂停了这个名单来源,检查获取方式、验证流程、hard bounce与抑制同步,并重新看目标客户匹配。

这也是为什么邮箱服务商规则必须进入运营系统。Google当前bulk sender FAQ说明达到其bulk阈值的域名会持续受到相应要求;Yahoo也持续公布认证、退订和投诉处理建议。

这些规则会更新,所以团队Runbook里放的是官方实时页面,而不是写死一份永久不变的经验。

最后的动作是:保留自动化系统,但移除这个质量差的名单来源。

又一次,真正有效的修复是缩小坏输入,而不是让文案变得更“聪明”。

30天示例复盘

在虚构的30天结束时,团队这样总结:

领域 示例变化 真正意味着什么
首次回复时间 明显下降 分类+草稿自动化有效
按期跟进 明显提高 队列管理改善
资深销售介入 常规线程减少 时间转向高判断工作
重复联系 接近0 归属状态更清楚
草稿采纳 状态模型后提高 更好上下文胜过更多Prompt
冷开发量 被刻意限制 信誉控制限制扩量
投诉/退信风险 高度依赖名单 目标质量仍是硬约束

团队没有宣布某一个数字就是“ROI”。

真正的价值由几部分组成:

  • 节省的重复劳动;
  • 没有再漏掉的商机跟进;
  • 减少的重复触达;
  • 更稳定的流程控制。

成本则包括:

  • 系统实现;
  • 监控;
  • 数据清理;
  • 人工审核;
  • 发送基础设施。

团队明确拒绝自动化的部分

边界本身也是案例的一部分。

最终仍由人负责:

  • 非标准报价;
  • 合同或法律解释;
  • 可能升级成争议的投诉;
  • 高敏感个人信息;
  • 未出现在批准资料里的重大承诺;
  • 账户关闭或财务变更;
  • 任何抑制例外。

所以系统没有追求“自动化百分比最大”。

它追求的是:

安全吞吐量最大。

从这个案例抽出来的一张复用清单

身份与发送基础设施

  • SPF/DKIM/DMARC已复核;
  • 发送域名有清单;
  • 退信路径被监控;
  • 服务商合规面板有人看。

收件人控制

  • 只有一个抑制真源;
  • 退订路径实测;
  • 投诉反馈能进入抑制;
  • hard bounce禁止重发;
  • 已识别适用地区规则。

数据与上下文

  • CRM身份能匹配;
  • 有线程历史;
  • 已批准事实有版本;
  • 缺少上下文时升级,不编造。

权限

  • 每种邮件有自动化等级;
  • 高风险承诺由人负责;
  • 自动发送范围写得清楚;
  • 有停止条件。

质量

  • 每周随机抽查已发送邮件;
  • 被拒草稿按原因分类;
  • 看业务状态有没有推进;
  • 不把“发得更多”当成功本身。

恢复

  • 保存日志;
  • Prompt/模型/规则有版本;
  • 单一路径可以独立暂停;
  • 系统重启后抑制仍然有效;
  • 有限量恢复流程已经写好。

为什么这个案例真正有价值

表面上的技术是邮件智能体。

真正发生变化的是它周围的工作系统。

分类被明确了。客户归属被明确了。抑制集中起来。草稿依据可以看见。自动发送按类别授权。发送者健康有权停止系统。资深人员少做了常规处理,不是因为模型“替代了判断”,而是因为系统把真正需要判断的异常更准确地送到了人面前。

这比“AI发了1万封邮件”强得多。

而且更容易长期扩张。

Sources

Related Reading