先给三个结论。

**第一,真正值钱的不是“AI会写邮件”。**生成文字已经是整条链里最便宜的一层。难的是权限、身份、数据质量、路由、送达率、人工接管和测量。

**第二,买家和卖家经常在用不同语言描述同一套东西。**买家说“我要一个能自动跟进潜客的智能体”,供应商实际交付的可能是一组CRM触发器、数据补全、文案生成、发信基础设施和自动化工作流。

**第三,邮件智能体受邮件生态规则约束。**认证、投诉率、退订、同意和域名信誉不是“上线后再优化”的细节,它们决定这套系统能不能长期运行。

理解这三点,邮件智能体市场就不再神秘。

买家通常有的是“工作流问题”,不是“AI问题”

销售团队很少会为了拥有一个“邮件智能体”而买产品。

真正的需求通常是:

  • 表单潜客进来后5分钟内跟进;
  • 客户问技术问题时先生成有依据的草稿;
  • 一个对话沉默太久时提醒销售;
  • 采购、售后和商务问题自动分流;
  • 基于已知客户信息做生命周期邮件;
  • 人工接手前自动总结长邮件线程;
  • 已退订、已经成交或不应继续触达的人自动停止发送。

这些工作流的风险完全不同。

“帮人工起草”与“自主向成千上万人发送”不是一个产品;客服智能体通常工作在已有对话里;生命周期营销必须工作在订阅与许可规则内;销售辅助智能体可以只做研究、建议和草稿,而不拥有发送权限。

因此,市场第一条分界线其实是:智能体到底有多大行动权限。

采购时应明确它能不能:

  1. 读取和分类;
  2. 起草;
  3. 建议下一步;
  4. 修改CRM字段;
  5. 安排发送;
  6. 真正发送;
  7. 自动重试;
  8. 加入抑制名单;
  9. 转人工。

一个供应商如果只说“全自动”却不拆这些权限,恰恰把最重要的产品信息藏起来了。

证据:送达规则已经把“邮件基础设施”变成产品本身的一部分

近几年邮箱服务商把发件规则写得越来越明确。

Google当前的邮件发送者指南要求所有向Gmail发送邮件的发送者做好基础认证并控制垃圾邮件率;达到其大批量发送门槛后,还要求SPF、DKIM、DMARC、域对齐,并要求营销和订阅类邮件支持一键退订。Google还明确说明,自2025年11月起,对不合规流量加大执行力度,可能出现临时或永久拒收。

Yahoo Sender Hub同样要求认证、低投诉率,并对批量发送者要求SPF、DKIM、DMARC以及便捷退订。Yahoo公开指南要求批量发送者把垃圾投诉率控制在0.3%以下,并在两天内处理退订。

这就是为什么不能只用“文案写得像不像真人”评价邮件智能体。

一封写得很漂亮的邮件,如果从信誉受损的基础设施发出去,仍然是送达问题。

一套技术认证很完整的系统,如果持续发给根本不想收到的人,仍然是信誉问题。

一个用户已经退订,智能体还继续追发,那不是“有毅力”,是系统坏了。

卖家地图:六层能力经常被打包在一起卖

市场上的产品大多占据下面一层或多层。

第一层:系统记录

也就是CRM、电商系统、客服系统或客户数据库。

它负责回答:

  • 这个人是谁;
  • 过去发生过什么;
  • 已知的订阅/许可状态是什么;
  • 对应哪个订单、机会、工单或公司;
  • 内部谁负责这个关系。

系统记录不可靠,个性化很快就会退化成猜测。

第二层:数据与补全

这层负责补字段、清洗或重组信息。

B2B里可能是公司属性、职位、公开资料;生命周期场景可能是商品历史、互动状态、客服上下文。

这里采购最应该问的是数据来源:这个字段从哪里来、什么时候观察到、我们是否有理由在这个场景使用它?

不确定的补全数据,不能被智能体加工成一个语气很肯定的私人事实。

第三层:编排与规则

这才是很多系统真正的“大脑”。

它决定一封邮件应该起草、发送、延迟、停止还是转人工。判断可能来自客户阶段、最后联系时间、订阅状态、账户负责人、时区、最近回复和业务规则。

优秀的编排层通常故意设计得很“无聊”,因为它需要大量明确规则:

  • 什么时候允许发送;
  • 一个人多久能收到几封;
  • 哪些情况必须人工审核;
  • 谁进入抑制名单;
  • 什么语言代表退订意图;
  • 谁接哪个类型的问题;
  • 什么情况升级;
  • 失败后是否重试;
  • 两条自动化同时想联系同一个人时谁优先。

这层的价值,就是不让“AI很积极”最后变成“客户被骚扰”。

第四层:生成与检索

模型在这里真正写东西、回答问题。

稳定的系统通常不仅有Prompt,还需要检索批准过的信息:产品资料、价格政策、文档、账户备注、最新邮件线程等。

这里必须区分两个词:生成与权威来源。

模型能生成一句很像真的话,并不代表这句话已经成为公司政策。

价格、合同承诺、交期、折扣、退款等高风险事实,最好来自受控来源或要求人工确认。

第五层:发送与送达基础设施

这包括域名、邮件传输、SPF/DKIM/DMARC、信誉、退信、退订以及流量控制。

很多“AI销售工具”把这一层藏在一个Send按钮后面,但买家不应该忽略。

直接问:

  • 用哪个域名发;
  • 谁配置认证;
  • 退信由谁处理;
  • 退订怎样同步到所有工作流;
  • 去哪里看投诉和信誉;
  • 能不能按域名、受众限制发送量;
  • Gmail或Yahoo开始拒收时系统怎么降速或停发?

回答不了这些问题,风险最终仍然在买家身上。

第六层:测量与人工复核

智能体必须有审计轨迹。

至少应该知道:

  • 为什么触发这次动作;
  • 使用了哪些数据;
  • 最终发送了哪个版本;
  • 是否有人审核;
  • 是否成功送达;
  • 对方是否回复;
  • 是否被停止、抑制或转人工。

销售场景中,“有效回复和真实推进”通常比“发了多少封”重要;生命周期场景则更应该看增量收入、留存、任务完成等结果。

只看打开率,远远不够指导一个自动行动系统。

例外:不是所有邮件都值得完全自动化

有些任务非常适合自动化:

  • 确认和状态通知;
  • 明确规则的提醒;
  • 分类与路由;
  • 长线程总结;
  • 低风险草稿;
  • 给内部销售的下一步建议。

另一些则更适合保留人工控制:

  • 商务谈判;
  • 非常规投诉;
  • 特殊价格;
  • 法律或合同承诺;
  • 敏感个人情况;
  • 明显愤怒的客户;
  • 表达含糊的退订;
  • 基于不确定第三方数据的个性化。

分界线不是“模型会不会写”,而是:写错的代价有多大,这个动作能不能撤回。

买家真正应该比较什么

1. 触发器质量

什么情况会让智能体行动?

强触发器通常是真实、可观察的事件:客户回复、提交表单、已知续费时间、明确的流程中断、CRM状态变化。

弱触发器则是“模型觉得这个人可能感兴趣”。

2. 权限模型

能否精确设置“可读、可改、可发”?

是否支持仅草稿、必须审批、不同角色不同权限?

3. 上下文质量

系统能否区分已验证事实、推断和第三方数据?

是否能看到来源和新鲜度?

4. 规则控制

联系频率、退订、同意、工作时间、账户归属、升级规则能否明确编码?

5. 送达运营

谁负责认证、退信、退订和投诉监控?

6. 人工接管

人工能不能随时接入,而不是跟自动化抢控制权?

好的智能体知道什么时候停止。

7. 测量

是否既看业务结果,也看错误类型?

8. 可迁移性

如果换供应商,模板、规则、日志、抑制名单和实验记录能不能导出?

卖家的收费方式会改变产品行为

收费模式往往会透露系统会优化什么。

按席位收费的产品可能更重协作。

按邮件量收费的产品,收入随发送量增加。

数据商会把补全能力放在中心。

平台可能更希望你使用它自己的发送基础设施。

机构会把策略、创意和运营打包。

这些模式都不天然有问题,但激励很重要。

如果供应商发得越多赚得越多,就问它怎么避免“不必要发送”;如果它靠数据补全赚钱,就问不确定字段怎么处理;如果迁移成本高,就问审计记录到底属于谁。

大多数团队其实只需要一条更简单的链路

一个实用架构通常是:

系统记录 → 编排规则 → 已批准知识 → 模型 → 必要时人工审核 → 发信基础设施 → 测量。

不要一上来就铺满所有场景。

可以先从一个边界清晰的流程开始,比如“官网Demo申请”。

智能体读取表单与既有客户记录,用批准过的资料起草回复;缺一个关键资格条件时只追问一个问题;企业级复杂客户直接转人工;所有动作写回系统。

这时就能积累真正有用的失败日志:

  • 触发错了;
  • 上下文过期;
  • 检索错资料;
  • 出现未经支持的承诺;
  • 联系错人;
  • 频率过高;
  • 送达失败;
  • 应该转人工但没转。

这种日志,比展示十封“写得很像真人”的最佳邮件更有价值。

为什么市场会继续分成“廉价生成层”和“昂贵控制层”

生成会越来越便宜。

控制不会。

真正能形成长期壁垒的,很可能是身份、权限、可信数据、送达率、审计和可衡量业务规则。

所以看产品Demo时,不要只看它如何漂亮地写一封邮件。

更应该要求演示以下情况:

  • 客户昨天刚退订;
  • CRM与第三方数据冲突;
  • 客户回复要求特殊价格;
  • 域名投诉率突然恶化;
  • 两条工作流同时想触达同一个账户;
  • 模型找不到经过验证的答案。

一张真正有用的邮件智能体市场地图,不是告诉你“谁会发邮件”,而是告诉你:在不应该发的时候,到底谁负责让它停下来。

Sources

Related Reading