有销售团队会问:“我们到底应该买哪个邮件智能体?”

这个问题通常问早了。

因为“邮件智能体”这个词,经常把完全不同的工作混在一起:退订名单过滤、CRM字段更新、判断谁该联系、研究客户、写信、选择跟进节奏、发送、识别回复、安排会议、再把结果写回CRM。

其中有些工作最适合死规则,有些适合工作流,有些适合语言模型,还有少数工作可以让真正的agent自主执行——但前提是企业已经把权限、异常和回滚想清楚。

所以真正影响速度、成本、控制力与风险的,不只是模型品牌,而是:

每一个环节究竟把多少判断权交给机器,以及犯错以后能不能轻易撤销。

本文把邮件智能体拆成四种运营方式:

  1. 确定性规则与模板;
  2. 带结构化分支的工作流自动化;
  3. LLM辅助起草 + 人工审批;
  4. 有边界的自主智能体。

成熟系统往往不是四选一,而是四层组合。

先看一张对比表

路线 最适合 上线速度 变动成本 控制力 人工审核 典型失败
规则 + 模板 退订、路由、固定序列、确定字段 快 低 很高 低 规则僵硬、个性化弱
工作流自动化 有明确分支的多步骤流程 中 低到中 高 低到中 异常分支漏掉、集成变旧
LLM辅助起草 研究总结、个性化文案 中 中 审批存在时较高 中到高 流畅地写错事实、审核成为瓶颈
有边界全代理 跨工具重复判断,权限清楚 设计较慢 中到高 中 按风险分层 工具误用、状态改变、链路难排查

这不是供应商报价表,而是运营特征。同样属于“工作流自动化”,内部轻量工具和大型企业平台的成本可能完全不同。

第一种:规则与模板——很多关键环节依然应该“笨一点”

规则不会思考,这恰恰是它最大的优点。

如果某个联系人已经退订,系统不应该再让模型判断“这封邮件是不是足够重要,可以再发一次”。正确动作就是确定性屏蔽。

类似场景还有:

  • 硬退信;
  • 禁止联系域名;
  • 发送身份;
  • 重复账户处理;
  • 区域分配;
  • 邮件类型标记;
  • 最大跟进次数;
  • 允许发送时段;
  • 已审批法律页脚;
  • CRM字段格式。

规则便宜、可审计、在大规模下行为稳定。

它的问题,是企业很容易把“判断”也硬编码成几百层if/else。例如“家具行业 + 20人以上 + title包含owner + 网站有wholesale页面 = 使用B序列”。数据一旧、职位一特殊、客户同时做零售和批发,规则就开始失真。

所以规则层应该少、硬、清晰,主要负责保护边界。

什么情况下规则应该赢

如果满足以下条件,优先规则:

  • 正确行为事先已知;
  • 错一次代价很高;
  • 平台、监管或内部制度形成硬边界;
  • 必须完整审计;
  • 个性化不会增加多少价值。

Gmail当前的发送要求就说明了这一点。向个人Gmail账户发信需要满足认证和基础设施要求;达到批量发信门槛后,还需要更严格的SPF、DKIM、DMARC等条件,营销和订阅类邮件需要支持一键退订。Google的FAQ建议用户举报垃圾邮件率保持在0.1%以下,并避免达到或超过0.3%。

这些不是“让模型灵活判断”的问题,而是运营约束。

第二种:工作流自动化——真正连接系统的骨架

工作流自动化适合把已经知道的步骤串起来,而不是让模型每一次都重新发明流程。

一个典型链路可能是:

新线索 → 校验邮箱 → 检查屏蔽 → 补充公司资料 → 分配负责人 → 创建任务 → 起草 → 等审批 → 发送 → 收集回复 → 更新CRM。

工作流引擎最重要的价值是保存状态:什么已经发生、什么还没发生、下一步应该是什么。

很多团队在这里跳得太快,直接上“agent”。模型被允许调用各种工具,却没有稳定的状态机。Demo看起来非常聪明,生产环境却到处都是重复发送、卡住的任务和状态冲突。

工作流擅长什么

它特别适合:

  • 重试;
  • 队列;
  • 超时;
  • 审批;
  • 条件分支;
  • webhook;
  • 幂等;
  • 日志;
  • CRM、邮箱、数据供应商、分析系统之间的同步。

而且,它可以精确规定AI出现在哪里。

例如:先用规则检查退订和资格,再由工作流调用模型总结客户,最后要求人工批准后才能发送。这样模型负责判断,人仍然控制不可逆动作。

它会怎么失败

流程图很容易掩盖软件复杂度。

一个有50个分支的工作流,本质上还是软件,需要版本控制、测试、告警和负责人。一旦CRM字段改名、API报错方式改变,流程可能静默停止,或者把客户路由错。

采购时不要只看happy path,直接问:

  • 查不到补充数据怎么办;
  • 两个联系人属于同一公司怎么办;
  • 邮箱断连怎么办;
  • CRM更新被拒怎么办;
  • 跟进期间客户提前回复怎么办;
  • 客户从另一个渠道退订怎么办。

异常路径往往比Demo更能说明产品成熟度。

第三种:LLM辅助起草——往往是最划算的中间层

语言模型最擅长的,是把上下文变成语言。

只要你给它干净的公司记录、少量经过核实的事实、产品边界和消息政策,它就能:

  • 总结客户研究;
  • 挑选相关卖点;
  • 调整语气;
  • 生成多个文案版本;
  • 分类回复;
  • 从自由文本提取结构化字段。

这能砍掉大量重复写作,同时又不必让模型拥有最终发送权。

对很多企业而言,这其实是第一阶段最划算的AI邮件方案。

一个容易被忽略的成本事实:模型费可能不是大头

截至2026年10月4日,OpenAI的GPT-5.6 Sol页面列出的文本价格为每百万输入token 4美元、输出token 20美元;Anthropic的Claude Sonnet 5则列为每百万输入token 2美元、输出token 10美元。价格会变化,长上下文和多轮agent也会改变实际成本,所以这里只能作为当日示例。

但它说明一个很现实的问题:在很多邮件自动化里,人工审核、数据、发送基础设施和运营成本,很可能比单纯文本生成费更贵。

如果每封草稿人工检查2分钟,5000封就是166小时以上。此时把模型费砍30%,可能远不如减少无意义审核,同时保持质量来得重要。

起草模式最常见的失败

模型会非常自然地把错误事实写得像真的。

所以真正关键的是上下文层要有来源信息:

  • 这个事实从哪里来;
  • 什么时间观察到;
  • 属于公司还是属于某个人;
  • 是否允许在邮件里提及;
  • 是否需要引用或人工确认。

提示词不是数据库。

第四种:全代理——只有“边界清楚”的自主才有价值

全代理能够研究、规划、调用工具、观察结果,再继续下一步。

如果环境足够结构化,这很有价值。

例如,可以允许一个有边界的agent:

  • 只研究批准的公开来源;
  • 只更新非敏感CRM字段;
  • 只起草允许的邮件类型;
  • 只有联系人通过确定性资格检查后才允许发送;
  • 固定最大跟进次数;
  • 自动分类回复;
  • 置信度不够时只创建会议任务,不直接替人预约。

关键不在“自主”,而在“有边界”。

智能体不应该继承创建者所有权限。它应该只有完成任务所需的最小权限、明确的不可逆动作限制,以及随时升级给人工的路径。

真正难的是状态,不只是文案

假设agent先发了A邮件,收到自动回复,又重新补充了客户资料,发现职位变了,于是想切到另一序列。

此时必须回答:

  • 旧序列是否取消;
  • 新数据和旧数据谁更可信;
  • 是否重新检查退订;
  • CRM是不是已经留下两个互相冲突的职位;
  • 下一封邮件到底属于哪条序列。

自主能力意味着不断改变状态。

所以如果供应商能展示很漂亮的AI文案,却展示不出事件日志、权限模型、异常恢复,那更像“文案生成器穿了一件agent外套”。

用“犯错成本”来决定自动化等级

动作越不可逆,越不应该在没有护栏的情况下把判断权完全交出去。

可以做一条简单风险阶梯:

低后果
总结公司 → 分类回复 → 提供主题行候选。

中后果
修改CRM字段 → 选择序列 → 安排跟进时间。

高后果
发送价格 → 写法律或合规声明 → 联系已屏蔽对象 → 修改合同条款 → 从核心域名大规模发送。

越往下,越应该增加确定性规则和人工批准。

这比笼统地说“我们human-in-the-loop”有用得多。

送达率会反过来限制“智能”

邮件自动化最终仍然受收件平台和域名信誉约束。

Google当前Gmail指南要求所有向个人Gmail账户发信的发送者满足基础认证和配置要求;每日向Gmail发送超过5000封的发送者需要满足更严格的条件。FAQ建议用户举报垃圾邮件率低于0.1%,并避免达到0.3%或更高。批量发送营销和推广邮件还需要一键退订。

美国FTC的CAN-SPAM商业邮件指南则要求发件头信息真实、主题不得欺骗、提供有效实体邮寄地址和清晰退订方式,并要求在10个工作日内处理退订请求。FTC也明确提示:把营销外包给第三方,并不能把法律责任一起“外包掉”。

这些美国规则并不是全球发送许可,各地区要求不同。但它们足够说明:资格判断、屏蔽和退订同步,不应该交给语言模型临场发挥。

最现实的架构,其实四层都会用

一个中型销售团队可以这样设计:

1. 确定性闸门
查退订、账户归属、发送域名、允许地区和必要字段。

2. 工作流状态
创建任务、调用补充数据、保存来源、处理重试和审批。

3. LLM判断
总结公司、选择允许的切入点、起草邮件、识别回复意图。

4. Agent自主
只在低风险人群中判断是否需要继续研究,或进入哪一个批准的序列分支。

5. 人工升级
价格例外、敏感声明、高管联系人、投诉和不确定事实全部交人。

它没有“AI销售员全自动替代人”那么戏剧化,但更容易真的跑起来。

七个问题决定该用哪一层

1. 我们交出去的到底是什么状态变化?

起草文字和真正发送,是两件完全不同的事。

2. 正确行为能不能写成硬规则?

能,就先用规则,不要花模型费重新解释已知边界。

3. 上下文缺失有多频繁?

缺数据越多,自主执行越危险,人工审核价值越高。

4. 误判一次的代价是什么?

回复分类错了可以修;给已退订用户继续发信,是另一种问题。

5. 需要协调多少工具?

邮箱、CRM、补充数据、日历、发送平台,每多一个系统,状态复杂度就上升。

6. 每一个动作能否重建原因?

如果事后回答不了“它为什么发了这封邮件”,就不应该给它高权限。

7. 能不能回滚?

容易撤回的动作可以大胆自动化;域名信誉和合规事故不容易撤回。

让供应商填这张表,而不是继续演示

功能 规则 工作流 LLM Agent 人工 是否保留证据/日志
联系资格
客户研究
起草
审批
发送
回复分类
退订
CRM更新
会议动作

如果几乎每一行都勾“Agent”,问为什么每一步都需要判断。

如果每一行都勾“人工”,问承诺的自动化到底创造了什么杠杆。

最应该避免的错误:可行动,却不可观察

最危险的邮件智能体,不一定是模型最差的那个,而是会执行、却解释不清自己为什么执行的那个。

提高自主权之前,至少应该能够重建:

  • 它看到了什么数据;
  • 使用的是哪个政策版本;
  • 调用了哪些工具;
  • 生成了什么;
  • 人是否改过;
  • 最终发了什么;
  • 收件人做了什么;
  • CRM之后发生了什么变化。

然后,每次只增加一个容易撤销的自主动作。

结论

规则、工作流、LLM起草和全代理不是四个互相排斥的产品,它们是四层能力。

硬边界用规则;状态管理用工作流;语言理解和起草用LLM;只有跨多个步骤的判断真的创造价值时,才上Agent。

最快的系统,也不是“把人全部删掉”的系统,而是把人从可预测工作里拿走,同时准确保留在人类判断最值钱的地方:不确定事实、信誉、合规和不可逆决策。

Sources

Related Reading