有销售团队会问:“我们到底应该买哪个邮件智能体?”
这个问题通常问早了。
因为“邮件智能体”这个词,经常把完全不同的工作混在一起:退订名单过滤、CRM字段更新、判断谁该联系、研究客户、写信、选择跟进节奏、发送、识别回复、安排会议、再把结果写回CRM。
其中有些工作最适合死规则,有些适合工作流,有些适合语言模型,还有少数工作可以让真正的agent自主执行——但前提是企业已经把权限、异常和回滚想清楚。
所以真正影响速度、成本、控制力与风险的,不只是模型品牌,而是:
每一个环节究竟把多少判断权交给机器,以及犯错以后能不能轻易撤销。
本文把邮件智能体拆成四种运营方式:
- 确定性规则与模板;
- 带结构化分支的工作流自动化;
- LLM辅助起草 + 人工审批;
- 有边界的自主智能体。
成熟系统往往不是四选一,而是四层组合。
先看一张对比表
| 路线 | 最适合 | 上线速度 | 变动成本 | 控制力 | 人工审核 | 典型失败 |
|---|---|---|---|---|---|---|
| 规则 + 模板 | 退订、路由、固定序列、确定字段 | 快 | 低 | 很高 | 低 | 规则僵硬、个性化弱 |
| 工作流自动化 | 有明确分支的多步骤流程 | 中 | 低到中 | 高 | 低到中 | 异常分支漏掉、集成变旧 |
| LLM辅助起草 | 研究总结、个性化文案 | 中 | 中 | 审批存在时较高 | 中到高 | 流畅地写错事实、审核成为瓶颈 |
| 有边界全代理 | 跨工具重复判断,权限清楚 | 设计较慢 | 中到高 | 中 | 按风险分层 | 工具误用、状态改变、链路难排查 |
这不是供应商报价表,而是运营特征。同样属于“工作流自动化”,内部轻量工具和大型企业平台的成本可能完全不同。
第一种:规则与模板——很多关键环节依然应该“笨一点”
规则不会思考,这恰恰是它最大的优点。
如果某个联系人已经退订,系统不应该再让模型判断“这封邮件是不是足够重要,可以再发一次”。正确动作就是确定性屏蔽。
类似场景还有:
- 硬退信;
- 禁止联系域名;
- 发送身份;
- 重复账户处理;
- 区域分配;
- 邮件类型标记;
- 最大跟进次数;
- 允许发送时段;
- 已审批法律页脚;
- CRM字段格式。
规则便宜、可审计、在大规模下行为稳定。
它的问题,是企业很容易把“判断”也硬编码成几百层if/else。例如“家具行业 + 20人以上 + title包含owner + 网站有wholesale页面 = 使用B序列”。数据一旧、职位一特殊、客户同时做零售和批发,规则就开始失真。
所以规则层应该少、硬、清晰,主要负责保护边界。
什么情况下规则应该赢
如果满足以下条件,优先规则:
- 正确行为事先已知;
- 错一次代价很高;
- 平台、监管或内部制度形成硬边界;
- 必须完整审计;
- 个性化不会增加多少价值。
Gmail当前的发送要求就说明了这一点。向个人Gmail账户发信需要满足认证和基础设施要求;达到批量发信门槛后,还需要更严格的SPF、DKIM、DMARC等条件,营销和订阅类邮件需要支持一键退订。Google的FAQ建议用户举报垃圾邮件率保持在0.1%以下,并避免达到或超过0.3%。
这些不是“让模型灵活判断”的问题,而是运营约束。
第二种:工作流自动化——真正连接系统的骨架
工作流自动化适合把已经知道的步骤串起来,而不是让模型每一次都重新发明流程。
一个典型链路可能是:
新线索 → 校验邮箱 → 检查屏蔽 → 补充公司资料 → 分配负责人 → 创建任务 → 起草 → 等审批 → 发送 → 收集回复 → 更新CRM。
工作流引擎最重要的价值是保存状态:什么已经发生、什么还没发生、下一步应该是什么。
很多团队在这里跳得太快,直接上“agent”。模型被允许调用各种工具,却没有稳定的状态机。Demo看起来非常聪明,生产环境却到处都是重复发送、卡住的任务和状态冲突。
工作流擅长什么
它特别适合:
- 重试;
- 队列;
- 超时;
- 审批;
- 条件分支;
- webhook;
- 幂等;
- 日志;
- CRM、邮箱、数据供应商、分析系统之间的同步。
而且,它可以精确规定AI出现在哪里。
例如:先用规则检查退订和资格,再由工作流调用模型总结客户,最后要求人工批准后才能发送。这样模型负责判断,人仍然控制不可逆动作。
它会怎么失败
流程图很容易掩盖软件复杂度。
一个有50个分支的工作流,本质上还是软件,需要版本控制、测试、告警和负责人。一旦CRM字段改名、API报错方式改变,流程可能静默停止,或者把客户路由错。
采购时不要只看happy path,直接问:
- 查不到补充数据怎么办;
- 两个联系人属于同一公司怎么办;
- 邮箱断连怎么办;
- CRM更新被拒怎么办;
- 跟进期间客户提前回复怎么办;
- 客户从另一个渠道退订怎么办。
异常路径往往比Demo更能说明产品成熟度。
第三种:LLM辅助起草——往往是最划算的中间层
语言模型最擅长的,是把上下文变成语言。
只要你给它干净的公司记录、少量经过核实的事实、产品边界和消息政策,它就能:
- 总结客户研究;
- 挑选相关卖点;
- 调整语气;
- 生成多个文案版本;
- 分类回复;
- 从自由文本提取结构化字段。
这能砍掉大量重复写作,同时又不必让模型拥有最终发送权。
对很多企业而言,这其实是第一阶段最划算的AI邮件方案。
一个容易被忽略的成本事实:模型费可能不是大头
截至2026年10月4日,OpenAI的GPT-5.6 Sol页面列出的文本价格为每百万输入token 4美元、输出token 20美元;Anthropic的Claude Sonnet 5则列为每百万输入token 2美元、输出token 10美元。价格会变化,长上下文和多轮agent也会改变实际成本,所以这里只能作为当日示例。
但它说明一个很现实的问题:在很多邮件自动化里,人工审核、数据、发送基础设施和运营成本,很可能比单纯文本生成费更贵。
如果每封草稿人工检查2分钟,5000封就是166小时以上。此时把模型费砍30%,可能远不如减少无意义审核,同时保持质量来得重要。
起草模式最常见的失败
模型会非常自然地把错误事实写得像真的。
所以真正关键的是上下文层要有来源信息:
- 这个事实从哪里来;
- 什么时间观察到;
- 属于公司还是属于某个人;
- 是否允许在邮件里提及;
- 是否需要引用或人工确认。
提示词不是数据库。
第四种:全代理——只有“边界清楚”的自主才有价值
全代理能够研究、规划、调用工具、观察结果,再继续下一步。
如果环境足够结构化,这很有价值。
例如,可以允许一个有边界的agent:
- 只研究批准的公开来源;
- 只更新非敏感CRM字段;
- 只起草允许的邮件类型;
- 只有联系人通过确定性资格检查后才允许发送;
- 固定最大跟进次数;
- 自动分类回复;
- 置信度不够时只创建会议任务,不直接替人预约。
关键不在“自主”,而在“有边界”。
智能体不应该继承创建者所有权限。它应该只有完成任务所需的最小权限、明确的不可逆动作限制,以及随时升级给人工的路径。
真正难的是状态,不只是文案
假设agent先发了A邮件,收到自动回复,又重新补充了客户资料,发现职位变了,于是想切到另一序列。
此时必须回答:
- 旧序列是否取消;
- 新数据和旧数据谁更可信;
- 是否重新检查退订;
- CRM是不是已经留下两个互相冲突的职位;
- 下一封邮件到底属于哪条序列。
自主能力意味着不断改变状态。
所以如果供应商能展示很漂亮的AI文案,却展示不出事件日志、权限模型、异常恢复,那更像“文案生成器穿了一件agent外套”。
用“犯错成本”来决定自动化等级
动作越不可逆,越不应该在没有护栏的情况下把判断权完全交出去。
可以做一条简单风险阶梯:
低后果
总结公司 → 分类回复 → 提供主题行候选。
中后果
修改CRM字段 → 选择序列 → 安排跟进时间。
高后果
发送价格 → 写法律或合规声明 → 联系已屏蔽对象 → 修改合同条款 → 从核心域名大规模发送。
越往下,越应该增加确定性规则和人工批准。
这比笼统地说“我们human-in-the-loop”有用得多。
送达率会反过来限制“智能”
邮件自动化最终仍然受收件平台和域名信誉约束。
Google当前Gmail指南要求所有向个人Gmail账户发信的发送者满足基础认证和配置要求;每日向Gmail发送超过5000封的发送者需要满足更严格的条件。FAQ建议用户举报垃圾邮件率低于0.1%,并避免达到0.3%或更高。批量发送营销和推广邮件还需要一键退订。
美国FTC的CAN-SPAM商业邮件指南则要求发件头信息真实、主题不得欺骗、提供有效实体邮寄地址和清晰退订方式,并要求在10个工作日内处理退订请求。FTC也明确提示:把营销外包给第三方,并不能把法律责任一起“外包掉”。
这些美国规则并不是全球发送许可,各地区要求不同。但它们足够说明:资格判断、屏蔽和退订同步,不应该交给语言模型临场发挥。
最现实的架构,其实四层都会用
一个中型销售团队可以这样设计:
1. 确定性闸门
查退订、账户归属、发送域名、允许地区和必要字段。
2. 工作流状态
创建任务、调用补充数据、保存来源、处理重试和审批。
3. LLM判断
总结公司、选择允许的切入点、起草邮件、识别回复意图。
4. Agent自主
只在低风险人群中判断是否需要继续研究,或进入哪一个批准的序列分支。
5. 人工升级
价格例外、敏感声明、高管联系人、投诉和不确定事实全部交人。
它没有“AI销售员全自动替代人”那么戏剧化,但更容易真的跑起来。
七个问题决定该用哪一层
1. 我们交出去的到底是什么状态变化?
起草文字和真正发送,是两件完全不同的事。
2. 正确行为能不能写成硬规则?
能,就先用规则,不要花模型费重新解释已知边界。
3. 上下文缺失有多频繁?
缺数据越多,自主执行越危险,人工审核价值越高。
4. 误判一次的代价是什么?
回复分类错了可以修;给已退订用户继续发信,是另一种问题。
5. 需要协调多少工具?
邮箱、CRM、补充数据、日历、发送平台,每多一个系统,状态复杂度就上升。
6. 每一个动作能否重建原因?
如果事后回答不了“它为什么发了这封邮件”,就不应该给它高权限。
7. 能不能回滚?
容易撤回的动作可以大胆自动化;域名信誉和合规事故不容易撤回。
让供应商填这张表,而不是继续演示
| 功能 | 规则 | 工作流 | LLM | Agent | 人工 | 是否保留证据/日志 |
|---|---|---|---|---|---|---|
| 联系资格 | ||||||
| 客户研究 | ||||||
| 起草 | ||||||
| 审批 | ||||||
| 发送 | ||||||
| 回复分类 | ||||||
| 退订 | ||||||
| CRM更新 | ||||||
| 会议动作 |
如果几乎每一行都勾“Agent”,问为什么每一步都需要判断。
如果每一行都勾“人工”,问承诺的自动化到底创造了什么杠杆。
最应该避免的错误:可行动,却不可观察
最危险的邮件智能体,不一定是模型最差的那个,而是会执行、却解释不清自己为什么执行的那个。
提高自主权之前,至少应该能够重建:
- 它看到了什么数据;
- 使用的是哪个政策版本;
- 调用了哪些工具;
- 生成了什么;
- 人是否改过;
- 最终发了什么;
- 收件人做了什么;
- CRM之后发生了什么变化。
然后,每次只增加一个容易撤销的自主动作。
结论
规则、工作流、LLM起草和全代理不是四个互相排斥的产品,它们是四层能力。
硬边界用规则;状态管理用工作流;语言理解和起草用LLM;只有跨多个步骤的判断真的创造价值时,才上Agent。
最快的系统,也不是“把人全部删掉”的系统,而是把人从可预测工作里拿走,同时准确保留在人类判断最值钱的地方:不确定事实、信誉、合规和不可逆决策。
Sources
- Google, Email sender guidelines for Gmail(访问于2026-10-04)— https://support.google.com/mail/answer/81126?hl=en
- Google, Email sender guidelines FAQ(访问于2026-10-04)— https://support.google.com/mail/answer/14229414?hl=en
- U.S. Federal Trade Commission, CAN-SPAM Act: A Compliance Guide for Business — https://www.ftc.gov/business-guidance/resources/can-spam-act-compliance-guide-business
- OpenAI, GPT-5.6 Sol model pricing(访问于2026-10-04)— https://developers.openai.com/api/docs/models/gpt-5.6-sol
- Anthropic, Claude Sonnet 5 pricing(访问于2026-10-04)— https://www.anthropic.com/research/claude-sonnet-5