一套邮件智能体,调用一次模型可以很便宜,但真正把它长期跑起来,未必便宜。

很多ROI模型就在这里算错了:采购方看到模型单价很低,乘上几千封邮件,就得出“自动化邮件几乎没有成本”的结论。模型账单当然是真的,但它只是其中一层。围绕模型存在的数据、联系人清洗、发信基础设施、人工审核、送达率、CRM同步、异常处理、合规和域名信誉,往往才决定这门生意到底划不划算。

所以更合理的起点不是“每封AI邮件多少钱”,而是:

每一个真正有用的商业结果,全部成本是多少?

下面引用的公开平台价格和发件规则按2026年10月4日核对,仅作为建模示例。价格与平台政策都可能变化,正式采购时必须换成自己的真实报价与适用规则。

先把8层成本列全

每一层都写三个数字:固定月费、随用量变化的费用、失败时由谁负责。

成本层 真正在付什么钱 为什么存在
模型推理 读上下文、分类、推理、起草 生成或判断内容
联系人与数据 CRM、补全、去重、来源和同意记录 防止智能体拿错身份做事
发信基础设施 邮箱/ESP、域名、认证、信誉监控 让邮件稳定进入收件系统
工作流编排 触发、队列、重试、日志、集成 把一次模型调用变成可运营流程
人工审核 审批、抽检、高风险回复、升级处理 拦住自动化不该承担的错误
送达率运营 退信、投诉、抑制名单、信誉监控 保护未来所有邮件的到达能力
合规与治理 退订、记录、权限、政策 避免增长变成监管和信任债务
CRM与营收运营 线索分配、归属、去重、归因 把邮件动作接回真实商业结果

如果一个报价只覆盖第一行,它并没有给你报“邮件智能体系统”的完整价格。

单是模型费,选择不同就可能差几十倍

公开API价格至少说明一件事:所谓“AI成本”不是一个固定数字。

截至2026年10月4日,OpenAI公开模型页显示,GPT-6 Luna文本价格为每100万输入token 0.10美元、输出0.50美元;GPT-5.6 Sol则为输入4美元、输出20美元。这只是一个供应商的两个公开例子,不代表推荐,也不是永久价格。

差异非常大。

如果工作流让小模型做回复分类、标签判断,让更强模型只处理复杂起草,并且能缓存重复上下文,模型费可能只是很小一项。反过来,如果每一封邮件都把巨大的客户历史塞进高价模型,又让它反复生成多个长版本,token成本也会迅速扩大。

但即使如此,采购时也不该只问“哪个模型最便宜”。

更值得问:

哪些步骤真的需要高成本推理?哪些可以用规则、小模型、缓存或批处理?

假设一个月做1万次邮件决策,每次用几千token。在很多配置里,模型成本依旧可能低于一个人工运营岗位、一个数据补全服务、一套发信系统,或者因为域名信誉下降而损失的业务机会。

送达率不是技术脚注,而是经济变量

邮件智能体如果让发送量增加,却把域名信誉做坏,账面“自动化效率”越高,实际可能亏得越快。

Google当前发件指南要求,向个人Gmail账户发送邮件的发件方至少配置SPF或DKIM、有效的正反向DNS并使用TLS,同时让Postmaster Tools里的垃圾邮件率低于0.3%。每天向Gmail发送超过5000封的发件方,还要满足SPF、DKIM、DMARC、直接邮件的域对齐等要求,营销或订阅邮件要支持一键退订。

Yahoo Sender Hub当前规则同样要求认证并把投诉率控制在0.3%以下;批量发件方需要SPF、DKIM和DMARC,并提供容易找到的退订方式,Yahoo还要求在两天内处理退订。

这意味着“多发一万封”的边际成本绝不只是API费。

量越大,越需要:

  • 抑制名单;
  • 退信处理;
  • 投诉监控;
  • 域名与身份治理;
  • 退订同步;
  • 内容和名单质量控制。

如果智能体把邮件发给明显不愿意接收的人,眼前的单封成本也许只有几分钱甚至更低,但后面的代价会通过送达率下降影响未来每一场活动。

所以仪表盘上应该把投诉率、退信、退订处理和域名信誉放在预约数、回复数旁边一起看。

人工审核是最容易被漏掉的一行

自动化真正便宜的时候,是任务足够可预测的时候。

一套成熟系统不应该让所有邮件走同一种审批方式,可以按风险分三层。

第一层:确定性自动化。
例如识别回复类别、更新CRM状态、执行退订、从批准过的事实片段里取内容。这些动作规则清楚,可以自动执行并保留日志。

第二层:抽样审核。
大量常规内容在政策允许时可以自动发送,但固定比例进入质量抽检。抽检不应该只看语法,而要看事实错误、错个性化、语气、错误对象和规则违规。

第三层:强制人工批准。
特殊报价、法律表述、敏感投诉、合同内容、高价值高管触达、使用来源不确定的数据,都应该停下来等人。

这三层直接影响利润。

所有邮件都让人工逐字审批,自动化节省的时间很快被审核吃掉;反过来,把所有边缘情况都交给模型,则可能用少量省下来的人工换来一次昂贵错误。

真正好的经济模型,是让系统按风险分流。

数据错了,越“个性化”越贵

邮件智能体只能使用它拿到的数据。

CRM里如果有重复公司、过期职位、来源不清的字段、错误的客户归属、被复制到多个账户的旧备注,模型不会自动把数据库变干净。它更可能把错误包装成一段读起来非常自然的邮件。

因此预算里还应该包括:

  • 身份匹配和重复规则;
  • 每个重要字段从哪里来的;
  • 补全数据的更新时间;
  • 退订/不联系状态;
  • 客户归属;
  • 一处纠正后如何同步到其他系统。

这也是为什么“每小时生成多少封”并不是好效率指标。

一个速度慢一点但上下文干净的智能体,可能比一个每分钟大量生成、却制造审核和投诉工作量的系统更便宜。

合规要放进流程,而不是最后粘一个页脚

美国FTC的CAN-SPAM商业邮件规则包括准确的头部信息、不能使用欺骗性主题、提供有效实体邮寄地址和退订机制等要求,而且企业可能对其委托的第三方发送行为承担责任。

所以合规不应该变成“邮件写完之后自动补一句退订说明”。

工作流一开始就应该知道:

  • 这是什么类型的信息;
  • 哪个发件身份被允许使用;
  • 哪些收件人已经被抑制;
  • 哪些营销表述经过批准;
  • 哪些回复或退订必须永久修改状态。

跨国发送时还要更加谨慎。美国规则并不等于全球通行证,不同司法辖区对商业邮件、同意、个人数据和营销都有不同要求。真正做全球业务时,应按收件人和业务场景映射适用规则。

用“结果成本”而不是“发送成本”算ROI

一个更实用的月度公式是:

总运营成本
= 模型 + 数据 + 发信 + 编排 + 人工 + 送达率运营 + 合规 + 集成

每个合格结果成本
= 总运营成本 ÷ 合格回复、预约、商机或保留客户

增量贡献
= 真正由项目增加的结果贡献 − 本来就会自然发生的贡献

回本情况
= 增量贡献 ÷ 总运营成本

这样会强迫团队把“动作量”和“商业价值”拆开。

例如系统发了2万封、约到100个会议,表面很漂亮。但如果其中60个是重复线索、不符合条件、销售根本接不了,或者本来就会预约的客户,经济结果完全不同。若同时投诉上升,让重要域名后续更难进入收件箱,结果还会再次改变。

采购时要求供应商写清楚这5个数字

  1. 在你的真实发送量下,每月全部平台与使用成本。 包括模型、数据、发信和集成,不接受只报“AI调用费”。
  2. 多少比例需要人工审核。 因为人工时间就是成本。
  3. 退订、退信和投诉怎么跨系统同步。 因为信誉问题会产生未来成本。
  4. 数据补全错误、CRM重复时系统怎么处理。 因为脏数据会直接变成运营费用。
  5. 商业结果怎么归因和去重。 因为邮件生成数量从来不是ROI。

然后再补一个只有你自己能提供的数字:

每一个合格结果到底值多少贡献。

这一行,才会把“很酷的AI演示”变成真正可以批准或否决的财务决策。

最后判断

最便宜的邮件智能体,不是token单价最低的那个。

它应该是:

  • 有用结果最多;
  • 人工返工最少;
  • 域名信誉损耗最低;
  • 数据治理最干净;
  • 总运营成本最低。

模型价格当然重要,规模大时尤其重要。但很多企业真正昂贵的错误都发生在模型之外:发错人、退订没同步、CRM被写乱、所有邮件都要人工重写,或者把“发送量”误当成“营收贡献”。

先把整条工作流定价,再判断自动化到底值不值得。

Sources

Related Reading