一套邮件智能体,调用一次模型可以很便宜,但真正把它长期跑起来,未必便宜。
很多ROI模型就在这里算错了:采购方看到模型单价很低,乘上几千封邮件,就得出“自动化邮件几乎没有成本”的结论。模型账单当然是真的,但它只是其中一层。围绕模型存在的数据、联系人清洗、发信基础设施、人工审核、送达率、CRM同步、异常处理、合规和域名信誉,往往才决定这门生意到底划不划算。
所以更合理的起点不是“每封AI邮件多少钱”,而是:
每一个真正有用的商业结果,全部成本是多少?
下面引用的公开平台价格和发件规则按2026年10月4日核对,仅作为建模示例。价格与平台政策都可能变化,正式采购时必须换成自己的真实报价与适用规则。
先把8层成本列全
每一层都写三个数字:固定月费、随用量变化的费用、失败时由谁负责。
| 成本层 | 真正在付什么钱 | 为什么存在 |
|---|---|---|
| 模型推理 | 读上下文、分类、推理、起草 | 生成或判断内容 |
| 联系人与数据 | CRM、补全、去重、来源和同意记录 | 防止智能体拿错身份做事 |
| 发信基础设施 | 邮箱/ESP、域名、认证、信誉监控 | 让邮件稳定进入收件系统 |
| 工作流编排 | 触发、队列、重试、日志、集成 | 把一次模型调用变成可运营流程 |
| 人工审核 | 审批、抽检、高风险回复、升级处理 | 拦住自动化不该承担的错误 |
| 送达率运营 | 退信、投诉、抑制名单、信誉监控 | 保护未来所有邮件的到达能力 |
| 合规与治理 | 退订、记录、权限、政策 | 避免增长变成监管和信任债务 |
| CRM与营收运营 | 线索分配、归属、去重、归因 | 把邮件动作接回真实商业结果 |
如果一个报价只覆盖第一行,它并没有给你报“邮件智能体系统”的完整价格。
单是模型费,选择不同就可能差几十倍
公开API价格至少说明一件事:所谓“AI成本”不是一个固定数字。
截至2026年10月4日,OpenAI公开模型页显示,GPT-6 Luna文本价格为每100万输入token 0.10美元、输出0.50美元;GPT-5.6 Sol则为输入4美元、输出20美元。这只是一个供应商的两个公开例子,不代表推荐,也不是永久价格。
差异非常大。
如果工作流让小模型做回复分类、标签判断,让更强模型只处理复杂起草,并且能缓存重复上下文,模型费可能只是很小一项。反过来,如果每一封邮件都把巨大的客户历史塞进高价模型,又让它反复生成多个长版本,token成本也会迅速扩大。
但即使如此,采购时也不该只问“哪个模型最便宜”。
更值得问:
哪些步骤真的需要高成本推理?哪些可以用规则、小模型、缓存或批处理?
假设一个月做1万次邮件决策,每次用几千token。在很多配置里,模型成本依旧可能低于一个人工运营岗位、一个数据补全服务、一套发信系统,或者因为域名信誉下降而损失的业务机会。
送达率不是技术脚注,而是经济变量
邮件智能体如果让发送量增加,却把域名信誉做坏,账面“自动化效率”越高,实际可能亏得越快。
Google当前发件指南要求,向个人Gmail账户发送邮件的发件方至少配置SPF或DKIM、有效的正反向DNS并使用TLS,同时让Postmaster Tools里的垃圾邮件率低于0.3%。每天向Gmail发送超过5000封的发件方,还要满足SPF、DKIM、DMARC、直接邮件的域对齐等要求,营销或订阅邮件要支持一键退订。
Yahoo Sender Hub当前规则同样要求认证并把投诉率控制在0.3%以下;批量发件方需要SPF、DKIM和DMARC,并提供容易找到的退订方式,Yahoo还要求在两天内处理退订。
这意味着“多发一万封”的边际成本绝不只是API费。
量越大,越需要:
- 抑制名单;
- 退信处理;
- 投诉监控;
- 域名与身份治理;
- 退订同步;
- 内容和名单质量控制。
如果智能体把邮件发给明显不愿意接收的人,眼前的单封成本也许只有几分钱甚至更低,但后面的代价会通过送达率下降影响未来每一场活动。
所以仪表盘上应该把投诉率、退信、退订处理和域名信誉放在预约数、回复数旁边一起看。
人工审核是最容易被漏掉的一行
自动化真正便宜的时候,是任务足够可预测的时候。
一套成熟系统不应该让所有邮件走同一种审批方式,可以按风险分三层。
第一层:确定性自动化。
例如识别回复类别、更新CRM状态、执行退订、从批准过的事实片段里取内容。这些动作规则清楚,可以自动执行并保留日志。
第二层:抽样审核。
大量常规内容在政策允许时可以自动发送,但固定比例进入质量抽检。抽检不应该只看语法,而要看事实错误、错个性化、语气、错误对象和规则违规。
第三层:强制人工批准。
特殊报价、法律表述、敏感投诉、合同内容、高价值高管触达、使用来源不确定的数据,都应该停下来等人。
这三层直接影响利润。
所有邮件都让人工逐字审批,自动化节省的时间很快被审核吃掉;反过来,把所有边缘情况都交给模型,则可能用少量省下来的人工换来一次昂贵错误。
真正好的经济模型,是让系统按风险分流。
数据错了,越“个性化”越贵
邮件智能体只能使用它拿到的数据。
CRM里如果有重复公司、过期职位、来源不清的字段、错误的客户归属、被复制到多个账户的旧备注,模型不会自动把数据库变干净。它更可能把错误包装成一段读起来非常自然的邮件。
因此预算里还应该包括:
- 身份匹配和重复规则;
- 每个重要字段从哪里来的;
- 补全数据的更新时间;
- 退订/不联系状态;
- 客户归属;
- 一处纠正后如何同步到其他系统。
这也是为什么“每小时生成多少封”并不是好效率指标。
一个速度慢一点但上下文干净的智能体,可能比一个每分钟大量生成、却制造审核和投诉工作量的系统更便宜。
合规要放进流程,而不是最后粘一个页脚
美国FTC的CAN-SPAM商业邮件规则包括准确的头部信息、不能使用欺骗性主题、提供有效实体邮寄地址和退订机制等要求,而且企业可能对其委托的第三方发送行为承担责任。
所以合规不应该变成“邮件写完之后自动补一句退订说明”。
工作流一开始就应该知道:
- 这是什么类型的信息;
- 哪个发件身份被允许使用;
- 哪些收件人已经被抑制;
- 哪些营销表述经过批准;
- 哪些回复或退订必须永久修改状态。
跨国发送时还要更加谨慎。美国规则并不等于全球通行证,不同司法辖区对商业邮件、同意、个人数据和营销都有不同要求。真正做全球业务时,应按收件人和业务场景映射适用规则。
用“结果成本”而不是“发送成本”算ROI
一个更实用的月度公式是:
总运营成本
= 模型 + 数据 + 发信 + 编排 + 人工 + 送达率运营 + 合规 + 集成
每个合格结果成本
= 总运营成本 ÷ 合格回复、预约、商机或保留客户
增量贡献
= 真正由项目增加的结果贡献 − 本来就会自然发生的贡献
回本情况
= 增量贡献 ÷ 总运营成本
这样会强迫团队把“动作量”和“商业价值”拆开。
例如系统发了2万封、约到100个会议,表面很漂亮。但如果其中60个是重复线索、不符合条件、销售根本接不了,或者本来就会预约的客户,经济结果完全不同。若同时投诉上升,让重要域名后续更难进入收件箱,结果还会再次改变。
采购时要求供应商写清楚这5个数字
- 在你的真实发送量下,每月全部平台与使用成本。 包括模型、数据、发信和集成,不接受只报“AI调用费”。
- 多少比例需要人工审核。 因为人工时间就是成本。
- 退订、退信和投诉怎么跨系统同步。 因为信誉问题会产生未来成本。
- 数据补全错误、CRM重复时系统怎么处理。 因为脏数据会直接变成运营费用。
- 商业结果怎么归因和去重。 因为邮件生成数量从来不是ROI。
然后再补一个只有你自己能提供的数字:
每一个合格结果到底值多少贡献。
这一行,才会把“很酷的AI演示”变成真正可以批准或否决的财务决策。
最后判断
最便宜的邮件智能体,不是token单价最低的那个。
它应该是:
- 有用结果最多;
- 人工返工最少;
- 域名信誉损耗最低;
- 数据治理最干净;
- 总运营成本最低。
模型价格当然重要,规模大时尤其重要。但很多企业真正昂贵的错误都发生在模型之外:发错人、退订没同步、CRM被写乱、所有邮件都要人工重写,或者把“发送量”误当成“营收贡献”。
先把整条工作流定价,再判断自动化到底值不值得。
Sources
- Google,Gmail Email sender guidelines(访问于2026-10-04)— https://support.google.com/mail/answer/81126?hl=en
- Yahoo Sender Hub,Sender Best Practices(访问于2026-10-04)— https://senders.yahooinc.com/best-practices/
- U.S. Federal Trade Commission,CAN-SPAM Act: A Compliance Guide for Business — https://www.ftc.gov/business-guidance/resources/can-spam-act-compliance-guide-business
- OpenAI,GPT-6 Luna公开模型价格(访问于2026-10-04)— https://developers.openai.com/api/docs/models/gpt-6-luna
- OpenAI,GPT-5.6 Sol公开模型价格(访问于2026-10-04)— https://developers.openai.com/api/docs/models/gpt-5.6-sol