最容易把线索评分买贵的方法,是从供应商Demo开始。

Demo十分钟就能展示一个漂亮分数、一张排序名单和一段“AI解释”,但它回答不了:你的CRM数据够不够稳定、销售是否同意“好线索”的定义、这个分数到底会改变什么分单动作,以及模型漂移以后谁会发现。

所以采购应该从另一个问题开始:

这个分数,被允许替团队做什么决定?

Forrester更新后的个人兴趣评分资料强调一个很重要的边界:评分可以帮助团队决定谁更值得优先人工跟进,但评分本身并不等于销售机会已经被资格确认。HubSpot当前评分功能也会把匹配度、互动、阈值、衰减和上线前测试拆开。能力都很有用,但必须先知道它服务哪一个运营决定。

下面用决策树来买,而不是用功能清单来买。

分支一:你真的需要“评分”,还是只是分单规则有问题?

先看痛点。

如果问题是“销售总收到不该归自己的账户”

这很可能是路由数据问题,不是评分问题。

先检查:

  • 销售区域和账户归属;
  • 母子公司关系;
  • 公司规模;
  • 国家/地区;
  • 现有客户状态;
  • 指定账户排除;
  • 产品资格;
  • 触达限制;
  • 重复记录。

一个再聪明的互动分,也救不了“错误地区客户被分给错误团队”这种基础错误。

先让核心分单字段可靠,再决定是否买评分。

如果问题是“看起来都像线索,但销售时间不够”

这才是评分真正有价值的场景:排序。

先定义稀缺资源到底是什么:SDR电话、AE研究时间、合作伙伴跟进名额,还是人工审核表单。

评分应该帮助分配这个稀缺资源,而不是在CRM里增加一个没人用的数字。

分支二:你要判断的是匹配度、意向,还是两者一起?

这是最重要的一叉。

匹配度:这个公司或人,本来就值得我们关注吗?

常见输入:

  • 公司规模;
  • 行业;
  • 地区;
  • 技术环境;
  • 使用场景;
  • 职位/资历;
  • 客户、合作伙伴等身份。

匹配度变化比较慢,但仍会因为企业数据陈旧、ICP变化而失真。

意向/互动:这个人现在是否表现出值得关注的动作?

可能包括:

  • 高意向表单;
  • Demo请求;
  • 价格页访问;
  • 多次产品页访问;
  • 活动参与;
  • 邮件互动;
  • 试用激活;
  • 产品使用。

HubSpot当前支持事件条件和分数衰减,这能把“半年前做过一次动作”和“最近持续互动”区分开。

两者一起:现在是否值得投入人工时间?

实际业务经常需要组合,但不要过早把两个维度压成一个数字。

低匹配、高互动的人,可能是学生、竞争对手、求职者或者商业上并不合适;高匹配、零互动的战略账户,也可能值得主动开发,但那不是因为“入站分数很高”。

**采购要求:**即使系统给综合总分,也最好能单独看到fit和engagement。

分支三:销售能不能解释“为什么这个人突然升分”?

如果不能,黑箱风险就开始出现。

销售经理应该能回答:

  • 为什么超过阈值?
  • 哪个动作贡献最大?
  • 哪些负信号扣了分?
  • 是联系人行为还是公司层变化?
  • 旧行为有没有衰减?
  • 是不是数据补全改变了匹配度?
  • 销售能否提出异议?

黑箱模型可能统计上有用,但只要输出会改变账户归属、响应SLA或昂贵人工工作,可解释性就不是锦上添花。

**采购测试:**让供应商打开一条样本记录,从原始信号一路解释到最终分数。如果答案只是“我们的AI会判断”,继续追问。

分支四:规则型、预测型,还是混合型?

规则型

团队明确写分值或条件。

适合:团队早期、历史样本有限、销售营销需要透明、买家路径比较清楚,或者治理比微小排序提升更重要。

缺点也明显:每个部门都想给自己的信号加分;旧规则只加不删;复杂信号之间的关系容易遗漏。

预测型

模型从历史结果里寻找关系。

适合:

  • 历史数据量足;
  • 结果标签可信;
  • 业务流程没有刚刚大改到让旧数据失效;
  • 有监控和重新校准计划。

Salesforce的Einstein Lead Scoring资料就是很好的提醒:预测评分依赖历史CRM数据和合适的数据条件。具体门槛因平台而异,但采购原则一样——没有可信历史结果,就没有可靠预测质量。

混合型

用硬规则做商业约束,再在合格池里用模型排序。

例如:

  1. 排除不服务地区;
  2. 把现有客户移出净新开发队列;
  3. 保留最低匹配要求;
  4. 再用互动/预测模型排序;
  5. 异常进入人工复核。

这往往比争论“规则好还是AI好”更实用。

分支五:旧行为怎么办?

一个人九个月前下载过一次资料,不应该永远保持同样的紧迫度。

采购时问清:

  • 是否支持时间衰减;
  • 滚动窗口;
  • 行为过期;
  • 负分;
  • 长期不活跃扣分;
  • 资格确认或否决后的重置。

HubSpot在事件组里提供分数衰减。具体功能是平台自己的,但采购问题是通用的:

时间能不能被明确建模,还是数据库里的意向会永生?

没有衰减策略的评分,常见情况是第一个月很好用,半年后越来越吵。

分支六:谁拥有“阈值”?

分数是连续的,但分单不是。

58分可能继续培育,60分就创建SDR任务。这两分差异会直接制造人工工作,所以阈值必须有负责人。

采购前写清:

  • 谁提出改阈值;
  • 哪种结果支持修改;
  • 不同细分市场是否用不同阈值;
  • 多久复核一次;
  • 销售能不能覆盖;
  • 临界分怎么办。

HubSpot允许设置评分阈值并测试分数分布。这很重要,因为团队可以先估算“多少记录会跨线”,再打开自动化。

**采购测试:**要求供应商演示“模拟改阈值,但不触发生产流程”。

分支七:能不能先影子运行,再控制真实人员?

第一次跑模型,绝对不要直接连到自动分单、外呼序列或管理层报表。

更安全的三阶段是:

第一阶段:影子模式

计算分数,但不改变分单。

抽取高、中、低分样本,与销售判断和真实结果比较。

第二阶段:辅助模式

给销售看分数和原因,让它影响优先级,但硬路由规则不变。

记录销售不认同的案例。这些分歧通常比一个平均“准确率”更有价值。

第三阶段:受控自动化

只把已经通过验收的组合自动化。

例如“高分 + 地区合格 + 无指定账户冲突”可以创建SDR任务,但没必要直接宣布成“已资格确认的销售机会”。

分支八:买完以后到底验收什么?

如果成功标准只有“系统上线”,先别买。

至少看:

结果 为什么要看
高优先线索响应时间 评分有没有改变动作
不同分数段转化 排序有没有区分度
假阳性复核率 噪音花多少销售时间
低分里漏掉的重要结果 看假阴性
销售覆盖/改分率 看信任和边界案例
有分记录覆盖率 数据库多少真的可用
数据新鲜度 防止输入老化
每单位销售时间产生的pipeline 回到经济价值

不要只优化“MQL转化率”。如果模型只是把池子砍得特别小,转化率可能更漂亮,但总有效pipeline反而下降。

分支九:你真的需要再买一个平台吗?

评分能力现在可能出现在CRM、营销自动化、销售互动平台、数据供应商和专业AI产品中。G2当前Lead Scoring分类里有大量产品,各大平台也持续把评分塞进更完整的工作流。

所以采购问题变成:

你可能不需要多买一套系统,而是需要:

  • 把CRM里已经付费的评分用好;
  • 先清理数据;
  • 换一个更简单的路由引擎;
  • 增加独立意向数据;
  • 或者只增加一个能把透明结果写回CRM的模型层。

先弄清楚缺的是哪一层,再决定要不要多一个平台。

十个统一问供应商的问题

所有候选都问同一套:

  1. 匹配度和互动能不能分开看?
  2. 哪些数据是原生、导入、外部补全或推断?
  3. 负信号和时间衰减怎么处理?
  4. 能不能把某些字段或记录排除出模型训练?
  5. 用户能不能看到为什么升分/降分?
  6. 阈值上线前能不能模拟?
  7. 公司级和个人级信号怎么组合?
  8. 原始贡献信号和分数历史能否导出?
  9. 字段缺失或冲突时系统怎么做?
  10. 漂移怎么监控、多久校准、如何回滚?

好的答案应该包含“做不到什么”,而不是只讲能力。

不要只看AI故事,要求演示真实脏数据

一个有价值的采购Demo,应该有一条不好看的记录。

可以给候选供应商一个样本:

  • 公司规模缺失;
  • 联系人刚换职位;
  • 已存在客户标记;
  • 网站互动很强;
  • 所在地区暂不服务;
  • 有一个很旧、应该衰减的行为。

然后看系统怎么处理。

它会显示缺失吗?会服从商业资格限制吗?能解释旧行为吗?能把“很感兴趣”与“能成交的账户”分开吗?能看分数历史吗?

这个测试比预设好的演示数据有价值得多。

采购以前就写退出规则

可以这样写:

“只有高分组能够持续集中更多我们定义的业务结果,同时没有制造不可接受的假阳性人工成本,也没有把战略重要账户大量压在低分区,我们才扩大评分使用范围。”

它没有要求“95%准确率”这种魔法数字,也没有默认供应商阈值,更没有授权模型自动确认机会。

它只问:

排序有没有改善一个真实的资源分配决定?

哪些理由不应该成为购买理由

不要因为这些就买:

  • 市场团队想换一个新的MQL数字;
  • CRM演示看上去很聪明;
  • “AI评分”听起来比规则高级;
  • 某家同行在用;
  • 数据很乱,希望模型顺便清洗;
  • 销售不看现在的分数,于是想换一个更花哨的。

这些是症状,不是采购需求。

一页决策树

线索总分错负责人? 先修路由和基础数据。

潜在客户太多,人手不够? 评分可能有价值。

需要透明运营规则? 先规则型或混合型。

有可靠历史、稳定结果? 再评估预测型。

行为会过期? 必须有衰减和历史。

阈值会制造人工工作? 必须可模拟、有治理。

模型准备控制自动化? 先影子模式、再辅助模式。

说不清要改善什么业务结果? 暂时别买。

Forrester最值得保留的边界是:评分帮助分配注意力,真正的资格确认仍需要人和业务流程判断。

最好的评分系统不是“分数最聪明”的系统,而是输入、时间、阈值、异常和负责人足够清楚,销售团队可以利用它,却不用把判断权整个交出去。

资料来源

相关阅读