线索评分只有在它真正改变“谁先得到注意力”,并且这种注意力分配改善了后端结果时,才有价值。

因此,“本月平均分多少”通常不是Revenue团队真正要看的数字。更重要的问题是:高分线索是否真的更容易转化?销售愿不愿意接?跟进速度有没有变快?低分线索里是不是经常漏掉后来变成机会的人?市场、Offer或数据链路变化以后,模型还有效吗?

HubSpot在2026年8月、9月更新的Lead Scoring文档已经把score history、performance和distribution作为正式分析对象;Salesforce Einstein Lead Scoring的标准Dashboard也直接提供“按分数区间看转化率”和score distribution。产品层面的变化其实说明了一件事:不要把分数当CRM里的装饰字段,要把它当成排序与路由系统来验。

下面这些指标才值得进周会或月会。

1. 按分数区间看后端转化

不要先规定“70分以上就是Hot”,先把线索分桶。

比如:

分数 线索数 被接受/合格 真正转化 转化率
0–24 420 18 4 1.0%
25–49 310 39 10 3.2%
50–74 170 48 17 10.0%
75–100 100 52 21 21.0%

这些数字只是示例。

真正要看的是曲线形状:如果评分有用,高分组通常应该在后端结果上明显强于低分组。它不需要完美递增,但如果25–49分长期比75–100分转得更好,就应该查模型。

Salesforce把“Conversion Rate by Lead Score”直接放进标准Einstein Dashboard,本质上也是这个思路。

2. 优先组的提升度 Lift

销售不会去跟进一张分布图,他们跟进的是一批“先做这些”的名单。

所以要计算最高优先级线索相对全体基线到底强多少。

最简单的公式:

Top-bucket lift = 优先线索转化率 ÷ 全体转化率

如果整体转化5%,优先组15%,提升度就是3.0x。

这里的“转化”不一定非得是成交,也可以是销售接受、Qualified Opportunity、预约出席等真正符合你业务的节点。

Lift回答的是一句很现实的话:我们优先处理这些人,真的换来了更高产出吗?

如果提升度很弱,可以查:低质量行为权重是不是过高、Fit数据是不是过期、事件有没有重复、或者模型预测的目标已经和新销售流程不一致。

3. 销售接受率,以及明确的拒绝原因

一个评分模型可以在Marketing数据里看起来很漂亮,却在交接环节完全失效。

需要记录高分线索送给销售后,有多少真正进入主动跟进;更重要的是,把拒绝原因标准化:

  • 地区不符合;
  • 职级/权限不对;
  • 联系方式无效;
  • 学生、供应商、求职者;
  • 已有客户;
  • 重复线索;
  • 没有当前项目;
  • 预算不匹配;
  • 产品不匹配;
  • Spam/欺诈。

拒绝原因不是抱怨清单,而是模型下一轮学习数据。

Demand Gen Report在2026年3月11日对Energize Marketing报告的报道中提到,该调查覆盖300名全球高级B2B Marketing、Demand Gen和RevOps负责人,其中52%把qualified pipeline列为首要优先级,超过90%把pipeline、ABM或lead quality放在前三目标。它只是一个特定样本,不能当成所有行业定律,但很好地解释了为什么“多产MQL”已经越来越难单独证明价值。

4. 跨过阈值以后,到第一次真实动作花多久

模型识别对了人,却没人及时跟进,这个模型分析上正确、运营上仍然没用。

建议记录:

评分跨过路由阈值 → 第一次有意义的销售动作

什么叫“有意义”要提前定义:真实电话尝试、人工邮件、接受任务、进入某个有审计记录的销售动作。不要把“系统自动发了通知”算成跟进。

再按下面切开:

  • 分数段;
  • 地区;
  • Owner/团队;
  • 来源;
  • 工作时间/非工作时间。

如果最高分线索反而比中分线索等得更久,问题可能不是模型,而是销售容量和路由队列。

5. Score Distribution与Coverage

如果模型把70%的数据库都标成“高”,那其实没有优先级。如果只有15%的新线索能成功评分,又可能说明数据覆盖太差。

至少看:

  • eligible leads里有多少真正拿到分数;
  • 每个bucket占比;
  • 缺关键字段的比例;
  • 被排除规则挡掉的比例;
  • 没有近期行为数据的比例。

HubSpot当前就提供score distribution/performance;Salesforce也明确列出一些“为什么某条Lead没有分数”的数据和活动条件。

Coverage能把“模型静默失效”暴露出来。

6. 高分的“年龄”与衰减

Engagement不是永久资产。

一个人在六个月前连续看过三次价格页,今天未必还值得同样优先级;一家公司的地区、规模、技术栈或购买阶段变化后,旧Fit Score也可能已经过期。

可以看:

  • 构成高分的行为事件平均/中位年龄;
  • 高分线索中30/60/90天没有有效行为的比例;
  • decay规则每月降级多少线索;
  • 引入衰减前后各分数段真实转化的变化。

工具会不断重新计算分数,但业务必须自己决定:多老的数据还应该代表今天的紧迫度。

7. 按Segment看模型漂移

整体表现不错,不代表每个市场都有效。

把转化率和lift按这些维度切:

  • 来源;
  • 国家/地区;
  • 产品线;
  • 公司规模;
  • 新客户/已有账户;
  • inbound/outbound;
  • 语言;
  • 销售团队。

不需要为了分析而无限细分。真正有价值的是找到持续出现的业务差异。

最重要的问题从来不是“模型准确率是多少”,而是:

在哪些人群里,这个排序已经不再帮助销售做决定?

一页纸评分Dashboard

一个月度Lead Scoring复盘,完全可以只保留七项:

  1. 各分数段真实转化;
  2. 最高优先组Lift;
  3. 销售接受率+主要拒绝原因;
  4. 到第一次真实跟进的中位时间;
  5. Score Coverage与Distribution;
  6. 过期高分占比;
  7. 一个最重要的Segment Drift视图。

这七项如果都健康,你其实不必天天争论“打开邮件到底加3分还是5分”。

评分公式不是产品,更合理地分配销售注意力才是产品。

衡量的是“决策有没有变好”,不是分数看起来多漂亮

一套评分模型可以在统计上很整齐,却在业务上毫无用处。最常见的原因,是团队一直判断“这个分数看起来像不像正确答案”,却没有检查它究竟改变了哪个真实动作。

每一个阈值都应该写清楚触发什么:立即分给销售、进入培育、触发账户研究、抑制触达,还是其实什么都不做。然后为这个动作配一个结果指标和一个失败指标。比如高分阈值触发销售路由,就可以同时看销售接受率,以及“假紧急”——大量高分线索刚进入队列就被快速退回。

这样也能避免团队把“更多数量”误当成绩。如果某个阈值一调整,突然把两倍线索推给销售,并不代表系统变好了;也可能只是把瓶颈从营销端搬到了销售端。

用分群回看抓住“平均数看不见的退化”

月度平均值很容易遮住评分问题。可以按来源、细分市场、地区、产品线或企业规模等真正影响业务的维度,对最近一批线索分别回看。

如果“80分以上”整体转化不错,却在某一个获客来源上明显失真,更合理的动作可能是做来源规则或修数据,而不是全局改阈值。某个细分样本太少时,也应该明确写“证据不足”,而不是假装模型很精确。

真正该问的不是“评分准不准”,而是:“对哪类对象、在哪个阈值、对应哪个下游动作,这个分数有用到足以抵消它带来的运营成本?”

Sources

Related Reading