第一个危险信号,并不是模型“准确率不高”,而是团队里没有人能解释:为什么这条线索恰好是82分。

这是一个综合案例。某B2B团队销售高考虑度服务,营销部门搭了一套很常见的评分卡:职位加分、公司规模加分、邮件点击加分、价格页访问更多加分、提交Demo表单加最多。70分以上自动交给销售。

CRM里看起来非常规范。结果第一批10条“热线索”,销售直接拒绝了4条。

一条是做课题的学生;一条来自竞争对手;一条位于公司根本不服务的国家;还有一条确实来自目标公司,但联系人只是帮内部项目搜资料的初级员工,没有采购角色。

评分公式并没有算错。错的是运营设计。

这个案例最值得保留的结论有点反常识:在问“这个人有多感兴趣”之前,系统首先应该回答“这是不是一条值得进入销售流程的线索”。

HubSpot当前的评分工具明确区分fit与engagement等概念;行业实践也反复强调,行为数据必须和人口属性、公司匹配度以及可靠的CRM数据结合。2026年8月MarTech还报道了一个更广泛的问题:越来越多营销团队把决策交给AI,但CRM数据准备度并没有同步提升。更复杂的模型会更快地放大坏数据,并不会自动把坏数据修好。

团队最终按下面这份清单重建评分系统。

检查1:先定义业务决策,再定义分数

旧模型想用一个数字同时做四件事:

  • 判断记录有没有资格进入销售;
  • 给销售确定优先级;
  • 决定应该路由给哪个团队;
  • 判断买家现在是不是准备购买。

这其实是四个不同的问题。

新设计拆成三层:

  1. 资格闸门:这条记录是否应该进入销售考虑范围?
  2. 匹配度评分:人和公司是否像我们真正能服务好的客户?
  3. 意向评分:近期行为是否显示正在发生真实采购研究?

至于路由,单独处理,不和优先级混成一件事。

一个总分看起来更“聪明”,三层结构看起来更笨,但后者更容易解释和审计。

为什么资格问题应该做成闸门

有些情况不应该只是“-5分”,而应该是硬规则。

例如:

  • 不服务的地区;
  • 竞争对手或供应商;
  • 求职者;
  • 内部员工;
  • 测试数据;
  • 已有客户误进拉新漏斗;
  • 明显无效联系方式。

如果“不服务地区”只扣20分,而反复访问页面能加50分,那么一个本来不能成交的人迟早会被堆成热线索。这不是权重调得不漂亮,而是把资格问题错误地当成了加减分问题。

检查2:把匹配度和活跃度拆开

旧模型最大的问题,是强烈行为可以压过糟糕匹配度。

举一个纯示例:

信号 旧模型分值
邮件点击两次 +10
参加线上活动 +15
访问价格页 +20
下载三份资料 +15
提交Demo +30
公司画像偏离目标 -8
总分 82

销售只看到“82”,看不到其中绝大部分来自行为。

新CRM改成分开显示:

  • Fit:31/100
  • Intent:88/100
  • Eligibility:PASS
  • Routing confidence:MEDIUM
  • 原因:近期行为很强,但公司匹配度偏弱

这条线索也许值得人工看一眼,但绝不能和“Fit 90、Intent 80”的客户包装成同一种“80多分线索”。

HubSpot当前官方文档支持把fit和engagement作为不同评分维度。具体字段、自动化能力和产品套餐会变化,所以这里讲的是设计逻辑,不是给某个平台写固定配置。

检查3:每一个高权重信号都必须留下“为什么”

团队原来给价格页访问+20分,因为“看价格的人意向强”。

有时候确实如此。

但价格页也会被竞争对手、求职者、行业研究者、老客户和早期调研者访问。真正危险的是:一个权重比当初支持它的证据活得更久。

团队建立了规则清单:

信号 权重 想表达什么 最近验证证据 负责人 复核频率
Demo申请 +30意向 明确希望沟通 CRM结果抽样 RevOps 每月
价格页访问 +12意向 商业研究 接受机会抽样 Demand Gen 每月
目标行业 +20匹配 ICP一致 赢单/输单复盘 Sales Ops 每季度
不服务地区 硬排除 无法服务 服务区域表 Ops 区域变更时
30天无活动 衰减 意向变旧 销售周期复核 Marketing Ops 每季度

任何规则都不能只因为“以前一直这么配”而永久存在。

检查4:让“时间”成为显性变量

旧模型只会累积分数,不会遗忘。

九个月前下载过资料的人还带着当时的分;上周看价格页和去年看价格页,几乎没有区别。

重构后加入衰减。

常见做法包括:

  • 超过一定无活动时间后扣分;
  • 单次行为分到期;
  • 只按滚动时间窗口重算意向;
  • 生命周期变成closed/lost后重置近期意向;
  • 把“历史参与度”单独保留,不再和“当前意向”混在一起。

没有一个适用于所有公司的30天、60天、90天答案。企业采购周期不同,衰减速度当然不同。

真正需要固定的规则只有一句:最近的购买信号和历史兴趣不是同一个变量。

检查5:把数据采集质量算进评分质量

旧模型规定每次邮件点击+5分。

后来RevOps发现,一些“高度参与”的联系人会在几秒内连续点击多个链接。这可能是安全扫描或自动链接检查,不一定是真人行为。重复联系人也会把行为拆散或放大。

所以,在调权重之前,先查:

  • 重复联系人;
  • 机器人/扫描器点击;
  • 导入的历史行为;
  • 表单事件重复触发;
  • 多人共用邮箱;
  • 公司补全数据的时间戳;
  • 已经陈旧的公司规模或职位;
  • 职位名称标准化是否可靠。

这也是AI评分最容易被高估的地方。如果训练数据本身噪声很大,模型完全可能学会“统计上有用、业务上无意义”的相关性。正确做法不是让模型更自信,而是改善数据,并把原因码保留下来。

检查6:在自动化之前,先搭好销售拒绝反馈

旧流程只有一个拒绝选项:Bad lead。

这几乎没有学习价值。

新流程要求必须选结构化原因:

  • 地区不对;
  • 公司类型不对;
  • 联系人角色不对;
  • 竞争对手/供应商;
  • 学生/研究;
  • 已有客户;
  • 重复数据;
  • 当前意向不足;
  • 公司对,但分配人不对;
  • 有效线索,但时机不对;
  • 其他——必须写备注。

这样模型才有反馈闭环。

如果“地区不对”越来越多,应该修资格规则;如果“角色不对”占比高,就要修联系人fit;如果大量是“还没准备好”,就要复核意向门槛或转入培育,而不是抱怨销售“不配合营销”。

把销售结果全部丢成自由文本,评分系统就永远学不到真正的问题。

检查7:用结果看分段,而不是看分数长得漂不漂亮

四周后,团队按优先级分组。

以下仍然只是示例,不是行业基准:

优先级 记录数 销售接受 商机 赢单
低 900 21 5 1
中 380 72 20 4
高 160 96 45 13
很高 65 48 31 11

真正要问的是:

  • 优先级越高,销售接受率是不是总体更高?
  • 高分段每条记录产生的商机是不是更多?
  • 有没有某些行业/区域分段完全不符合这个关系?
  • 低分里出现的赢单,是否暴露了模型缺失的重要信号?
  • 最高分段是不是大到销售根本消化不了,或小到没有运营意义?

分布图看起来很顺滑,没有任何商业价值;排序能不能帮助团队把时间用在更可能产生结果的记录上,才有价值。

检查8:规则评分和预测评分要公平比较

团队开始讨论:要不要彻底换成AI评分。

可以,但不能把“规则=落后,AI=先进”当成结论。

规则评分的优势:

  • 容易解释;
  • 改起来快;
  • 小数据也能运行;
  • 原因明确;
  • 资格规则很多时尤其合适。

预测模型可能擅长:

  • 非线性关系;
  • 更大的特征集合;
  • 文本与行为数据;
  • 在基础设施允许时持续重估。

但预测模型需要足够多、足够有代表性的结果标签,也需要监控漂移。一些厂商自己的预测评分就有最低数据要求;2026年的销售线索排序研究也继续把稀疏标签、多阶段漏斗、线上线下指标错位和时间漂移当成核心问题。

所以团队先跑shadow mode:预测分数在后台排序,但销售仍然可以看到原有规则、fit、intent和拒绝原因。只有当模型在真实“销售接受、商机和赢单”上持续表现更好,才考虑让它改变路由。

检查9:把“为什么”直接显示在分数旁边

销售真正开始信任系统,是在CRM不再只显示“82”之后。

新卡片变成:

Priority:High

为什么:

  • 目标行业;
  • 公司规模在目标区间;
  • 七天内两次看价格页;
  • 提交Demo;
  • 联系人为高级运营岗位。

风险:

  • 公司补全数据距今110天;
  • 本周之前没有产品相关行为。

这样,分数变成“解释”,而不是“神谕”。

当系统错的时候,销售可以指出某个原因错了。一个没有原因的82分,几乎没法被有效纠正。

检查10:一次只重建一个假设

上线失败后,团队第一反应是同时改掉所有权重。

最终没有这么做。

Week 1:加入硬资格闸门。

Week 2:拆分fit与intent。

Week 3:加入衰减。

Week 4:统一销售拒绝原因。

Week 5以后:再根据结果调整权重。

这样才能知道是哪一次改变真正带来了改善。如果一次改十条规则,后面再好的报表也无法解释因果。

最终改变结果的并不是“更聪明的模型”

最有效的变化,其实是改变了“被评分的对象”。

旧系统把所有活跃记录先假设成潜在买家,再想办法用一个数字压缩所有判断。新系统先做资格检查,然后拆开匹配与意向,保留时间衰减,记录结构化销售反馈,并且公开评分原因。

那条82分线索仍然有价值。

只是系统不再允许“82分”掩盖一个更关键的事实:它可能只是一个82分的非买家。

把这个区别做对,才是销售真正愿意相信评分系统的起点。

Sources

Related Reading