第一个危险信号,并不是模型“准确率不高”,而是团队里没有人能解释:为什么这条线索恰好是82分。
这是一个综合案例。某B2B团队销售高考虑度服务,营销部门搭了一套很常见的评分卡:职位加分、公司规模加分、邮件点击加分、价格页访问更多加分、提交Demo表单加最多。70分以上自动交给销售。
CRM里看起来非常规范。结果第一批10条“热线索”,销售直接拒绝了4条。
一条是做课题的学生;一条来自竞争对手;一条位于公司根本不服务的国家;还有一条确实来自目标公司,但联系人只是帮内部项目搜资料的初级员工,没有采购角色。
评分公式并没有算错。错的是运营设计。
这个案例最值得保留的结论有点反常识:在问“这个人有多感兴趣”之前,系统首先应该回答“这是不是一条值得进入销售流程的线索”。
HubSpot当前的评分工具明确区分fit与engagement等概念;行业实践也反复强调,行为数据必须和人口属性、公司匹配度以及可靠的CRM数据结合。2026年8月MarTech还报道了一个更广泛的问题:越来越多营销团队把决策交给AI,但CRM数据准备度并没有同步提升。更复杂的模型会更快地放大坏数据,并不会自动把坏数据修好。
团队最终按下面这份清单重建评分系统。
检查1:先定义业务决策,再定义分数
旧模型想用一个数字同时做四件事:
- 判断记录有没有资格进入销售;
- 给销售确定优先级;
- 决定应该路由给哪个团队;
- 判断买家现在是不是准备购买。
这其实是四个不同的问题。
新设计拆成三层:
- 资格闸门:这条记录是否应该进入销售考虑范围?
- 匹配度评分:人和公司是否像我们真正能服务好的客户?
- 意向评分:近期行为是否显示正在发生真实采购研究?
至于路由,单独处理,不和优先级混成一件事。
一个总分看起来更“聪明”,三层结构看起来更笨,但后者更容易解释和审计。
为什么资格问题应该做成闸门
有些情况不应该只是“-5分”,而应该是硬规则。
例如:
- 不服务的地区;
- 竞争对手或供应商;
- 求职者;
- 内部员工;
- 测试数据;
- 已有客户误进拉新漏斗;
- 明显无效联系方式。
如果“不服务地区”只扣20分,而反复访问页面能加50分,那么一个本来不能成交的人迟早会被堆成热线索。这不是权重调得不漂亮,而是把资格问题错误地当成了加减分问题。
检查2:把匹配度和活跃度拆开
旧模型最大的问题,是强烈行为可以压过糟糕匹配度。
举一个纯示例:
| 信号 | 旧模型分值 |
|---|---|
| 邮件点击两次 | +10 |
| 参加线上活动 | +15 |
| 访问价格页 | +20 |
| 下载三份资料 | +15 |
| 提交Demo | +30 |
| 公司画像偏离目标 | -8 |
| 总分 | 82 |
销售只看到“82”,看不到其中绝大部分来自行为。
新CRM改成分开显示:
- Fit:31/100
- Intent:88/100
- Eligibility:PASS
- Routing confidence:MEDIUM
- 原因:近期行为很强,但公司匹配度偏弱
这条线索也许值得人工看一眼,但绝不能和“Fit 90、Intent 80”的客户包装成同一种“80多分线索”。
HubSpot当前官方文档支持把fit和engagement作为不同评分维度。具体字段、自动化能力和产品套餐会变化,所以这里讲的是设计逻辑,不是给某个平台写固定配置。
检查3:每一个高权重信号都必须留下“为什么”
团队原来给价格页访问+20分,因为“看价格的人意向强”。
有时候确实如此。
但价格页也会被竞争对手、求职者、行业研究者、老客户和早期调研者访问。真正危险的是:一个权重比当初支持它的证据活得更久。
团队建立了规则清单:
| 信号 | 权重 | 想表达什么 | 最近验证证据 | 负责人 | 复核频率 |
|---|---|---|---|---|---|
| Demo申请 | +30意向 | 明确希望沟通 | CRM结果抽样 | RevOps | 每月 |
| 价格页访问 | +12意向 | 商业研究 | 接受机会抽样 | Demand Gen | 每月 |
| 目标行业 | +20匹配 | ICP一致 | 赢单/输单复盘 | Sales Ops | 每季度 |
| 不服务地区 | 硬排除 | 无法服务 | 服务区域表 | Ops | 区域变更时 |
| 30天无活动 | 衰减 | 意向变旧 | 销售周期复核 | Marketing Ops | 每季度 |
任何规则都不能只因为“以前一直这么配”而永久存在。
检查4:让“时间”成为显性变量
旧模型只会累积分数,不会遗忘。
九个月前下载过资料的人还带着当时的分;上周看价格页和去年看价格页,几乎没有区别。
重构后加入衰减。
常见做法包括:
- 超过一定无活动时间后扣分;
- 单次行为分到期;
- 只按滚动时间窗口重算意向;
- 生命周期变成closed/lost后重置近期意向;
- 把“历史参与度”单独保留,不再和“当前意向”混在一起。
没有一个适用于所有公司的30天、60天、90天答案。企业采购周期不同,衰减速度当然不同。
真正需要固定的规则只有一句:最近的购买信号和历史兴趣不是同一个变量。
检查5:把数据采集质量算进评分质量
旧模型规定每次邮件点击+5分。
后来RevOps发现,一些“高度参与”的联系人会在几秒内连续点击多个链接。这可能是安全扫描或自动链接检查,不一定是真人行为。重复联系人也会把行为拆散或放大。
所以,在调权重之前,先查:
- 重复联系人;
- 机器人/扫描器点击;
- 导入的历史行为;
- 表单事件重复触发;
- 多人共用邮箱;
- 公司补全数据的时间戳;
- 已经陈旧的公司规模或职位;
- 职位名称标准化是否可靠。
这也是AI评分最容易被高估的地方。如果训练数据本身噪声很大,模型完全可能学会“统计上有用、业务上无意义”的相关性。正确做法不是让模型更自信,而是改善数据,并把原因码保留下来。
检查6:在自动化之前,先搭好销售拒绝反馈
旧流程只有一个拒绝选项:Bad lead。
这几乎没有学习价值。
新流程要求必须选结构化原因:
- 地区不对;
- 公司类型不对;
- 联系人角色不对;
- 竞争对手/供应商;
- 学生/研究;
- 已有客户;
- 重复数据;
- 当前意向不足;
- 公司对,但分配人不对;
- 有效线索,但时机不对;
- 其他——必须写备注。
这样模型才有反馈闭环。
如果“地区不对”越来越多,应该修资格规则;如果“角色不对”占比高,就要修联系人fit;如果大量是“还没准备好”,就要复核意向门槛或转入培育,而不是抱怨销售“不配合营销”。
把销售结果全部丢成自由文本,评分系统就永远学不到真正的问题。
检查7:用结果看分段,而不是看分数长得漂不漂亮
四周后,团队按优先级分组。
以下仍然只是示例,不是行业基准:
| 优先级 | 记录数 | 销售接受 | 商机 | 赢单 |
|---|---|---|---|---|
| 低 | 900 | 21 | 5 | 1 |
| 中 | 380 | 72 | 20 | 4 |
| 高 | 160 | 96 | 45 | 13 |
| 很高 | 65 | 48 | 31 | 11 |
真正要问的是:
- 优先级越高,销售接受率是不是总体更高?
- 高分段每条记录产生的商机是不是更多?
- 有没有某些行业/区域分段完全不符合这个关系?
- 低分里出现的赢单,是否暴露了模型缺失的重要信号?
- 最高分段是不是大到销售根本消化不了,或小到没有运营意义?
分布图看起来很顺滑,没有任何商业价值;排序能不能帮助团队把时间用在更可能产生结果的记录上,才有价值。
检查8:规则评分和预测评分要公平比较
团队开始讨论:要不要彻底换成AI评分。
可以,但不能把“规则=落后,AI=先进”当成结论。
规则评分的优势:
- 容易解释;
- 改起来快;
- 小数据也能运行;
- 原因明确;
- 资格规则很多时尤其合适。
预测模型可能擅长:
- 非线性关系;
- 更大的特征集合;
- 文本与行为数据;
- 在基础设施允许时持续重估。
但预测模型需要足够多、足够有代表性的结果标签,也需要监控漂移。一些厂商自己的预测评分就有最低数据要求;2026年的销售线索排序研究也继续把稀疏标签、多阶段漏斗、线上线下指标错位和时间漂移当成核心问题。
所以团队先跑shadow mode:预测分数在后台排序,但销售仍然可以看到原有规则、fit、intent和拒绝原因。只有当模型在真实“销售接受、商机和赢单”上持续表现更好,才考虑让它改变路由。
检查9:把“为什么”直接显示在分数旁边
销售真正开始信任系统,是在CRM不再只显示“82”之后。
新卡片变成:
Priority:High
为什么:
- 目标行业;
- 公司规模在目标区间;
- 七天内两次看价格页;
- 提交Demo;
- 联系人为高级运营岗位。
风险:
- 公司补全数据距今110天;
- 本周之前没有产品相关行为。
这样,分数变成“解释”,而不是“神谕”。
当系统错的时候,销售可以指出某个原因错了。一个没有原因的82分,几乎没法被有效纠正。
检查10:一次只重建一个假设
上线失败后,团队第一反应是同时改掉所有权重。
最终没有这么做。
Week 1:加入硬资格闸门。
Week 2:拆分fit与intent。
Week 3:加入衰减。
Week 4:统一销售拒绝原因。
Week 5以后:再根据结果调整权重。
这样才能知道是哪一次改变真正带来了改善。如果一次改十条规则,后面再好的报表也无法解释因果。
最终改变结果的并不是“更聪明的模型”
最有效的变化,其实是改变了“被评分的对象”。
旧系统把所有活跃记录先假设成潜在买家,再想办法用一个数字压缩所有判断。新系统先做资格检查,然后拆开匹配与意向,保留时间衰减,记录结构化销售反馈,并且公开评分原因。
那条82分线索仍然有价值。
只是系统不再允许“82分”掩盖一个更关键的事实:它可能只是一个82分的非买家。
把这个区别做对,才是销售真正愿意相信评分系统的起点。
Sources
- HubSpot Knowledge Base — Understand the lead scoring tool(updated September 2, 2026): https://knowledge.hubspot.com/scoring/understand-the-lead-scoring-tool
- HubSpot Knowledge Base — Build lead scores: https://knowledge.hubspot.com/scoring/build-lead-scores
- Salesforce Help — Einstein Lead Scoring setup and considerations: https://help.salesforce.com/s/articleView?id=sf.einstein_sales_setup_enable_lead_insights.htm
- MarTech — How to revamp your lead scoring strategy for 2025: https://martech.org/how-to-revamp-your-lead-scoring-strategy-for-2025/
- MarTech — Marketers know AI is using bad data to make decisions(August 28, 2026): https://martech.org/marketers-know-ai-is-using-bad-data-to-make-decisions/
- arXiv — Rethinking Sales Lead Scoring with LLM-based Hierarchical Preference Ranking(2026): https://arxiv.org/abs/2606.04387