最容易把线索评分买贵的方法,是从供应商Demo开始。
Demo十分钟就能展示一个漂亮分数、一张排序名单和一段“AI解释”,但它回答不了:你的CRM数据够不够稳定、销售是否同意“好线索”的定义、这个分数到底会改变什么分单动作,以及模型漂移以后谁会发现。
所以采购应该从另一个问题开始:
这个分数,被允许替团队做什么决定?
Forrester更新后的个人兴趣评分资料强调一个很重要的边界:评分可以帮助团队决定谁更值得优先人工跟进,但评分本身并不等于销售机会已经被资格确认。HubSpot当前评分功能也会把匹配度、互动、阈值、衰减和上线前测试拆开。能力都很有用,但必须先知道它服务哪一个运营决定。
下面用决策树来买,而不是用功能清单来买。
分支一:你真的需要“评分”,还是只是分单规则有问题?
先看痛点。
如果问题是“销售总收到不该归自己的账户”
这很可能是路由数据问题,不是评分问题。
先检查:
- 销售区域和账户归属;
- 母子公司关系;
- 公司规模;
- 国家/地区;
- 现有客户状态;
- 指定账户排除;
- 产品资格;
- 触达限制;
- 重复记录。
一个再聪明的互动分,也救不了“错误地区客户被分给错误团队”这种基础错误。
先让核心分单字段可靠,再决定是否买评分。
如果问题是“看起来都像线索,但销售时间不够”
这才是评分真正有价值的场景:排序。
先定义稀缺资源到底是什么:SDR电话、AE研究时间、合作伙伴跟进名额,还是人工审核表单。
评分应该帮助分配这个稀缺资源,而不是在CRM里增加一个没人用的数字。
分支二:你要判断的是匹配度、意向,还是两者一起?
这是最重要的一叉。
匹配度:这个公司或人,本来就值得我们关注吗?
常见输入:
- 公司规模;
- 行业;
- 地区;
- 技术环境;
- 使用场景;
- 职位/资历;
- 客户、合作伙伴等身份。
匹配度变化比较慢,但仍会因为企业数据陈旧、ICP变化而失真。
意向/互动:这个人现在是否表现出值得关注的动作?
可能包括:
- 高意向表单;
- Demo请求;
- 价格页访问;
- 多次产品页访问;
- 活动参与;
- 邮件互动;
- 试用激活;
- 产品使用。
HubSpot当前支持事件条件和分数衰减,这能把“半年前做过一次动作”和“最近持续互动”区分开。
两者一起:现在是否值得投入人工时间?
实际业务经常需要组合,但不要过早把两个维度压成一个数字。
低匹配、高互动的人,可能是学生、竞争对手、求职者或者商业上并不合适;高匹配、零互动的战略账户,也可能值得主动开发,但那不是因为“入站分数很高”。
**采购要求:**即使系统给综合总分,也最好能单独看到fit和engagement。
分支三:销售能不能解释“为什么这个人突然升分”?
如果不能,黑箱风险就开始出现。
销售经理应该能回答:
- 为什么超过阈值?
- 哪个动作贡献最大?
- 哪些负信号扣了分?
- 是联系人行为还是公司层变化?
- 旧行为有没有衰减?
- 是不是数据补全改变了匹配度?
- 销售能否提出异议?
黑箱模型可能统计上有用,但只要输出会改变账户归属、响应SLA或昂贵人工工作,可解释性就不是锦上添花。
**采购测试:**让供应商打开一条样本记录,从原始信号一路解释到最终分数。如果答案只是“我们的AI会判断”,继续追问。
分支四:规则型、预测型,还是混合型?
规则型
团队明确写分值或条件。
适合:团队早期、历史样本有限、销售营销需要透明、买家路径比较清楚,或者治理比微小排序提升更重要。
缺点也明显:每个部门都想给自己的信号加分;旧规则只加不删;复杂信号之间的关系容易遗漏。
预测型
模型从历史结果里寻找关系。
适合:
- 历史数据量足;
- 结果标签可信;
- 业务流程没有刚刚大改到让旧数据失效;
- 有监控和重新校准计划。
Salesforce的Einstein Lead Scoring资料就是很好的提醒:预测评分依赖历史CRM数据和合适的数据条件。具体门槛因平台而异,但采购原则一样——没有可信历史结果,就没有可靠预测质量。
混合型
用硬规则做商业约束,再在合格池里用模型排序。
例如:
- 排除不服务地区;
- 把现有客户移出净新开发队列;
- 保留最低匹配要求;
- 再用互动/预测模型排序;
- 异常进入人工复核。
这往往比争论“规则好还是AI好”更实用。
分支五:旧行为怎么办?
一个人九个月前下载过一次资料,不应该永远保持同样的紧迫度。
采购时问清:
- 是否支持时间衰减;
- 滚动窗口;
- 行为过期;
- 负分;
- 长期不活跃扣分;
- 资格确认或否决后的重置。
HubSpot在事件组里提供分数衰减。具体功能是平台自己的,但采购问题是通用的:
时间能不能被明确建模,还是数据库里的意向会永生?
没有衰减策略的评分,常见情况是第一个月很好用,半年后越来越吵。
分支六:谁拥有“阈值”?
分数是连续的,但分单不是。
58分可能继续培育,60分就创建SDR任务。这两分差异会直接制造人工工作,所以阈值必须有负责人。
采购前写清:
- 谁提出改阈值;
- 哪种结果支持修改;
- 不同细分市场是否用不同阈值;
- 多久复核一次;
- 销售能不能覆盖;
- 临界分怎么办。
HubSpot允许设置评分阈值并测试分数分布。这很重要,因为团队可以先估算“多少记录会跨线”,再打开自动化。
**采购测试:**要求供应商演示“模拟改阈值,但不触发生产流程”。
分支七:能不能先影子运行,再控制真实人员?
第一次跑模型,绝对不要直接连到自动分单、外呼序列或管理层报表。
更安全的三阶段是:
第一阶段:影子模式
计算分数,但不改变分单。
抽取高、中、低分样本,与销售判断和真实结果比较。
第二阶段:辅助模式
给销售看分数和原因,让它影响优先级,但硬路由规则不变。
记录销售不认同的案例。这些分歧通常比一个平均“准确率”更有价值。
第三阶段:受控自动化
只把已经通过验收的组合自动化。
例如“高分 + 地区合格 + 无指定账户冲突”可以创建SDR任务,但没必要直接宣布成“已资格确认的销售机会”。
分支八:买完以后到底验收什么?
如果成功标准只有“系统上线”,先别买。
至少看:
| 结果 | 为什么要看 |
|---|---|
| 高优先线索响应时间 | 评分有没有改变动作 |
| 不同分数段转化 | 排序有没有区分度 |
| 假阳性复核率 | 噪音花多少销售时间 |
| 低分里漏掉的重要结果 | 看假阴性 |
| 销售覆盖/改分率 | 看信任和边界案例 |
| 有分记录覆盖率 | 数据库多少真的可用 |
| 数据新鲜度 | 防止输入老化 |
| 每单位销售时间产生的pipeline | 回到经济价值 |
不要只优化“MQL转化率”。如果模型只是把池子砍得特别小,转化率可能更漂亮,但总有效pipeline反而下降。
分支九:你真的需要再买一个平台吗?
评分能力现在可能出现在CRM、营销自动化、销售互动平台、数据供应商和专业AI产品中。G2当前Lead Scoring分类里有大量产品,各大平台也持续把评分塞进更完整的工作流。
所以采购问题变成:
你可能不需要多买一套系统,而是需要:
- 把CRM里已经付费的评分用好;
- 先清理数据;
- 换一个更简单的路由引擎;
- 增加独立意向数据;
- 或者只增加一个能把透明结果写回CRM的模型层。
先弄清楚缺的是哪一层,再决定要不要多一个平台。
十个统一问供应商的问题
所有候选都问同一套:
- 匹配度和互动能不能分开看?
- 哪些数据是原生、导入、外部补全或推断?
- 负信号和时间衰减怎么处理?
- 能不能把某些字段或记录排除出模型训练?
- 用户能不能看到为什么升分/降分?
- 阈值上线前能不能模拟?
- 公司级和个人级信号怎么组合?
- 原始贡献信号和分数历史能否导出?
- 字段缺失或冲突时系统怎么做?
- 漂移怎么监控、多久校准、如何回滚?
好的答案应该包含“做不到什么”,而不是只讲能力。
不要只看AI故事,要求演示真实脏数据
一个有价值的采购Demo,应该有一条不好看的记录。
可以给候选供应商一个样本:
- 公司规模缺失;
- 联系人刚换职位;
- 已存在客户标记;
- 网站互动很强;
- 所在地区暂不服务;
- 有一个很旧、应该衰减的行为。
然后看系统怎么处理。
它会显示缺失吗?会服从商业资格限制吗?能解释旧行为吗?能把“很感兴趣”与“能成交的账户”分开吗?能看分数历史吗?
这个测试比预设好的演示数据有价值得多。
采购以前就写退出规则
可以这样写:
“只有高分组能够持续集中更多我们定义的业务结果,同时没有制造不可接受的假阳性人工成本,也没有把战略重要账户大量压在低分区,我们才扩大评分使用范围。”
它没有要求“95%准确率”这种魔法数字,也没有默认供应商阈值,更没有授权模型自动确认机会。
它只问:
排序有没有改善一个真实的资源分配决定?
哪些理由不应该成为购买理由
不要因为这些就买:
- 市场团队想换一个新的MQL数字;
- CRM演示看上去很聪明;
- “AI评分”听起来比规则高级;
- 某家同行在用;
- 数据很乱,希望模型顺便清洗;
- 销售不看现在的分数,于是想换一个更花哨的。
这些是症状,不是采购需求。
一页决策树
线索总分错负责人? 先修路由和基础数据。
潜在客户太多,人手不够? 评分可能有价值。
需要透明运营规则? 先规则型或混合型。
有可靠历史、稳定结果? 再评估预测型。
行为会过期? 必须有衰减和历史。
阈值会制造人工工作? 必须可模拟、有治理。
模型准备控制自动化? 先影子模式、再辅助模式。
说不清要改善什么业务结果? 暂时别买。
Forrester最值得保留的边界是:评分帮助分配注意力,真正的资格确认仍需要人和业务流程判断。
最好的评分系统不是“分数最聪明”的系统,而是输入、时间、阈值、异常和负责人足够清楚,销售团队可以利用它,却不用把判断权整个交出去。
资料来源
- HubSpot Knowledge Base,Build lead scores — https://knowledge.hubspot.com/scoring/build-lead-scores — 访问日期:2026-10-03
- Salesforce,Sales Productivity documentation(Einstein Lead Scoring相关部分)— https://resources.docs.salesforce.com/latest/latest/en-us/sfdc/pdf/sales_productivity.pdf — 访问日期:2026-10-03
- Forrester,The Basics Of Individual Interest Scoring (Lead Scoring) — https://www.forrester.com/report/the-new-basics-of-individual-interest-scoring/RES171477 — 更新日期:2025-11-24;访问日期:2026-10-03
- G2,Lead Scoring Software category — https://www.g2.com/categories/lead-scoring — 访问日期:2026-10-03
相关阅读
- https://salesai.globalsiriusmc.com/zh/articles/data-enrichment-composite-case-conflicting-records-and-exit-rule/
- https://salesai.globalsiriusmc.com/zh/articles/a-realistic-ai-research-agents-case-decisions-trade-offs-and-what-changed-the-outcome/
- https://salesai.globalsiriusmc.com/zh/articles/a-buyer-s-guide-to-ai-research-agents-what-to-compare-before-spending-money/