“AI研究智能体”听起来像一个单独产品,实际上更像一整套技术栈:底层模型、工具调用、搜索与数据源、任务编排、权限、评测、监控,以及最后给用户看的研究工作流。
这也是采购最容易比错的地方。
两个产品都能“生成一份公司研究报告”,背后可能完全不是一回事:一个是通用智能体平台,一个是已经做好的研究应用,一个则是拥有独家数据的数据库加AI入口。表面结果相似,但你购买的是完全不同的责任边界。
下面按“买家为什么买 → 系统如何完成 → 卖家在哪一层收费”拆开。
先记住三个判断
第一,模型只是其中一层。 现在的智能体SDK和平台普遍不只是调用模型,还会加入工具、状态、移交、护栏、追踪或受控执行环境。没有可靠数据、权限和工作流控制,再聪明的模型也不等于生产级研究系统。
第二,研究质量本质上也是评测问题。 智能体会连续做很多步选择,调用不同工具,再根据中间结果调整。这种系统不能只靠“看一次结果挺好”来判断,必须有任务级评测、回归测试、来源核对和人工校准。
第三,市场正在向互操作发展。 A2A、MCP式工具连接等开放协议背后是同一个需求:企业不希望每个智能体都困在一个供应商的封闭岛里。现在还远没到“完全通用”,但能否连接、替换和迁移,已经是采购要问的问题。
买家真正买的不是“智能体”,而是一个工作结果
多数人不是为了“拥有一个AI agent”而采购,而是为了:
- 找到并总结可信来源;
- 持续监控市场或目标公司;
- 对比供应商和产品;
- 自动生成公司/行业简报;
- 从内部文件提取结构化信息;
- 从公开网络搜集事实并整理;
- 把研究流程标准化;
- 减少分析师重复搜集的时间。
因此市场第一刀应该先切成两类:
成品工作流和通用平台。
成品研究产品卖的是“直接得到结果”;通用平台卖的是“你可以自己搭很多结果”。前者通常上线快,后者控制力强,但会把更多工程、测试和维护工作留给买家。
第一层:基础模型
很多系统最底下是通用大模型API或托管模型。
模型负责理解、规划、归纳、写作和选择工具,但“研究是否可靠”不只是模型能力决定。真正的研究还需要证据来源、引用、冲突处理,以及找不到资料时不乱补的机制。
采购时至少要问:
- 可以使用哪些模型;
- 换模型是不是要把整个流程重做;
- 长任务中断后能否继续;
- 工具调用错误怎么处理;
- 能不能看到任务追踪和关键中间证据;
- 数据保存在哪里、保存多久;
- 企业权限是否能原样继承。
不要只看一个模型跑分,就把整套系统判断完了。
第二层:智能体运行与编排
这一层负责把“回答一次问题”变成“连续完成一个任务”。
现在的智能体SDK通常会提供工具调用、状态、重试、移交、护栏、追踪甚至沙盒执行。卖家在这里卖的不是一句“AI更聪明”,而是执行基础设施。
买家实际付钱的可能包括:
- 工具连接;
- 错误重试;
- 会话与任务状态;
- 人工审批节点;
- 多智能体协作;
- 可观测性;
- 文件或代码的受控执行;
- 权限和策略控制。
小团队可能更适合托管产品,因为省运维;技术团队可能更喜欢代码优先SDK,因为能深度接自己的系统。
没有绝对谁更好,关键是:工程责任你想留在自己手上多少。
第三层:搜索、检索和独家数据
没有证据的数据智能体,很容易变成“表达非常流畅的猜测器”。
这一层包括公开网络搜索、企业内部搜索、收费数据库、CRM、文档库、知识库和行业专属数据。
很多真正有壁垒的商业价值其实在这里。模型可能越来越容易替换,但长期积累、合法授权、权限清晰、更新稳定的数据源没那么容易替换。
采购时不要只问“覆盖多少数据”,而要拆开问:
- 哪些是一手来源、哪些是授权数据、哪些是公开网页;
- 能不能返回原始URL或文件位置;
- 数据多新;
- 找不到时会不会明确说“未找到”;
- 能不能区分“没搜到”和“事实不存在”;
- 原文档权限能不能继承;
- 两个来源冲突时如何处理。
Demo搜中一个漂亮答案,不代表它能稳定覆盖你的全量任务。
第四层:验证、评测和可观测性
早期项目最容易漏掉的就是这一层。
NIST的AI风险管理框架和生成式AI Profile都强调,AI风险需要被识别、衡量和持续管理。落到智能体系统里,就是你不能只凭感觉说“最近效果还不错”,而要能看到系统行为的证据。
Anthropic在2026年的智能体评测文章也强调,多轮、工具调用、状态变化和自适应行为会让智能体比单轮模型更难测试。
研究智能体可以重点测:
- 来源是否正确;
- 引用能不能支持对应结论;
- 必填字段是否完整;
- 动态信息是否足够新;
- 重复率;
- 是否漏掉相反证据;
- 是否出现无来源事实断言;
- 任务完成率;
- 每个有效任务的成本和时间。
一个供应商如果无法说明这些东西怎么测,应该先把它当“原型工具”看,而不是直接当生产级研究系统。
第五层:真正影响员工体验的工作流
用户最后接触到的是最上层。
可能是聊天框、研究工作台、浏览器智能体、内部看板、定时邮件、CRM自动补全或API。
这一层决定“能不能融入工作”。
销售团队可能希望研究结果直接写入CRM;战略团队需要长报告和完整引用;采购团队需要结构化比较和审批痕迹;老板可能只要一键公司简报。
同一个模型,放在不同工作流里,体验可能差很多。
市场上常见的四种卖法
1. 成品研究应用
按席位或用量付费,拿来就用。
优点:上线快。
代价:底层编排、数据和模型选择通常可控程度较低。
2. 智能体平台
买的是搭建和管理大量智能体的底座。
优点:基础设施可复用、管理集中。
代价:实施责任更多落到你的技术团队或集成商。
3. 数据产品 + 智能体入口
真正值钱的是数据库,AI只是新的操作界面。
优点:垂直领域数据强时非常有价值。
代价:结果上限受它的数据覆盖和授权范围限制。
4. 服务商和集成商
对方替你把模型、数据、自动化和内部系统拼起来。
优点:快速获得工程经验。
代价:如果没有把文档、账号、流程和知识产权边界谈清楚,后期容易形成服务依赖。
钱到底花在哪里
智能体研究项目的实际成本很少只有“一个月多少钱”。
完整成本可能包含:
- 模型调用;
- 搜索和数据库调用;
- 智能体平台;
- 文档存储和检索;
- 自动化流程;
- 评测与监控;
- 集成开发;
- 安全审核;
- 人工复核;
- 持续维护。
所以采购时只比“每席位价格”很容易失真。
更实用的指标是:每个通过质量标准的有效研究任务,综合成本是多少。
互操作为什么越来越重要
2025年Google发布A2A协议,随后又把该项目移交Linux Foundation,由多家技术公司参与。它解决的是不同供应商、不同框架的智能体之间如何通信和协作的问题。
与此同时,各类智能体SDK也在把“模型调用”和“编排、工具、执行”拆成不同层。
对采购者来说,不需要现在押注“哪个协议最后赢”,而应该尽量避免无谓锁死:
- 能不能通过标准接口调用外部工具;
- 能不能把自己的能力暴露为API;
- 输出、日志、追踪是否可导出;
- 你的数据模型能否独立于供应商保存;
- 数据提供商能否替换;
- 模型或运行时更换时是否必须推倒重来。
用一条链把所有产品放回正确位置
可以用这一条顺序比较任何“AI研究智能体”:
业务需求 → 工作流 → 数据 → 智能体运行层 → 模型 → 评测 → 治理 → 输出
如果供应商一上来只讲模型参数和榜单,就把话题拉回业务流程。
例如做公司研究,你真正应该问的是:必填字段能不能稳定找到、每个关键事实能否保留来源、找不到时会不会承认、能否发现冲突、能否去重、能否遵守数据权限、最终能不能直接进入你团队的工作系统。
模型强,只是必要条件之一。
什么情况会让采购结论改变
只做公开网络研究的小团队,和处理客户私有数据的受监管企业,系统架构完全不是一回事。
一次战略报告可以接受较多人工复核;每天生成几万条数据的系统就必须有自动评测。只总结用户自己选定的文件,比自主浏览全网需要的开放网络控制更少。
数据敏感度、任务量、错误代价、速度要求、审计要求和集成深度,都会改变“应该买哪一层、自己做哪一层”。
签约前十个问题
- 哪些研究任务已经在真实生产里跑过?
- 数据源哪些是自有、授权、公开或客户提供?
- 关键事实能否保留来源?
- 来源冲突怎么处理?
- 必填信息找不到时怎么办?
- 模型或提示词升级前跑什么回归评测?
- 能否查看工具调用、追踪和人工审批点?
- 哪些数据和流程可以导出、替换?
- 每个真正合格任务的综合成本是多少?
- 数据源/API变化后,谁负责维护?
这十个问题通常比再看一次漂亮Demo更能看清产品。
延伸阅读
来源
- NIST,AI Risk Management Framework:https://www.nist.gov/itl/ai-risk-management-framework
- NIST,Generative AI Profile(NIST AI 600-1):https://www.nist.gov/publications/artificial-intelligence-risk-management-framework-generative-artificial-intelligence
- OpenAI,Agents SDK文档:https://developers.openai.com/api/docs/guides/agents/sdk
- Anthropic,Demystifying evals for AI agents(2026-01-09):https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents
- Google Developers Blog,Announcing the Agent2Agent Protocol(2025-04-09):https://developers.googleblog.com/en/a2a-a-new-era-of-agent-interoperability/
- Google Developers Blog,Google Cloud donates A2A to Linux Foundation(2025-06-23):https://developers.googleblog.com/google-cloud-donates-a2a-to-linux-foundation/
复核日期:2026年10月2日。智能体产品迭代很快,采购前应重新核对最新文档、数据条款和合同责任。