1. 简介
Data Agent 支持连接符合 OpenAI/Azure 接口规范的本地大模型以及云上大模型。
提示:1)免责申明:帆软仅提供大模型的推荐参考及对接方式,不对大模型本身的问题承担责任。
2)本文推荐模型仅针对问数场景,报告场景的推荐模型尚在测试阶段。
2. 公有云推荐模型
如果通过模型厂商或云服务商托管的公有云大模型 API 接入 Data Agent,可参考以下评测结果进行选型。
本次评测使用帆软内部问数 Benchmark 评测集,在统一环境下对 7 个公有云大模型 API 进行测试。评测包含 200 条统一用例,主要关注两个指标:
精度评分: 衡量模型回答的准确程度。
性能评分: 衡量模型的响应速度和等待体验。
2.1 选型建议
| 使用侧重点 | 建议优先评估的模型 | 评测表现 |
|---|---|---|
| 更关注回答准确性 | Kimi K3 | 精度评分 80.7,参评模型中排名第 1 |
| 更关注响应速度 | DeepSeek V4 Flash(正式版0731) | 性能评分 80.8,参评模型中排名第 1 |
| 希望兼顾精度和响应性能 | Qwen 3.8 Max | 精度评分 79.4,排名第 2 性能评分 75.0,排名第 3 |
注:精度评分和性能评分是两个独立指标,本评测不将二者合并计算为总分。建议结合业务对准确性和响应速度的要求进行选择,并在正式使用前使用实际业务数据验证效果。
2.2 评测结果
以下榜单按照精度评分从高到低排序;精度评分相同时,性能评分更高的模型排名靠前。
注:实际性能和并发表现会受到不同显卡型号、显卡数量影响,优先企业级显卡。
| 排名 | 模型 | 精度评分 | 性能评分 | 评测等级 |
|---|---|---|---|---|
| 1 | Kimi K3 | 80.7 | 53.8 | A |
| 2 | Qwen 3.8 Max | 79.4 | 75.0 | A |
| 3 | Qwen 3.8 27B | 78.0 | 66.6 | A |
| 4 | DeepSeek V4 Pro(正式版0813) | 77.5 | 47.9 | A |
| 5 | DeepSeek V4 Flash(正式版0731) | 76.5 | 80.8 | A |
| 6 | Qwen 3.7 Plus | 73.4 | 77.9 | B |
| 7 | GLM 5.2 | 71.4 | 50.5 | B |
| 8 | DeepSeek V4 Pro(内测版) | 68.5 | 72.7 | C |
2.3 公有云模型采购要求
以上推荐模型均满足 Data Agent 基础使用需求,若配置其他公有云大模型,建议企业估算各项使用配额并像模型提供商确认以下内容:
| 采购项 | 需要向模型服务商确认的内容 | 对实际使用的影响 |
|---|---|---|
| 模型及版本 | 模型名称、版本号、是否自动升级、旧版本保留周期 | 模型版本发生变化后,回答效果和接口行为可能发生变化 |
| QPM/RPM 配额 | 每分钟允许调用大模型的次数,以及是否存在突发流量限制 | 配额不足时,高峰期可能出现限流、排队或调用失败 |
| TPM 配额 | 每分钟允许处理的输入和输出 token 数,以及输入、输出是否分别限额 | 配额不足时,复杂问题、长上下文或高并发调用可能失败 |
| 并发限制 | 同一时间允许处理的调用数量,以及超出限制后的排队机制 | 影响业务高峰期的响应时间和超时率 |
| 上下文能力 | 单次调用支持的最大上下文长度和最大输出 token 数 | 影响复杂问题、长提示词和大规模元数据的处理 |
| 网络与安全 | API 访问地址、网络接入方式、数据是否留存以及相关安全合规条款 | 决定模型服务能否正常接入,以及是否符合企业安全要求 |
相关概念拓展:QPM(Queries Per Minute): 每分钟允许完成的查询数量。
RPM(Requests Per Minute): 每分钟允许发起的 API 请求数量。
TPM(Tokens Per Minute): 每分钟允许模型处理的 token 数量,包括输入和输出 token。
并发限制: 同一时间允许模型服务处理的 API 调用数量。
2.3.1 配额如何估算
Dora 回答一个用户问题时,可能需要多次调用大模型。因此,不能直接按照用户提问数购买 API 配额。
可使用以下方法进行初步估算:
1)每分钟调用次数需求
例如,业务高峰期每分钟有 10 个用户问题,Dora 回答每个问题平均需要调用大模型 3 次,则每分钟调用次数约为:0 × 3 = 30 次/分钟
此时采购的 QPM/RPM 配额应高于 30 次/分钟,并预留流量波动、调用重试和后续业务增长所需的余量。
2)每分钟 token 需求
例如,高峰期每分钟调用大模型 30 次,每次调用平均使用 5,000 token,则 TPM 需求约为:30 × 5,000 = 150,000 TPM
如果模型服务商分别限制输入 TPM 和输出 TPM,还需要根据实际调用记录分别计算,不能只计算输入、输出 token 的合计值。
注:Data Agent 没有适用于所有项目的固定 QPM、TPM 或 token 采购值。企业的数据表数量、知识范围、问题复杂度、用户使用量和业务高峰分布都会影响实际消耗,应以真实业务测试和调用记录为准。仅购买足够的 token 总量,并不代表模型服务能够支撑高峰期使用,还需要同时确认 QPM/RPM、TPM 和并发限制。
2.4 评分说明
1)精度评分
通过用例数占已评估用例数的比例,并折算为百分制。因数据缺失等原因无法评估的用例不计入分母。
计算公式:精度评分 = 通过数 ÷ 已评估数 × 100
精度评分对应的等级如下:
| 等级 | 精度评分 |
|---|---|
| S | ≧ 85 分 |
| A | 75 ≤ 精度评分 < 85 |
| B | 70 ≤ 精度评分 < 75 |
| C | 60 ≤ 精度评分 < 70 |
| D | 精度评分 < 60 |
2)性能评分
由整体响应速度、尾部延迟和超时长尾占比三项加权折算。分数越高,表示整体等待时间越短、慢查询越少。
注:大模型的配置与定价可参考文档:模型资源配置。
3. 私有化模型部署推荐
如果数据不允许传输至公有云,或者需要自行控制模型服务和算力资源,可以选择私有化部署。
| 推荐模型 | 显卡要求 |
|---|---|
| DeepSeek V4 Flash(0731正式版) | 方案一:8*H20-3e 方案二:8*A800(2*TP4) |
注:当前建议优先验证的私有化模型版本为 DeepSeek V4 Flash(0731正式版),并提供相应的两种私有化部署的硬件方案。
3.1 场景推荐硬件部署方案
企业可根据现有硬件条件、业务高峰期的使用量和预算范围,从以下两套方案中选择:
| 企业使用场景 | 部署方案 | 参考表现 |
|---|---|---|
| 企业用户可能在同一时段集中使用,更关注高峰期处理能力 | 8*H20-3e |
|
| 企业更关注首期采购成本,且可以接受高峰期适当排队 | 8*A800(2*TP4) |
|
概念拓展——什么是后台任务?3.2 两种部署方案表现对比
以下为两套部署方案的详细表现,企业可结合上一节的场景推荐进行选择。
| 部署方案 | 单套服务的高峰容量参考 | 接近容量上限时的等待时间 | 流量明显超出容量时 | 部署预算(仅参考) |
|---|---|---|---|---|
| 8*H20-3e |
| 约 40~70 秒 | 同时执行 50 项任务时约 90~140 秒 | 约 320 万元 |
| 8*A800(2*TP4) |
| 约 50~70 秒 | 同时执行 28 项任务时约 110~150 秒 | 约 100~200 万元 |
技术人员补充参考
以下指标主要用于部署团队进行性能分析,普通业务选型无需重点关注:
| 技术指标 | 8*H20-3e | 8*A800(2*TP4) |
|---|---|---|
单并发时延 (服务空闲时,完成一项任务所需时间) | 约 8~13 秒 | 约 18~24 秒 |
单并发 QPM (服务空闲时,每分钟可完成的任务数) | 约 5~7 | 约 2.5~3.3 |
KV Cache (可同时保存的任务上下文容量) | 683 万 token | 约 142 万 token |
概念拓展——KV Cache?模型处理任务时,需要临时记住提示词、上下文以及已经生成的内容。KV Cache 可以理解为模型处理进行中任务时使用的「临时工作区」,其容量使用 token 表示。token 是大模型计算文本长度时使用的基本单位,可以简单理解为模型拆分文本后得到的文字片段,但不等同于固定数量的汉字。
容量越大,通常越有利于同时处理更多任务,或者处理上下文更长的任务。例如,一个任务使用的上下文越长,占用的 KV Cache 通常越多,可同时容纳的任务就会越少。
KV Cache 不是硬盘空间,也不是用于长期保存聊天记录的容量,也不能直接换算成在线用户数。实际可同时处理的任务数量还会受到模型部署参数、任务长度、显存分配和推理框架等因素影响。
3.3 私有化部署采购要求
同一型号硬件在服务器配置、推理框架、模型精度、并行策略和服务参数不同的情况下,最终性能可能明显不同。
采购私有化方案时,建议将以下内容一并写入采购或技术验证清单:
1)模型版本:明确部署 DeepSeek V4 Flash(0731正式版),并确认模型文件、授权方式和升级策略。
2)推理服务:确认推理框架、部署参数以及 Azure 兼容接口,并完成与 Data Agent 的联调。
3)容量目标:根据预计并发量、峰值 QPM、问题长度和目标响应时间,明确验收指标。
3.4 上线前验证建议
私有化方案完成部署后,建议至少验证以下内容:
1)使用实际业务问题验证回答准确性,不仅验证模型接口能够返回结果。
2)在预计峰值并发下测试 QPM、平均响应时间、尾部延迟和超时率。
3)使用典型长问题验证上下文容量及显存占用。
4)模拟超过预计容量的突发流量,确认限流、排队和恢复机制。
5)完成模型服务重启、节点故障、监控告警和日志排查验证。
4. 使用非推荐模型的风险与支持边界
本文中推荐的模型或部署组合已经具备评测数据或验证依据,并不表示 Data Agent 只能连接推荐模型。用户可以接入其他符合接口规范的模型,但对于非推荐模型,帆软不保证其兼容性、回答效果、响应性能和运行稳定性。
使用未经推荐的模型可能出现以下情况:
1)接口字段、鉴权方式或返回格式不兼容,导致模型无法连接或调用失败;
2)模型指令理解、工具调用或结构化输出能力不足,导致回答错误、结果不稳定或任务无法完成;
3)上下文窗口、QPM、TPM 或并发额度不足,导致限流、超时、排队或响应时间过长;
4)模型版本升级后能力或接口行为发生变化,导致原有业务效果下降;
5)私有化硬件资源或部署参数不足,导致显存不足、吞吐不足、服务异常或扩容成本增加。
