1. 简介
Data Agent 支持连接符合 OpenAI/Azure 接口规范的本地大模型以及云上大模型。
免责申明:帆软仅提供大模型的推荐参考及对接方式,不对大模型本身的问题承担责任。2. 公有云推荐模型
如果通过模型厂商或云服务商托管的公有云大模型 API 接入 Data Agent,可参考以下评测结果进行选型。
本次评测使用帆软内部问数 Benchmark 评测集,在统一环境下对 7 个公有云大模型 API 进行测试。评测包含 200 条统一用例,主要关注两个指标:
精度评分: 衡量模型回答的准确程度。
性能评分: 衡量模型的响应速度和等待体验。
2.1 选型建议
| 使用侧重点 | 建议优先评估的模型 | 评测表现 |
|---|---|---|
| 更关注回答准确性 | Kimi K3 | 精度评分 80.7,参评模型中排名第 1 |
| 更关注响应速度 | DeepSeek V4 Flash(正式版0731) | 性能评分 80.8,参评模型中排名第 1 |
| 希望兼顾精度和响应性能 | Qwen 3.8 Max | 精度评分 79.4,排名第 2 性能评分 75.0,排名第 3 |
注:精度评分和性能评分是两个独立指标,本评测不将二者合并计算为总分。建议结合业务对准确性和响应速度的要求进行选择,并在正式使用前使用实际业务数据验证效果。
2.2 评测结果
以下榜单按照精度评分从高到低排序;精度评分相同时,性能评分更高的模型排名靠前。
| 排名 | 模型 | 精度评分 | 性能评分 | 评测等级 |
|---|---|---|---|---|
| 1 | Kimi K3 | 80.7 | 53.8 | A |
| 2 | Qwen 3.8 Max | 79.4 | 75.0 | A |
| 3 | DeepSeek V4 Pro(正式版0813) | 77.5 | 47.9 | A |
| 4 | DeepSeek V4 Flash(正式版0731) | 76.5 | 80.8 | A |
| 5 | Qwen 3.7 Plus | 73.4 | 77.9 | B |
| 6 | GLM 5.2 | 71.4 | 50.5 | B |
| 7 | DeepSeek V4 Pro(内测版) | 68.5 | 72.7 | C |
2.3 评分说明
1)精度评分
通过用例数占已评估用例数的比例,并折算为百分制。因数据缺失等原因无法评估的用例不计入分母。
计算公式:精度评分 = 通过数 ÷ 已评估数 × 100
精度评分对应的等级如下:
| 等级 | 精度评分 |
|---|---|
| S | ≧ 85 分 |
| A | 75 ≤ 精度评分 < 85 |
| B | 70 ≤ 精度评分 < 75 |
| C | 60 ≤ 精度评分 < 70 |
| D | 精度评分 < 60 |
2)性能评分
由整体响应速度、尾部延迟和超时长尾占比三项加权折算。分数越高,表示整体等待时间越短、慢查询越少。
注:大模型的配置与定价可参考文档:模型资源配置。
