推荐大模型

  • 文档创建者:Aria.Han
  • 历史版本:33
  • 最近更新:Aria.Han 于 2026-08-31
  •  1. 简介

    Data Agent 支持连接符合 OpenAI/Azure 接口规范的本地大模型以及云上大模型。

    icon提示:

    1)免责申明:帆软仅提供大模型的推荐参考及对接方式,不对大模型本身的问题承担责任。

    2)本文推荐模型仅针对问数场景,报告场景的推荐模型尚在测试阶段。

    2. 公有云推荐模型

    如果通过模型厂商或云服务商托管的公有云大模型 API 接入 Data Agent,可参考以下评测结果进行选型。

    本次评测使用帆软内部问数 Benchmark 评测集,在统一环境下对 7 个公有云大模型 API 进行测试。评测包含 200 条统一用例,主要关注两个指标:

    • 精度评分: 衡量模型回答的准确程度。

    • 性能评分: 衡量模型的响应速度和等待体验。

    2.1 选型建议

    使用侧重点建议优先评估的模型评测表现
    更关注回答准确性Kimi K3精度评分 80.7,参评模型中排名第 1
    更关注响应速度DeepSeek V4 Flash(正式版0731)性能评分 80.8,参评模型中排名第 1
    希望兼顾精度和响应性能Qwen 3.8 Max精度评分 79.4,排名第 2
    性能评分 75.0,排名第 3

    注:精度评分和性能评分是两个独立指标,本评测不将二者合并计算为总分。建议结合业务对准确性和响应速度的要求进行选择,并在正式使用前使用实际业务数据验证效果。

    2.2 评测结果

    以下榜单按照精度评分从高到低排序;精度评分相同时,性能评分更高的模型排名靠前。

    注:实际性能和并发表现会受到不同显卡型号、显卡数量影响,优先企业级显卡。

    排名模型精度评分性能评分评测等级
    1Kimi K380.753.8A
    2Qwen 3.8 Max79.475.0A
    3Qwen 3.8 27B78.066.6A
    4DeepSeek V4 Pro(正式版0813)77.547.9
    A
    5DeepSeek V4 Flash(正式版0731)76.580.8A
    6Qwen 3.7 Plus73.477.9B
    7GLM 5.271.450.5B
    8DeepSeek V4 Pro(内测版)68.572.7C

    2.3 公有云模型采购要求

    以上推荐模型均满足 Data Agent 基础使用需求,若配置其他公有云大模型,建议企业估算各项使用配额并像模型提供商确认以下内容:

    采购项需要向模型服务商确认的内容对实际使用的影响
    模型及版本模型名称、版本号、是否自动升级、旧版本保留周期模型版本发生变化后,回答效果和接口行为可能发生变化
    QPM/RPM 配额每分钟允许调用大模型的次数,以及是否存在突发流量限制配额不足时,高峰期可能出现限流、排队或调用失败
    TPM 配额每分钟允许处理的输入和输出 token 数,以及输入、输出是否分别限额配额不足时,复杂问题、长上下文或高并发调用可能失败
    并发限制同一时间允许处理的调用数量,以及超出限制后的排队机制影响业务高峰期的响应时间和超时率
    上下文能力单次调用支持的最大上下文长度和最大输出 token 数影响复杂问题、长提示词和大规模元数据的处理
    网络与安全API 访问地址、网络接入方式、数据是否留存以及相关安全合规条款决定模型服务能否正常接入,以及是否符合企业安全要求
    icon相关概念拓展:
    • QPM(Queries Per Minute): 每分钟允许完成的查询数量。

    • RPM(Requests Per Minute): 每分钟允许发起的 API 请求数量。

    • TPM(Tokens Per Minute): 每分钟允许模型处理的 token 数量,包括输入和输出 token。

    • 并发限制: 同一时间允许模型服务处理的 API 调用数量。

    2.3.1 配额如何估算

    Dora 回答一个用户问题时,可能需要多次调用大模型。因此,不能直接按照用户提问数购买 API 配额。

    可使用以下方法进行初步估算:

    1)每分钟调用次数需求

    例如,业务高峰期每分钟有 10 个用户问题,Dora 回答每个问题平均需要调用大模型 3 次,则每分钟调用次数约为:0 × 3 = 30 次/分钟

    此时采购的 QPM/RPM 配额应高于 30 次/分钟,并预留流量波动、调用重试和后续业务增长所需的余量。

    2)每分钟 token 需求

    例如,高峰期每分钟调用大模型 30 次,每次调用平均使用 5,000 token,则 TPM 需求约为:30 × 5,000 = 150,000 TPM

    如果模型服务商分别限制输入 TPM 和输出 TPM,还需要根据实际调用记录分别计算,不能只计算输入、输出 token 的合计值。

    注:Data Agent 没有适用于所有项目的固定 QPM、TPM 或 token 采购值。企业的数据表数量、知识范围、问题复杂度、用户使用量和业务高峰分布都会影响实际消耗,应以真实业务测试和调用记录为准。仅购买足够的 token 总量,并不代表模型服务能够支撑高峰期使用,还需要同时确认 QPM/RPM、TPM 和并发限制。

    2.4 评分说明

    1)精度评分

    通过用例数占已评估用例数的比例,并折算为百分制。因数据缺失等原因无法评估的用例不计入分母。

    计算公式:精度评分 = 通过数 ÷ 已评估数 × 100

    精度评分对应的等级如下:

    等级
    精度评分
    S≧ 85 分
    A75 ≤ 精度评分 < 85
    B70 ≤ 精度评分 < 75
    C60 ≤ 精度评分 < 70
    D精度评分 < 60

    2)性能评分

    由整体响应速度、尾部延迟和超时长尾占比三项加权折算。分数越高,表示整体等待时间越短、慢查询越少。

    注:大模型的配置与定价可参考文档:模型资源配置

    3. 私有化模型部署推荐

    如果数据不允许传输至公有云,或者需要自行控制模型服务和算力资源,可以选择私有化部署。

    推荐模型
    显卡要求
    DeepSeek V4 Flash(0731正式版)

    方案一:8*H20-3e

    方案二:8*A800(2*TP4)

    注:当前建议优先验证的私有化模型版本为 DeepSeek V4 Flash(0731正式版),并提供相应的两种私有化部署的硬件方案。

    3.1 场景推荐硬件部署方案

    企业可根据现有硬件条件、业务高峰期的使用量和预算范围,从以下两套方案中选择:

    企业使用场景部署方案参考表现
    企业用户可能在同一时段集中使用,更关注高峰期处理能力8*H20-3e
    • 可同时执行约 20~25 项后台分析任务

    • 繁忙时完成一项任务约需 40~70 秒

    • 部署预算约 320 万元(仅参考)

    企业更关注首期采购成本,且可以接受高峰期适当排队8*A800(2*TP4)
    • 可同时执行约 10~14 项后台分析任务

    • 繁忙时完成一项任务约需 50~70 秒

    • 部署预算约 100~200 万元(仅参考)

    icon概念拓展——什么是后台任务?
    Dora 回答用户问题时,会在后台调用大模型完成分析。每次交给大模型处理,记作一项「后台分析任务」。回答一个用户问题可能需要执行多项后台分析任务。

    3.2 两种部署方案表现对比

    以下为两套部署方案的详细表现,企业可结合上一节的场景推荐进行选择。

    部署方案单套服务的高峰容量参考接近容量上限时的等待时间流量明显超出容量时部署预算(仅参考)
    8*H20-3e
    • 同时执行约 20~25 项后台分析任务

    • 每分钟约完成 18~30 项

    约 40~70 秒同时执行 50 项任务时约 90~140 秒

    约 320 万元

    8*A800(2*TP4)
    • 同时执行约 10~14 项后台分析任务

    • 每分钟约完成 9~14 项

    约 50~70 秒同时执行 28 项任务时约 110~150 秒

    约 100~200 万元

    技术人员补充参考

    以下指标主要用于部署团队进行性能分析,普通业务选型无需重点关注:

    技术指标
    8*H20-3e8*A800(2*TP4)

    单并发时延

    服务空闲时,完成一项任务所需时间

    约 8~13 秒约 18~24 秒

    单并发 QPM

    服务空闲时,每分钟可完成的任务数

    约 5~7约 2.5~3.3

    KV Cache

    可同时保存的任务上下文容量

    683 万 token约 142 万 token

    icon概念拓展——KV Cache

    模型处理任务时,需要临时记住提示词、上下文以及已经生成的内容。KV Cache 可以理解为模型处理进行中任务时使用的「临时工作区」,其容量使用 token 表示。token 是大模型计算文本长度时使用的基本单位,可以简单理解为模型拆分文本后得到的文字片段,但不等同于固定数量的汉字。

    容量越大,通常越有利于同时处理更多任务,或者处理上下文更长的任务。例如,一个任务使用的上下文越长,占用的 KV Cache 通常越多,可同时容纳的任务就会越少。

    KV Cache 不是硬盘空间,也不是用于长期保存聊天记录的容量,也不能直接换算成在线用户数。实际可同时处理的任务数量还会受到模型部署参数、任务长度、显存分配和推理框架等因素影响。

    3.3 私有化部署采购要求

    同一型号硬件在服务器配置、推理框架、模型精度、并行策略和服务参数不同的情况下,最终性能可能明显不同。

    采购私有化方案时,建议将以下内容一并写入采购或技术验证清单:

    1)模型版本:明确部署 DeepSeek V4 Flash(0731正式版),并确认模型文件、授权方式和升级策略。

    2)推理服务:确认推理框架、部署参数以及 Azure 兼容接口,并完成与 Data Agent 的联调。

    3)容量目标:根据预计并发量、峰值 QPM、问题长度和目标响应时间,明确验收指标。

    3.4 上线前验证建议

    私有化方案完成部署后,建议至少验证以下内容:

    1)使用实际业务问题验证回答准确性,不仅验证模型接口能够返回结果。

    2)在预计峰值并发下测试 QPM、平均响应时间、尾部延迟和超时率。

    3)使用典型长问题验证上下文容量及显存占用。

    4)模拟超过预计容量的突发流量,确认限流、排队和恢复机制。

    5)完成模型服务重启、节点故障、监控告警和日志排查验证。

    4. 使用非推荐模型的风险与支持边界

    本文中推荐的模型或部署组合已经具备评测数据或验证依据,并不表示 Data Agent 只能连接推荐模型。用户可以接入其他符合接口规范的模型,但对于非推荐模型,帆软不保证其兼容性、回答效果、响应性能和运行稳定性。

    使用未经推荐的模型可能出现以下情况:

    1)接口字段、鉴权方式或返回格式不兼容,导致模型无法连接或调用失败;

    2)模型指令理解、工具调用或结构化输出能力不足,导致回答错误、结果不稳定或任务无法完成;

    3)上下文窗口、QPM、TPM 或并发额度不足,导致限流、超时、排队或响应时间过长;

    4)模型版本升级后能力或接口行为发生变化,导致原有业务效果下降;

    5)私有化硬件资源或部署参数不足,导致显存不足、吞吐不足、服务异常或扩容成本增加。


    附件列表


    主题: 模型配置
    • 有帮助
    • 没帮助
    • 只是浏览
    • 评价文档,奖励 1 ~ 100 随机 F 豆!