推荐大模型

  • 文档创建者:Aria.Han
  • 历史版本:27
  • 最近更新:Aria.Han 于 2026-08-13
  •  1. 简介

    Data Agent 支持连接符合 OpenAI/Azure 接口规范的本地大模型以及云上大模型。

    icon免责申明:帆软仅提供大模型的推荐参考及对接方式,不对大模型本身的问题承担责任。

    2. 公有云推荐模型

    如果通过模型厂商或云服务商托管的公有云大模型 API 接入 Data Agent,可参考以下评测结果进行选型。

    本次评测使用帆软内部问数 Benchmark 评测集,在统一环境下对 7 个公有云大模型 API 进行测试。评测包含 200 条统一用例,主要关注两个指标:

    • 精度评分: 衡量模型回答的准确程度。

    • 性能评分: 衡量模型的响应速度和等待体验。

    2.1 选型建议

    使用侧重点建议优先评估的模型评测表现
    更关注回答准确性Kimi K3精度评分 80.7,参评模型中排名第 1
    更关注响应速度DeepSeek V4 Flash(正式版0731)性能评分 80.8,参评模型中排名第 1
    希望兼顾精度和响应性能Qwen 3.8 Max精度评分 79.4,排名第 2
    性能评分 75.0,排名第 3

    注:精度评分和性能评分是两个独立指标,本评测不将二者合并计算为总分。建议结合业务对准确性和响应速度的要求进行选择,并在正式使用前使用实际业务数据验证效果。

    2.2 评测结果

    以下榜单按照精度评分从高到低排序;精度评分相同时,性能评分更高的模型排名靠前。

    排名模型精度评分性能评分评测等级
    1Kimi K380.753.8A
    2Qwen 3.8 Max79.475.0A
    3DeepSeek V4 Pro(正式版0813)77.547.9
    A
    4DeepSeek V4 Flash(正式版0731)76.580.8A
    5Qwen 3.7 Plus73.477.9B
    6GLM 5.271.450.5B
    7DeepSeek V4 Pro(内测版)68.572.7C

    2.3 评分说明

    1)精度评分

    通过用例数占已评估用例数的比例,并折算为百分制。因数据缺失等原因无法评估的用例不计入分母。

    计算公式:精度评分 = 通过数 ÷ 已评估数 × 100

    精度评分对应的等级如下:

    等级
    精度评分
    S≧ 85 分
    A75 ≤ 精度评分 < 85
    B70 ≤ 精度评分 < 75
    C60 ≤ 精度评分 < 70
    D精度评分 < 60

    2)性能评分

    由整体响应速度、尾部延迟和超时长尾占比三项加权折算。分数越高,表示整体等待时间越短、慢查询越少。

    注:大模型的配置与定价可参考文档:模型资源配置

    附件列表


    主题: 模型配置
    已经是第一篇
    已经是最后一篇
    • 有帮助
    • 没帮助
    • 只是浏览
    • 评价文档,奖励 1 ~ 100 随机 F 豆!