旗舰指南 · 大模型选型

企业应该选择哪个大模型?

没有脱离任务的最佳模型。先固定真实任务、输入、工具、输出和评分标准,再比较具体模型版本的一次成功率、失败类型、延迟、数据路径与总成本,最后配置主路线和备用路线。

模型选型与路由方法公开责任:研究负责人 How发布:2026-07-13更新:2026-09-08研究与证据方法

直接回答

先选模型服务条件,再用任务决定版本

第一轮先排除数据地域、合同、安全、并发和可用性不满足要求的服务;第二轮用同一批真实任务评测剩余候选。重要业务通常需要主模型、低成本模型和备用模型,而不是让一个模型承担全部工作。

六个判断维度

模型选型先问什么

  1. 01

    任务:输入是什么,必须交付什么,错误是否容易发现?

  2. 02

    数据:资料允许经过哪些地域、云服务和第三方处理方?

  3. 03

    工具:是否稳定输出结构化参数,能否正确停止、重试和拒绝?

  4. 04

    质量:事实、证据、完整性和人工修改量怎样评分?

  5. 05

    体验:首字延迟、总时长、并发和限流是否满足业务?

  6. 06

    成本:一次被采用的结果包含多少调用、重试、工具和复核成本?

候选池

品牌只决定从哪里开始测,不决定最后选谁

候选路线必须核验任务评测
OpenAI / GPT可用模型、工具接口、数据条款与价格在本企业材料和工具上盲测
Anthropic / Claude可用模型、工具接口、数据条款与价格与相同输入、提示和预算对比
Google / Gemini可用模型、模态、地域和服务配额单独测试多模态与工具任务
国产模型官方 API 版本、部署路径、并发和合同测试中文知识、长文档、代码和结构输出

这里列的是候选路线,不是能力排名。模型名称、版本、价格与条款应以评测和采购当日的官方页面为准。

评测集

20 条任务可以开始,但不能只测顺利样本

从最近真实工作中抽取常规、长输入、资料缺失、规则冲突和高风险任务。固定检索结果、工具定义、输出格式、预算和重试次数,由业务人员盲评。记录具体模型标识和测试日期,避免把旧版本结果套用到新版本。

指标记录口径不能替代
一次成功率不重跑即可进入下一环节只看主观“感觉不错”
人工修改量修改时间、字段数和错误类型只比较生成速度
工具可靠性正确调用、停止、重试和越权次数只测聊天回答
一次成功成本模型、工具、重试和复核总成本只比较 token 单价

路由策略

主模型、专长模型和备用模型

主模型覆盖大多数日常任务

便于控制默认质量、成本和用户体验。

专长模型处理特定高价值步骤

例如复杂报告、代码、视觉理解或批量推理。

备用模型服务异常时继续工作

在质量可接受的前提下保证关键任务连续性。

官方来源

先核对当日产品事实,再形成企业判断

链接用于核对当前模型、接口和服务条件,不代表数位人对某一模型作永久推荐。

模型路由是否会增加复杂度?

会增加配置和监测工作,因此不应为了“模型多”而多。只有当任务质量、数据地域、成本或可用性存在明确差异时才增加路线,并始终保留统一的任务日志和预算控制。

继续决策

GPT 和 Claude 怎么比较智能体技术栈怎么选企业智能体怎么建设

场景评估 · 商务负责人 孙景璐

从一个真实任务开始。

查看服务流程