智能体与模型观察 · 热点深度解读

DeepSeek V4 Preview 强调 Agent 能力,企业应该怎样评测?

DeepSeek 官方页面已展示 V4 Preview,并强调更强的 Agent 能力。企业不应只比较推理题和代码榜单,而应验证多步任务、工具调用、证据、失败恢复、延迟和一次可采用结果的成本。

事实核验 + 企业机制分析公开责任:研究负责人 How发布:2026-07-21更新:2026-07-21研究与证据方法

先给结论

DeepSeek V4 Preview 强调 Agent 能力,企业应该怎样评测?

DeepSeek V4 Preview 的企业价值不能由一句“Agent 能力更强”直接推出。应把它接入相同 Harness,用企业真实材料和工具运行多步任务,观察是否正确调用、何时停止、能否返回证据、失败后怎样恢复,以及包含重试和人工复核后的总成本。

数位人判断

模型进入 Agent 时代后,评测单位必须从“一次回答”升级为“一段任务轨迹”。

原创系统图

Agent 模型的评测单位不是答案,而是完整轨迹

01真实输入

正常、缺失和冲突样本

02任务规划

步骤是否合理、能否调整

03工具执行

参数、重试、停止和幂等

04结果证据

来源、产物和不确定性

05总成本

模型、工具、复核和返工

只看最后一段文字,会看不见错误工具调用、重复动作和中间证据丢失。

事实核验

先区分官方信息与我们的判断

官方状态

DeepSeek 英文官网当前展示 V4 Preview,并将更强 Agent 能力作为主要更新信号。

核对来源
服务入口

官方提供网页、应用和 API,企业评测应记录具体入口、模型标识、日期与参数。

核对来源
证据限制

截至本页更新,本文不引用第三方转述的参数量、榜单和未在官方页面核验的价格。

核对来源

企业决策表

从模型榜单转向企业任务评测

评测对象常见做法数位人建议
推理能力看公开题库分数加入本企业材料、反例和时间限制
工具调用看是否成功调用一次测试错误参数、超时、撤销和重复执行
长任务看最终是否生成检查中间状态、证据和人工接管
成本比较每百万 token计算一次可采用结果的完整成本

企业下一步

不追热点演示,用真实任务建立结论

  1. 01

    建立二十到五十条真实任务集,并冻结测试期间的工具与数据版本。

  2. 02

    与当前主模型盲测,不向业务评分者展示模型品牌。

  3. 03

    把事实错误、越权、遗漏、工具失败和人工修改分别记录。

  4. 04

    只在某类任务达到门槛后配置路由,不做全站默认替换。

边界与反例

这些能力不能被宣传语自动证明

  • Preview 版本能力、标识、稳定性和价格可能变化。
  • 公开基准不能覆盖企业私有材料、业务工具和责任要求。
  • 国内部署与服务并不自动免除企业的数据分类和权限治理。

站内延伸阅读

企业多模型路由指南GPT 与 Claude 企业任务怎么选模型与算力服务

场景评估 · 商务负责人 孙景璐

从一个真实任务开始。

查看服务流程