DeepSeek V4 Flash 与 Qwen 3.8 Max 正式版对比,谁更强?

DeepSeek V4 Flash正式版于2026年7月31日发布后,隔了一个周末阿里就发布的自家最强大模型 Qwen 3.8 Max 正式版。

从官方发布的测试数据来看,两款模型公布的测试项目并不完全相同,所以也很难确定哪个模型更强。下面先比较相同项目,再分别介绍各自的专项成绩。

相同测试项目:

在终端操作方面,DeepSeek V4 Flash 的 TerminalBench 2.1 得分为 82.7。Qwen 3.8 Max 的 TerminalBench-2.1 得分为 86.6,领先 DeepSeek 3.9 分。

Agents' Last Exam。Qwen 3.8 Max 得分为 52.4,而 DeepSeek V4 Flash 为 25.2,差距达到 27.2 分。这通常意味着 Qwen 在长时任务规划、状态维护、连续决策和多步骤目标完成方面更强。

多模态与视觉推理:Qwen 3.8 Max 的优势更明显

在软件工程方面,Qwen 3.8 Max 的测试分数如下:

  • SWE-Pro 得分为 67.7,主要考察模型解决复杂软件开发问题的能力;
  • FrontierSWE 得分为 73.5,侧重测试模型处理高难度软件工程任务的水平;
  • PaperBench 得分为 93.0,主要测试模型能否理解论文并复现其中的研究方法。
  • 整体来看,Qwen 在复杂编码和研究复现方面表现较强。

在视觉和多模态任务方面,Qwen 3.8 Max 的测试分数如下:

  • BabyVision 得分为 91.3,主要测试基础视觉推理;
  • CharXiv 得分为 93.5,重点考察图表阅读、数据分析和科学推理;
  • PerceptionBench 得分为 63.5,测试模型识别和理解视觉信息的能力;
  • Vision2Web 得分为 69.0,考察根据网页视觉效果进行网页开发的能力;
  • LVBench 得分为 81.8,主要测试长视频内容理解;
  • ERQA 得分为 77.8,考察模型结合视觉信息进行具身推理的能力。

在 Agent 和电脑操作方面,Qwen 3.8 Max 的测试分数如下:

  • CoWorkBench 得分为 74.8,主要测试模型协助完成专业办公任务的能力;
  • JobBench 得分为 53.4,考察模型能否帮助人类完成实际工作流程;
  • OSWorld-Verified 得分为 86.1,测试模型操作电脑、使用软件和完成桌面任务的能力;
  • MobileWorld 得分为 77.8,主要测试模型操作移动端应用的能力。

此外,QwenReactBench 得分为 1724,主要用于评价模型生成 React 前端页面和交互效果的能力。该项目的计分方式与其他 0—100 分制不同,因此不能直接横向比较。

多模态与视觉推理:Qwen 3.8 Max 的优势更明显

DeepSeek V4 Flash 的专项成绩

DeepSeek V4 Flash 的测试分数如下:

  • 在 Cybergym 中得分 76.7,主要测试模型处理网络安全环境、分析问题并完成相关操作的能力;
  • Toolathlon Verified 得分 70.3,重点考察模型调用多个工具、理解工具返回结果并完成任务的能力。

在代码开发方面:

  • DSBench-FullStack 得分为 68.7,主要测试模型完成前端、后端和数据库等全栈开发任务的能力;
  • DSBench-Hard 得分为 59.6,侧重考察模型处理高难度 Coding Agent 任务的能力;
  • DeepSWE 得分为 54.4,主要测试模型理解代码仓库、定位问题并修改代码的能力;
  • NL2Repo 得分为 54.2,考察模型能否根据自然语言需求生成或修改代码仓库。

在自动化方面:

  • Automation Bench 得分为 25.1,主要测试模型自动执行一系列工作任务的能力;
  • Artificial Analysis 智能指数为 50,则是对模型综合推理、知识、编码和 Agent 能力的整体评估。

DeepSeek V4 Flash 的专项成绩

简单评价

从这些成绩看,Qwen 3.8 Max 的优势是能力覆盖面广,在复杂软件工程、图表理解、视觉推理、电脑操作、移动端操作和长时任务方面表现突出,更适合让模型独立规划并完成复杂工作。

DeepSeek V4 Flash 的优势是 Agent 执行和使用成本,在终端操作、工具调用、网络安全、全栈开发和代码仓库修改方面具备较强能力,而且 API 价格较低,更适合高频调用和大规模自动化部署。

简单说,Qwen 3.8 Max 更像是“负责思考和解决复杂问题的专家”,DeepSeek V4 Flash 更像是“负责大量执行具体任务的高性价比助手”。