AI 新品汇|8月12-13日:多款模型扎堆上线,Agent 时代全面开卷

过去两天,AI 圈仿佛约好了一样集体发新品——Google、DeepSeek、xAI、阿里几乎前后脚亮出各自的重磅更新。从 1.6 万亿参数的 MoE 旗舰到 2.4 万亿参数的开源巨兽,从价格腰斩到 Agent 框架开源,这一轮密集发布的共同主题只有一个:让 AI 不只是回答问题,而是把活干完。以下是五款新品的详细解读。

一、Google DeepMind:Gemini 3.7 Flash — 三周迭代,价格再砍半

Gemini 3.7 Flash 于 8 月 13 日正式发布,距离上一代 Gemini 3.6 Flash 仅过去三周。Google 明确表示,这不是一个全新的预训练模型,而是在 3.6 Flash 基础上进行算法改进的精炼版本——但"精炼"的幅度相当可观。

核心升级:

  • 编码能力跃升:FrontierCode 1.1 Main 从 34.4% 提升至 43.6%,DeepSWE v1.1 从 49.0% 提升至 65.3%,WebDev Arena Elo 从 1538 升至 1588。调试、修 Bug、生成生产级代码的一次通过率显著提高。
  • 知识工作与 Web 开发:文本提示即可生成可玩的 3D 游戏、交互式落地页,或将 PDF 年报转成带图表的交互式网页。
  • 开发体验优化:遇到障碍会自己适应,需要澄清时主动提问,多步骤规划和工具调用更稳定,手动盯控和返工的次数显著减少。

规格参数: 支持文本、图像、音频、视频输入,1M token 上下文窗口,最大输出 64K token,支持可定制的思考配置(在质量、成本与延迟之间灵活权衡)。知识截止 2026 年 3 月。

定价: 2026 年底前体验价为输入 $0.75/百万 token、输出 $3.75/百万 token——是原 3.6 Flash 定价的一半。按 80/20 输入输出混合计算,每百万 token 约 $1.35,仅为 Claude Sonnet 5($3.60)和 GPT-5.6 Terra($4.00)的三分之一左右。对大规模跑 Agent 的团队来说,这个"智能每美元"的差距相当有说服力。

值得注意的是,3.7 Flash 已同步接入 Gemini Spark(面向 Google AI Pro/Ultra 订阅用户的 24/7 个人 Agent),在 160 多个国家可用。

二、DeepSeek-V4-Pro 正式版:1.6 万亿参数,价格不到 Fable 5 的 2%

8 月 12 日深夜至 13 日凌晨,DeepSeek 将 V4 Pro 从预览版正式转正,版本号更新为 DeepSeek-V4-Pro-0813。没有发布会、没有博客文章,唯一的变化是官网 API 定价页上的一行字。这种"闷声发大模型"的风格,确实很 DeepSeek。

核心规格:

  • 架构:混合专家(MoE)模型,总参数 1.6 万亿,每 token 激活 490 亿参数
  • 上下文:100 万 token,最大输出 38.4 万 token(384K)
  • 接口:原生支持 OpenAI Responses API 格式,兼容 Anthropic API 格式,支持 Tool Calls、结构化 JSON 输出,Beta 阶段支持对话前缀续写与 FIM 补全
  • 思考模式:支持 low / high / max 三档思考强度,可根据任务复杂度灵活选择

性能表现: 正式版大幅增强了 Agent 能力。编程智能体测试 DeepSWE 从预览版的 12.8 跃升至 62.7;多项指标逼近 Claude Fable 5,而价格仅为后者的约 2%(输入 $0.435/百万 token,输出 $0.87/百万 token,对比 Fable 5 的输入 $10、输出 $50)。

定价调整预告: 官方同时宣布将引入"峰谷定价"机制——闲时价格为高峰时段的一半,高峰时段为北京时间 9:00-12:00、14:00-18:00,新价格将于 8 月 17 日生效。另外,定价页面上还挂了一句话:“近期会有一次显著的价格调整”——至于涨多少,暂未公布。想用低价窗口薅羊毛的开发者,建议抓紧。

三、DeepSeek Harness v0.1:一切皆插件的开源 Agent 框架

如果说 V4 Pro 是 DeepSeek 的"大脑",那么 Harness 就是它的"执行神经系统"。8 月 13 日晚间,DeepSeek Harness 团队正式发布 v0.1 开发者预览版,面向全球开发者开放测试,同步以 MIT 协议开源。

这是什么? Harness 是 DeepSeek 自主研发的开源智能体框架(Agent Harness),负责调度工具、管理任务状态和执行闭环,将模型的推理能力转化为能实际完成复杂任务的智能体。官方给出的公式很简洁:Model + Harness = Agent。

设计核心——“一切皆插件”:

Harness 基于具有时空可组合性的 Cordis 插件系统构建,模型、工具、技能、会话、沙箱、存储、循环、调度、UI 等所有 Agent 能力均由插件组合而成,可自由替换、灵活重组。开发者无需改动源码本身,就能以插件方式独立选择、替换或扩展任一能力。

四种运行模式:

  • 标准模式:提供完整的工具组合
  • PTC 模式(程序化工具调用):由模型生成一段代码来组合多轮工具调用
  • 极简模式:仅保留一个 shell 工具与一个文件编辑工具,用于最小环境下的模型基准测试
  • 创造模式:可检查当前运行时、在内存中试验插件,并据此组合和创作新的模式

可追溯性: 模型看到的一切——系统提示词、思维链、工具调用与结果、子 Agent 调度——均被完整记录在仅追加(append-only)的会话日志中,支持恢复、分叉、检索与回放。

在产品定位上,Harness 对标 OpenAI Codex 及 Anthropic Claude Code,主打编程和办公场景。团队于 2026 年 5 月内部立项,由前 Jane Street 量化交易员崔添翼担任负责人。快速体验命令:npx @deepseek-ai/dsh web。

四、xAI 发布 Grok 4.6:后训练升级,长流程 Agent 是主角

xAI(现已并入 SpaceX,官方名称为 SpaceXAI)于 8 月 12 日发布 Grok 4.6,距上一代 Grok 4.5(7 月 16 日发布)不到一个月。这不是一个更大的基座模型,而是在 Grok 4.5 基础上进行更长的补充训练、重新生成 SFT 轨迹、并在 Agent 环境中做强化学习的后训练升级。

核心能力:

  • 长时间运行 Agent:能跨多步骤持续执行任务——研究某个主题、分析信息、在整个代码库中作业,或将一个想法转化为完善的应用程序,且在更长任务过程中进行自主测试与验证
  • 基准表现:Artificial Analysis 智能指数得分 61,与 GPT-5.6 Sol Max 持平,仅略低于 Fable 5 Max 的 62 分;GDPVal-AA v2(模拟真实工作任务)从 Grok 4.5 的 1526 升至 1753;CursorBench v3.2 从 66.7% 升至 69.9%
  • 规格:500K 上下文窗口,支持文本和图像输入,新增 xhigh 推理强度级别
  • 可用性:即日上线 Cursor、Grok Build、API、OpenRouter、Vercel 与 Cloudflare

定价: 输入 $2/百万 token,输出 $6/百万 token(超过 200K prompt token 时价格翻倍)。相比部分竞争对手约为其一半,xAI 显然在用"高性能+低成本"策略抢攻开发者市场。

短板: 在 DeepSWE 和 Terminal-Bench 等终端/计算机操作类测试中仍落后于 GPT-5.6 Terra,代码开发上有一定短板。另外,不提供开放权重,无法自托管。

五、Qwen3.8-2.4T-A95B 开源:阿里首次开放 Max 级旗舰权重

8 月 13 日,阿里千问团队正式开放 Qwen3.8-2.4T-A95B 模型权重。这是 Qwen-Max 级别模型首次开源,也是本次新品潮中"体量"最大的一位选手。

核心规格:

  • 架构:MoE 稀疏架构,总参数 2.4 万亿(2.4T),每 token 激活 950 亿参数(95B)
  • 专家配置:每个 MoE 层包含 512 个专家,每 token 选择 10 个路由专家 + 1 个共享专家
  • 注意力机制:延续 Qwen3.5 的混合架构——92 层中约 3/4 为 Gated DeltaNet(线性注意力),1/4 为 Gated Attention(全注意力)
  • 上下文:原生支持 262,144 token,可扩展至约 101 万 token
  • 推理模式:默认以思考模式运行,不支持关闭

性能表现: 官方云端版 Qwen3.8-Max 在 PaperBench(论文复现)中取得 93.0 分,高于 GPT-5.6 Sol、Fable 5 和 Claude Opus 4.8;OSWorld-Verified(电脑操作)86.1 分居参评模型首位;参数化 CAD 基准 91.5 分同样领先。但在 SWE-bench Pro 上落后于 Fable 5,TerminalBench 2.1 略低于 GPT-5.6 Sol。

开源亮点与限制: 开放版本为纯文本(text-only),仅支持思考模式,原生上下文 262K。视觉输入、non-thinking 模式、默认 1M 上下文及内置工具等能力保留在云端 Qwen3.8-Max 中。许可证从 Qwen3 时代的 Apache 2.0 改为自定义的 Qwen3.8-Max License——仍允许广泛使用和修改,但商业产品超过 1 亿月活或月收入超过 2000 万美元需展示模型名称,MaaS 业务超过特定收入门槛需另行取得许可。

部署方面: 可通过 SGLang、vLLM 和 TokenSpeed 推理引擎部署。第三方团队 Unsloth AI 已用动态 1-bit 分层选择性量化技术将 4.9TB 的模型压缩至 397GB(缩减 91%),设备内存+显存总量达 410GB 以上即可本地运行。更小杯的 Qwen3.8-27B 也已在路上。

写在最后

把五款产品放在一起看,趋势已经非常清晰:

Agent 是唯一的战场。 无论是 Gemini 3.7 Flash 强调"多步骤规划和工具调用更稳定"、DeepSeek 直接开源 Agent 框架、Grok 4.6 主打"长时间运行 Agent"、还是 Qwen3.8 展示连续自主编程 16 天——所有玩家都在回答同一个问题:模型能不能脱离人工陪伴,自己把一个复杂任务从头到尾做完?

价格战仍在加速。 Gemini 3.7 Flash 体验价砍半,DeepSeek 的价格已经低到让对手"差了两个数量级",Grok 4.6 也试图以低于竞品一半的价格切入。对于开发者来说,这大概是最幸福的烦恼了。