DeepSeek多模态模型发布:V4-Flash-Vision-Exp 实验性模型上线

2026年8月21日 —— 国内 AI 大模型领军企业 DeepSeek 今日宣布,全新多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp 正式上线 DeepSeek API 平台。这是 DeepSeek 首次向多模态领域迈出实质性一步,标志着其在纯文本大模型之外,正式开启了图文融合理解的新篇章。

实验性质模型,纯文本能力不缩水

据 DeepSeek 官方介绍,V4-Flash-Vision-Exp 是一个实验性质的模型,用户可通过在 API 请求中设置 model='deepseek-v4-flash-vision-exp' 即可访问。值得关注的是,该模型在纯文本能力方面并未因加入视觉模块而做出妥协——在 Agent、推理、世界知识等公开基准测试中,V4-Flash-Vision-Exp 与 DeepSeek-V4-Flash 正式版表现持平。

而在需要视觉理解的 Agent Benchmark 上,V4-Flash-Vision-Exp 相比纯文本版本实现了大幅跃升,官方称其多模态 Agent 能力已接近 Anthropic 的 Opus-4.8 水平。

DeepSeek 支持多模态:V4-Flash-Vision-Exp 实验性模型上线

多模态能力解锁更多 Agent 场景

DeepSeek 在发布中展示了多个实际应用案例,展现了 V4-Flash-Vision-Exp 在各类 Agent 框架内的多模态适配能力:

  • 商业 PPT 生成:在 Agent 框架下,模型可根据详细提示词生成高端定制自驾游方案的完整 PPT,包含视觉风格把控与真实定价方案输出。
  • 网站二次创作:模型能够对现有网站进行风格重构,经过长多轮交互后输出未来主义风格的开发者网站设计。
  • 前端创意 Demo:支持生成带有特定视觉风格(如黏土怪物风格动态特效)的前端交互原型。

这些案例表明,DeepSeek 的多模态能力并非简单的"看图说话",而是深度融入了 Agent 工作流,能够支撑复杂的多步骤创作任务。

API 接入与计费

在 API 层面,V4-Flash-Vision-Exp 保持了与 DeepSeek 现有生态的高度兼容:

  • 调用格式:支持 Chat Completions、Messages(Anthropic 格式)、Responses 三种 API 格式调用,可无缝接入各类 Agent 工具。
  • 图片输入方式:支持 base64 内联、外部 URL、Files API 三种图片传入方式,支持图文混合输入。
  • 计费规则:图片会被转换为 token 后按 token 计费,单张图片最多占用 384 tokens,计费价格与 V4-Flash 模型一致。参考现有定价,V4-Flash 输入(缓存未命中)空闲时段为 1.5 元/百万 tokens,高峰时段为 3.0 元/百万 tokens;输出空闲时段 4.5 元/百万 tokens,高峰时段 9.0 元/百万 tokens。

此外,DeepSeek 同步上线了 Files API,该接口免费使用。用户可先将图片上传至平台,再通过 file_id 在请求中引用,从而节省请求带宽,同一张图片在多个请求中无需重复上传。

模型生态持续扩展

目前 DeepSeek API 平台提供两大主力模型:deepseek-v4-flash(已更新至 DeepSeek-V4-Flash-0731)和 deepseek-v4-pro(已更新至 DeepSeek-V4-Pro-0813),均支持 1M 上下文长度与最大 384K 输出长度,并具备思考模式、JSON Output、Tool Calls、对话前缀续写等丰富功能。此次多模态模型的加入,进一步扩展了 DeepSeek 的能力版图。

 

DeepSeek 表示,V4-Flash-Vision-Exp 目前仍处于实验阶段,团队将持续迭代优化多模态能力。对于开发者而言,这无疑是低成本探索多模态 Agent 应用的绝佳时机。