今天,全新的多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp 上线 DeepSeek API 平台,这是一个实验性质的模型,用户可以通过设置 model='deepseek-v4-flash-vision-exp' 访问该模型。
平衡文本与多模态能力
- 在纯文本能力(Agent、推理、世界知识等)方面,DeepSeek-V4-Flash-Vision-Exp 与 DeepSeek-V4-Flash 正式版持平;
- 在需要视觉理解的 Agent Benchmark 上,DeepSeek-V4-Flash-Vision-Exp 相比 DeepSeek-V4-Flash 实现了大幅跃升,多模态 Agent 能力已接近 Opus-4.8。
多模态能力解锁更多 Agent 场景
V4-Flash-Vision-Exp 在各类 Agent 框架内展现出了较好的多模态适配能力,能够有效支持大家借助多样化的 Agent 工具解锁更多实用的工作场景。
示例 1:在 Agent 框架下生成商业定制西藏自驾游 PPT
Prompt:帮我做个西藏攻略的 ppt,藏南 + 藏北,一个月,自驾游,我是高端定制游,只做私人服务,和别的旅行团不一样,核心调性:野性、原始、探索感——不是常规打卡路线,是深入无人区级别的体验。视觉风格要大气、粗粝、有力量感,拒绝小清新和网红风。ppt 要发送给高净值客户,要足够大气、野性、高端美观且最后给到三种真实定价方案,所有配图使用真实摄影图片风格(实拍质感)
示例 2:对 DeepSeek Harness 官网进行二次创作
示例 3:制作黏土怪物风格动态特效的前端 Mini Demo
API 支持
用户可以通过设置 model='deepseek-v4-flash-vision-exp' 来访问 V4-Flash-Vision-Exp 模型的 API。在 API 服务中,图片会转换成 token 后按 token 计费,一张图片最多占 384 tokens,计费价格与 V4-Flash 模型一致。
多模态 API 支持 Chat Completions、Messages、Responses 三种格式调用,可以方便接入各类 Agent 工具中使用,支持图文混合输入,支持 base64 内联、外部 URL、Files API 三种图片传入方式。使用说明请参考官方 API 文档:API 指南 - 图像理解。
Files API 上线
Files API 现已开放,该 API 不收费,用户可先将图片上传到平台,再在请求中通过 file_id 引用,从而节省请求带宽。同一张图片在多个请求中无需重复上传。详细使用说明请参考官方 API 文档:API 指南 - Files API。