DeepSeek-V4-Flash-Vision-Exp 多模态视觉模型开放 API 访问
8月21日,深度求索宣布多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp 在 DeepSeek API 平台上线。该模型支持在文本之外输入图片,可完成图片描述、截图文字识别、图表分析等任务,支持的图片格式包括 JPEG、PNG、GIF、WebP。官方说明这是一个实验性质模型,可通过 model=’deepseek-v4-flash-vision-exp’ 调用。

在纯文本能力方面,该模型与 DeepSeek-V4-Flash 正式版持平;在需要视觉理解的 Agent Benchmark 上,相比 DeepSeek-V4-Flash 有明显提升,多模态 Agent 能力接近 Opus-4.8。深度求索表示,V4-Flash-Vision-Exp 在各类 Agent 框架内展现出较好的多模态适配能力。
API 服务中图片会转换为 token 后按 token 计费,单张图片最多占用 384 tokens,计费价格与 V4-Flash 模型一致。多模态 API 支持 Chat Completions、Messages、Responses 三种格式调用,支持图文混合输入,并提供 base64 内联、外部 URL、Files API 三种图片传入方式。
Files API 现已开放且不收费。用户可先将图片上传到平台,再在请求中通过 file_id 引用,这样同一张图片在多个请求中无需重复上传,可节省请求带宽。






