DeepSeek V4.1 Flash模型发布:原生多模态视觉理解,API定价下调
2026年9月10日,深度求索正式发布DeepSeek V4.1 Flash模型。该模型是全新模型结构系列中尺寸最小的版本,具备原生多模态视觉理解能力。官方介绍,新结构在能力上限、推理速度、吞吐量以及向更大参数模型扩展等方面进行了调整。

DeepSeek V4.1 Flash是552B参数的MoE模型,采用Causal-Encoder-Decoder结构,输入输出不对称,输入激活为8B,输出激活为16B。官方称其成本明显低于已知同尺寸模型。该模型使用新的预训练方式,并经过更大规模的强化学习后训练,在基准测试中超过了DeepSeek V4 Pro等旗舰模型。与此前版本相比,V4.1 Flash的KV Cache大幅减少,对HBM的需求降至1/4,对SSD的需求降至1/8,这有助于降低Agent类任务中缓存命中带来的费用。相对初代模型,其KV Cache为原来的1/437。
目前,DeepSeek V4.1 Flash已在DeepSeek API上线,用户将模型名称改为deepseek-flash即可调用。旧版本V4 Flash和V4 Flash Vision Exp已下线,模型名deepseek-v4-flash、deepseek-v4-flash-vision-exp会暂时路由到V4.1 Flash。官方表示,经过多方测试,V4.1 Flash在性能、费用、速度、总用时等指标上已全面超越V4 Pro,因此计划有序下线V4 Pro模型。北京时间2026年9月14日12:00之后、至未来V4.1 Pro上线之前,访问deepseek-v4-pro的请求将全部路由到V4.1 Flash,并按V4.1 Flash单价计费。腾讯WorkBuddy、CodeBuddy以及OpenCode已全量接入该模型。
定价方面,DeepSeek V4.1 Flash继续采用峰谷定价,闲时价格为高峰时段价格的一半。新价格于2026年9月10日12:00开始生效。模型已在Hugging Face开源,技术报告同步公开。






