DeepSeek V4.1 Flash 上线国家超算互联网,开放 API 调用入口

9月10日,DeepSeek V4.1 Flash 模型在国家超算互联网中心上线。用户可登录国家超算互联网官网,从首页进入“模型服务”页面,找到该模型并打开 API 调用界面,后续可通过接口使用模型服务。

DeepSeek V4.1 Flash 上线国家超算互联网,开放 API 调用入口

DeepSeek V4.1 Flash 是一款 552B 参数的 MoE 模型。它采用 Causal-Encoder-Decoder 结构,输入和输出部分不对称,输入激活为 8B,输出激活为 16B。与已知的同尺寸模型相比,这一设计带来了更低的计算成本。

训练方面,V4.1 Flash 使用了新的预训练方式,并接受了更大规模的强化学习后训练。在基准测试中,该模型超过了包括 DeepSeek V4 Pro 在内的多款旗舰模型。

在缓存优化上,V4.1 Flash 大幅缩减了 KV Cache 的占用。与上一代模型相比,对 HBM 的需求减少到 1/4,对 SSD 的需求减少到 1/8,有利于降低推理时的硬件开销。

在 Agent 使用场景中,缓存命中费用通常在总费用中占比较高。通过压缩 KV Cache,V4.1 Flash 可以减少这部分支出,从而降低 Agent 类任务的整体使用成本。