DeepSeek发布V4.1 Flash 552B MoE模型并以MIT许可开源
DeepSeek于2026年9月10日发布V4.1 Flash 552B参数MoE模型并以MIT许可开源,采用非对称架构与极致KV Cache压缩,基准测试超越V4 Pro,将显著降低Agent类任务推理成本。
发布核心事实
2026年9月10日,DeepSeek正式发布V4.1 Flash 552B参数MoE模型,并以MIT许可向全球开发者开源[S1]。该模型是DeepSeek全新模型结构系列中的最小尺寸型号,设计目标为能力上限更高、推理速度更快、吞吐更大,并可平滑扩展到更大参数规模的模型[S2]。
与此前多数多模态模型依赖外挂视觉模块不同,V4.1 Flash具备原生多模态视觉理解能力,能够直接处理图文混合输入,无需额外的视觉编码器适配[S3]。模型开源地址位于Hugging Face的deepseek-ai/DeepSeek-V4.1-Flash仓库,官方同时发布了配套技术报告,详细披露架构设计与性能数据[S11]。
非对称架构创新
V4.1 Flash最核心的技术突破在于采用了全新的非对称Causal-Encoder-Decoder结构。作为总参数达552B的MoE混合专家模型,其输入阶段仅激活8B参数,输出阶段激活16B参数,通过输入输出不对称的计算设计,在保持大模型容量优势的同时,显著降低了实际推理成本[S1]。
这种非对称架构的逻辑在于:输入侧主要负责理解与编码任务,不需要全量参数参与;而输出侧需要生成高质量、高一致性的结果,因此分配更多激活参数。官方数据显示,该架构下的单位Token计算成本显著低于已知同尺寸模型,实现了“小成本跑大任务”的设计目标[S2]。
除架构创新外,V4.1 Flash还采用了新的预训练方式,并经过更大规模的强化学习后训练,在基准测试中成功超越了包括DeepSeek V4 Pro在内的多款旗舰模型的智能水平[S4]。
KV Cache压缩突破
在推理成本优化方面,V4.1 Flash实现了KV Cache的大幅压缩。与上一代模型相比,新模型对HBM显存的需求降至原来的1/4,对SSD存储的需求降至原来的1/8;若相对于DeepSeek初代模型,KV Cache规模已缩小437倍[S2]。
KV Cache是大模型长上下文推理中的主要存储开销来源,尤其在Agent智能体场景中,由于系统提示词、工具调用历史、对话记忆等内容需要反复读取,缓存命中的费用往往占总调用成本的较高比例。KV Cache的极致压缩,意味着Agent类任务的单位调用成本将出现显著下降,对需要长期运行、持续交互的智能体应用尤为重要[S5]。
技术层面,新模型通过Compressed Sparse Attention 2(CSA2)机制为每个注意力层分配Full、Reindex、Reuse三种静态模式,实现跨层KV数据共享与稀疏注意力索引复用,避免重复计算;同时叠加采用E2M1格式的FP4 KV缓存技术,配合每16通道的缩放因子,在不单独执行量化步骤的前提下进一步压缩显存占用[S9]。
性能表现
以下基准测试数据均来自官方披露。根据官方披露的19项测评结果,V4.1 Flash有14项指标超过V4 Pro,整体能力刷新了DeepSeek模型的性能上限[S7]。
在智能体基准测试中,V4.1 Flash表现尤为突出:在DeepSWE v1.1软件工程评测、CyberGym网络安全环境评测、Automation-Bench通用自动化评测三项核心基准中,其得分超过Kimi K3、GLM 5.3、Opus 5、GPT 5.6 Sol等主流前沿模型;仅在Terminal-Bench 3.0终端复杂任务评测中,得分略低于Opus 5与GPT 5.6 Sol,整体智能体能力已进入全球前沿模型梯队[S7]。
具体单项数据方面,V4.1 Flash在Terminal-Bench 2.1测试中得分达90.6,DeepSWE v1.1得分为74.2,Automation-Bench得分为54.8,代码与自动化代理任务表现接近或优于V4 Pro版本[S8]。
值得注意的是,目前官方尚未披露该模型在多模态视觉理解任务上的具体评测数据与行业对比表现,非对称Causal-Encoder-Decoder架构的详细技术实现细节也有待技术报告的进一步解读。第三方独立机构对模型性能、安全性、幻觉率的全面评测结果,以及实际部署中的推理速度、吞吐量、硬件需求等工程化指标,仍需后续持续观察。
API与商业化
V4.1 Flash发布当日即同步上线DeepSeek API服务,开发者将模型名称更改为deepseek-flash即可调用最新版本。旧版V4 Flash与V4 Flash Vision Exp已临时路由至新模型,保障业务平滑过渡[S3]。
定价方面,自2026年9月10日12时起Flash系列执行新的价格体系,并延续峰谷分时计价策略。空闲时段输入缓存命中价格为0.02元/百万Token,输入未命中为1元/百万Token,输出为4元/百万Token,其中缓存命中输入价格较此前降幅达60%;高峰时段(周一至周五9:00-12:00、14:00-18:00)价格为空闲时段的两倍[S6]。
此外,官方计划于2026年9月14日12:00后,将deepseek-v4-pro的请求也转接至V4.1 Flash并按新价格计费,意味着Pro级用户也将享受到新架构带来的成本优化与性能提升[S8]。
开源生态价值
MIT许可的开源策略,加上Rust工具链的配套支持,使V4.1 Flash对开发者与产业界具备较高的落地价值。模型附带基于Rust开发的prompt编码工具deepseek-recipe,默认不包含Jinja聊天模板,开发者可根据自身需求灵活定制提示词编码逻辑[S9]。
对于开源生态而言,552B参数规模的MoE模型以MIT协议开放,意味着企业与研究者可以免费商用、修改、再分发,无需承担复杂的授权成本与法律风险,有助于推动大模型在垂直行业的深度落地。尤其是其非对称架构与KV Cache压缩技术路线,为行业探索“大参数、低成本”的模型设计提供了可参考的实践样本。
制作记录
公开编辑轨迹,不含隐藏推理。
正在整理制作记录…
Reader Signal
这篇文章对你有帮助吗?
只收集预设选项,不开放评论,不公开展示个人反馈。
选择一个判断,也可以附加一个预设标签。
发布于 2026-09-11 07:07:27。本文由明确标注的 Aione AI 编辑 Agent 参与制作,未经授权不得转载,不构成投资建议。