阿里2.4T开放权重Qwen3.8-Max可在GB300 NVL72部署
阿里发布2.4T参数开放权重模型Qwen3.8-Max,采用MoE架构并支持百万token上下文,已可在NVIDIA GB300 NVL72平台部署推理,将显著影响开源旗舰模型选型与企业推理成本。
模型核心参数与架构特征
阿里巴巴发布的Qwen3.8-2.4T-A95B(又称Qwen3.8-Max)是其迄今最大的开放权重模型,总参数规模达到2.4T,推理时每个token仅激活95B参数,属于典型的稀疏混合专家架构路线[S1][S2]。这一设计意味着模型在保留超大容量知识储备的同时,不会让推理成本随全量参数线性增长,而是随实际激活的专家规模变化,为企业级部署留出了成本空间。
该模型采用细粒度MoE结构,容量被分配给更多小型专家而非少数大型专家,以提升每单位激活计算的专业化程度和路由效率[S2]。学习到的路由器会根据每个token的需求选择对应专家,因此服务成本主要跟踪活动参数而非完整的2.4T参数,使旗舰级容量能以接近稠密模型小得多的成本对外提供。
除稀疏激活外,Qwen3.8-Max还延续了Qwen系列的混合架构思路,将全注意力与线性注意力结合,为长上下文场景提供计算和内存边界控制能力[S2]。官方公开信息显示,模型上下文窗口最高可达100万token,输出长度最高支持128K,能够支撑大规模文档分析、长周期多步骤工作流等重型任务[S1][S2]。
长上下文与可配置推理的技术设计
面向长上下文推理的架构创新,是Qwen3.8-Max区别于前代旗舰的重要特征。对于代理式应用而言,系统指令、工具输出、检索文档、代码、日志和多步推理痕迹会在整个工作流中持续累积,当上下文扩展到百万token级别时,注意力计算和KV缓存会成为主要瓶颈[S2]。
为解决这一问题,模型采用全注意力层与线性注意力层交替的混合架构:在全注意力层中,每个token会关注所有其他token,保证关键信息的全局关联;在线性注意力层中,不断增长的KV缓存被替换为有界循环状态,从而在上下文扩展到100万token时仍能维持计算和内存的边界[S2]。这种设计使长文档、长对话和长链路Agent任务不再受限于显存容量和推理时延的快速膨胀。
另一项值得关注的设计是内置可配置推理控制。开发者可以为每个请求配置低、中、高三档推理深度,根据任务类型以算力换取推理质量:面对复杂多步推理时可以调高推理强度,面对高吞吐量文档处理时则可以调低强度,以兼顾成本与效率[S2]。这种可配置推理模式与当前行业中“思考模式/快速模式”的双轨思路一致,但通过统一接口实现,便于企业在不同业务场景中灵活调度。
在NVIDIA GB300 NVL72平台的推理性能表现
NVIDIA官方博客披露,Qwen3.8-2.4T-A95B在首发日无需额外模型调优,即可在NVIDIA GB300 NVL72平台上实现每GPU每秒超过4K token的吞吐量;在FP8精度下,单用户推理速度可达每秒超过350 token[S2]。这一性能数据意味着,对于企业级长文档处理和高并发Agent服务,该模型已具备可落地的吞吐基础。
NVIDIA同时提到,后续优化还将包括NVFP4精度等方向,有望随时间推移带来更高的性能提升[S2]。对于计划部署超大规模开放权重模型的企业而言,首发即有成熟的硬件与软件栈支持,意味着从模型下载到生产级部署的链路更短,风险也更低。
部署2.4T参数级别的开放权重模型,原本需要数据中心规模的加速计算支撑,且高度依赖跨芯片、系统架构和软件的协同设计。NVIDIA表示正与开源生态合作,通过优化内核、推理运行时和分布式服务方案,将该类模型引入多节点部署[S2]。GB300 NVL72平台的首发验证,也为后续更多超大型MoE模型的快速落地提供了参考路径。
面向Agent与编码场景的能力定位
Qwen3.8-Max的设计目标并非通用聊天,而是面向高要求推理与代理式工作负载,典型场景包括编码、大规模文档分析和长周期多步骤工作流[S2]。这类任务的共同特点是上下文会不断累积、需要调用工具、需要长时间保持状态稳定,并对事实一致性和步骤完整性有较高要求。
从技术路径看,混合注意力架构解决了长上下文的边界问题,细粒度MoE控制了推理成本,可配置推理则适配不同强度的任务需求,三者共同构成了Agent场景的能力底座。对于需要自主完成多文件编码、长文档审阅、多工具协同的企业智能体而言,开放权重意味着可以在自有基础设施上进行深度微调、领域适配和安全加固,而不必完全依赖闭源API。
需要说明的是,现有一手NVIDIA信源主要聚焦文本推理部署与性能,并未完整披露Qwen3.8-Max在代码、推理、长上下文等主流基准测试中的具体得分,也未给出与其他旗舰模型的横向对比数据。其在真实长任务中的端到端成功率、长上下文事实召回率等关键指标,仍需等待更多独立评测与企业落地反馈。
开放权重对开源生态与产业选型的影响
Qwen3.8-Max开放权重的发布,对开源大模型生态具有明显的标杆意义。一方面,2.4T总参数、95B激活的MoE旗舰进入开放生态,会进一步拉高开源模型的能力上限,推动研究社区和企业围绕超大MoE开展推理优化、微调方法和应用探索;另一方面,首发即获得顶级算力平台的部署验证,也会加速其在企业级推理基础设施中的渗透。
对于产业选型而言,开放权重模型的价值不仅在于能力,更在于可控性。企业可以基于开放权重进行私有化部署、领域继续训练、安全对齐和成本优化,尤其适合对数据隐私、合规性和长期成本敏感的行业。当开源旗舰模型具备接近闭源前沿模型的能力,并拥有成熟的硬件部署方案时,企业在“闭源API调用”与“自建推理栈”之间的选择会更加平衡。
不过,当前公开信息仍存在若干待明确点。例如,模型的开源协议类型与商用授权边界、在其他硬件平台上的部署可行性与性能表现、百万token上下文在真实任务中的准确率衰减曲线等,都需要更多资料和实测数据支撑。从业者在评估选型时,应重点结合自身业务场景的上下文长度、并发规模、安全要求和成本预算,而非仅依据总参数规模做判断。
总体来看,Qwen3.8-Max以2.4T参数、细粒度MoE、百万上下文和可配置推理为核心特征,加上GB300 NVL72平台的首发部署验证,标志着开放权重旗舰模型正在进入“超大参数+可落地推理”的新阶段。它不仅会推动开源生态的技术迭代,也会对企业级AI基础设施的算力规划和模型选型产生持续影响。
参考资料: [S1] NVIDIA开发者博客:Serve Qwen3.8-2.4T-A95B, a 2.4T-Parameter Model, with Configurable Reasoning on NVIDIA GB300 NVL72. https://developer.nvidia.com/blog/serve-qwen3-8-2-4t-a95b-a-2-4t-parameter-model-with-configurable-reasoning-on-nvidia-gb300-nvl72/ [S2] NVIDIA中文开发者博客:在 NVIDIA GB300 NVL72 上部署参数量达 2.4T 的 Qwen3.8-2.4T-A95B 模型,并支持可配置推理. https://developer.nvidia.cn/blog/serve-qwen3-8-2-4t-a95b-a-2-4t-parameter-model-with-configurable-reasoning-on-nvidia-gb300-nvl72/
制作记录
公开编辑轨迹,不含隐藏推理。
正在整理制作记录…
Reader Signal
这篇文章对你有帮助吗?
只收集预设选项,不开放评论,不公开展示个人反馈。
选择一个判断,也可以附加一个预设标签。
发布于 2026-08-25 07:03:14。本文由明确标注的 Aione AI 编辑 Agent 参与制作,未经授权不得转载,不构成投资建议。