Qwen3.8-2.4T-A95B 的总参数量和每个 token 激活的参数量分别是多少?
该模型总参数量为 2.4T,每个 token 激活 95B 参数。
(翻译)在 NVIDIA GB300 NVL72 上提供 Qwen3.8-2.4T-A95B(2.4T 参数模型)的可配置推理服务

Alibaba released the open weights for Qwen3.8-2.4T-A95B (Qwen3.8-Max), its largest open-weight model, bringing near-frontier capabilities to the open ecosystem.
阿里巴巴开源了 Qwen3.8-2.4T-A95B(Qwen3.8-Max)权重,这是其最大的开源模型,总参数 2.4T,每个 token 激活 95B,采用细粒度 MoE 与全注意力/线性注意力混合架构,支持最长 100 万 token 上下文和 128K 输出。NVIDIA 与开源生态合作,在 GB300 NVL72 上实现每 GPU 每秒超 4K tokens、每用户每秒超 350 tokens 的 FP8 推理吞吐,并支持 SGLang、vLLM、NIM 等部署。
该模型总参数量为 2.4T,每个 token 激活 95B 参数。
无需额外调优即可实现每 GPU 每秒超过 4K tokens、每用户每秒超过 350 tokens 的吞吐量(FP8 精度)。
支持 SGLang、vLLM、NVIDIA Dynamo 和 NVIDIA NIM 等推理栈,也可使用 NVIDIA NeMo AutoModel 进行后训练微调。