NVIDIA Technical Blog 发布于 08/13 02:23

Serve Qwen3.8-2.4T-A95B, a 2.4T-Parameter Model, with Configurable Reasoning on NVIDIA GB300 NVL72

(翻译)在 NVIDIA GB300 NVL72 上提供 Qwen3.8-2.4T-A95B(2.4T 参数模型)的可配置推理服务

查看原文

资讯摘要

Alibaba released the open weights for Qwen3.8-2.4T-A95B (Qwen3.8-Max), its largest open-weight model, bringing near-frontier capabilities to the open ecosystem.

AI 摘要

阿里巴巴开源了 Qwen3.8-2.4T-A95B(Qwen3.8-Max)权重,这是其最大的开源模型,总参数 2.4T,每个 token 激活 95B,采用细粒度 MoE 与全注意力/线性注意力混合架构,支持最长 100 万 token 上下文和 128K 输出。NVIDIA 与开源生态合作,在 GB300 NVL72 上实现每 GPU 每秒超 4K tokens、每用户每秒超 350 tokens 的 FP8 推理吞吐,并支持 SGLang、vLLM、NIM 等部署。

AI 问答

Qwen3.8-2.4T-A95B 的总参数量和每个 token 激活的参数量分别是多少?

该模型总参数量为 2.4T,每个 token 激活 95B 参数。

该模型在 NVIDIA GB300 NVL72 上实现了怎样的推理性能?

无需额外调优即可实现每 GPU 每秒超过 4K tokens、每用户每秒超过 350 tokens 的吞吐量(FP8 精度)。

开发者可以通过哪些推理栈或工具部署或微调该模型?

支持 SGLang、vLLM、NVIDIA Dynamo 和 NVIDIA NIM 等推理栈,也可使用 NVIDIA NeMo AutoModel 进行后训练微调。

打开原文