Technology
NVIDIA Publishes Day-0 Inference Results for Qwen3.8-2.4T-A95B on GB300 NVL72
NVIDIA published Day-0 inference results for Alibaba's Qwen3.8-2.4T-A95B on its GB300 NVL72 rack, hitting over 4,000 tokens per second per GPU in FP8. The 2.4-trillion-parameter MoE model activates only 95 billion parameters per token and ships with configurable reasoning depth.