7月21日,英伟达宣布其BlackwellGB300在MoE预训练领域刷新了世界纪录,实现了每GPU算力达到1648TFLOPs。MoE(混合专家模型)是一种将大型模型分割为多个更小的“专家”子网络的机器学习模型架构,这种设计旨在降低计算成本,同时实现更大规模的模型容量,尤其在大语言模型中提升效率。英伟达在博文中提到,使用256块GPU预训练DeepSeek-v3671B模型时,GB300NVL72达到了每GPU吞吐1648TFLOPs的新纪录,相较于之前使用的更多GPU硬件,GB300NVL72以更少的硬件达到了相同的性能。
在过去的6个多月里,英伟达通过模拟超过25万种不同配置,为Blackwell摸索发现了38项重大优化方案,并累计进行了140万小时的GPU优化测试。与2025年11月的预训练测试结果相比,GB300NVL72系统性能优化提升了50%。此外,与上一代GB200每GPU606TFLOPs的成绩相比,GB300实现了约3倍的性能提升。


