8月18日,晶圆级AI推理加速器制造商Cerebras宣布推出新一代芯片WSE-3Turbo及其基于该芯片的CS-4系统。与上一代CS-3相比,CS-4在词元容量上提升了10倍,速度翻倍。WSE-3Turbo芯片集成了90万个核心和44GB的SRAM片上缓存,其FP16稀疏AI算力、内存带宽、片上互联带宽和I/O带宽均实现了翻倍。
CS-4系统能够集成3块WSE-3Turbo芯片,显著提升了算力密度。在OpenAIGPT-OSS模型上,CS-4的词元交付速度达到4465Token/s,是GPU方案的30倍,相较于CS-3提升了93%。对于超高参数模型,CS-4的2μs低延迟晶圆间互连能在10T规模上实现超过1000Token/s的词元输出。CS-4还原生支持推理负载拆分,可作为解码单元与异构的预填充硬件配套使用,发挥双方架构上的差异化优势。
这一算力硬件基于Cerebras全新的Nexus机架式平台,计算、电源、互连三大方面现在是重新设计的独立系统,整体组件数量减少了50%,制造自动化比例大幅提升。CS-4几乎完全消除了板级供电功率损耗,为WSE-3Turbo提供了双倍的电力供给。

