IT之家8月19日消息,晶圆级AI推理加速器制造商Cerebras当地时间18日宣布推出其新一代芯片WSE-3Turbo和基于该芯片的CS-4系统。与上代CS-3相比,CS-4带来了10倍的词元容量和2倍的速度。
与此前的WSE-3类似,WSE-3Turbo集成了90万个核心和44GB SRAM片上缓存,但其FP16稀疏AI算力、内存带宽、片上互联带宽、I/O带宽均实现翻倍。而CS-4系统则可集成3块WSE-3Turbo,进一步提升了算力密度。
Cerebras表示,CS-4在OpenAI GPT-OSS模型上拥有4465Token/s的词元交付速度,是GPU方案的30倍,同时较CS-3提升93%。对于超高参数模型,CS-4的2μs低延迟晶圆间互连则能在10T规模上实现超1000Token/s的词元输出。
CS-4 原生支持推理负载拆分,可作为解码单元与异构的预填充硬件配套使用,发挥双方架构上的差异化优势。
这一算力硬件基于Cerebras全新的Nexus机架式平台,计算、电源、互连3大方面现在是重新设计的独立系统,整体组件数量减少了50%,制造自动化比例大幅提升。CS-4几乎完全消除了板级供电功率损耗,为WSE-3Turbo提供了双倍的电力供给。
