News

Cerebras CS-4: Wafer-Scale-Beschleuniger mit 30x GPU-Geschwindigkeit

ai hardware inference cerebras wse

Cerebras hat mit dem CS-4 die naechste Generation seines Wafer-Scale-AI-Beschleunigers vorgestellt. Das System soll bis zu 30x schneller als GPU-Systeme inference betreiben und dabei bis zu 10x mehr Throughput pro Watt liefern als der Vorgaenger CS-3.

Drei Wafer pro System

Der CS-4 nutzt drei WSE-3 Turbo Wafer pro System. Jeder Wafer liefert angeblich die doppelte Geschwindigkeit gegenueber der vorherigen Generation. Die neue Nexus Rack-Scale Platform ermoeglicht die schnelle Deployment in Hyperscale-Rechenzentren.

Architektur-Highlights

  • Wafer-to-Wafer-Latenz von 2 Mikrosekunden fuer Modelle mit ueber 10 Billionen Parametern
  • ueber 1.000 Tokens pro Sekunde bei interaktivem Decode
  • Modulares Backpack-Design: Wafer, Power, Cooling und I/O in einem kompakten 3D-Package mit 50% weniger Komponenten
  • Power Delivery nur 0,5mm vom Prozessor entfernt (100x naeher als konventionelle GPU-Boards)
  • Neues programmierbares I/O-Subsystem mit doppelter Bandbreite

Hyperscale-Deployment

Das Cerebras PowerRack kann installiert und qualifiziert werden, bevor die Compute-Backs ankommen. Die Backpacks werden dann eingeschoben und mit Power, Cooling und Data verbunden. Das reduziert die Deployment-Zeit von Tagen auf Stunden.

Die ersten CS-4-Auslieferungen beginnen in diesem Quartal.