News
Cerebras CS-4: Wafer-Scale-Beschleuniger mit 30x GPU-Geschwindigkeit
Cerebras hat mit dem CS-4 die naechste Generation seines Wafer-Scale-AI-Beschleunigers vorgestellt. Das System soll bis zu 30x schneller als GPU-Systeme inference betreiben und dabei bis zu 10x mehr Throughput pro Watt liefern als der Vorgaenger CS-3.
Drei Wafer pro System
Der CS-4 nutzt drei WSE-3 Turbo Wafer pro System. Jeder Wafer liefert angeblich die doppelte Geschwindigkeit gegenueber der vorherigen Generation. Die neue Nexus Rack-Scale Platform ermoeglicht die schnelle Deployment in Hyperscale-Rechenzentren.
Architektur-Highlights
- Wafer-to-Wafer-Latenz von 2 Mikrosekunden fuer Modelle mit ueber 10 Billionen Parametern
- ueber 1.000 Tokens pro Sekunde bei interaktivem Decode
- Modulares Backpack-Design: Wafer, Power, Cooling und I/O in einem kompakten 3D-Package mit 50% weniger Komponenten
- Power Delivery nur 0,5mm vom Prozessor entfernt (100x naeher als konventionelle GPU-Boards)
- Neues programmierbares I/O-Subsystem mit doppelter Bandbreite
Hyperscale-Deployment
Das Cerebras PowerRack kann installiert und qualifiziert werden, bevor die Compute-Backs ankommen. Die Backpacks werden dann eingeschoben und mit Power, Cooling und Data verbunden. Das reduziert die Deployment-Zeit von Tagen auf Stunden.
Die ersten CS-4-Auslieferungen beginnen in diesem Quartal.