
Cerebras CS-4, WSE-3T 탑재로 GPU 랙 대비 30배 빠른 AI 추론
웨이퍼 스케일 엔진 칩 개발사인 Cerebras가 새로운 WSE-3 Turbo 칩을 탑재한 최신 CS-4 솔루션을 출시했다.
Cerebras는 2024년 3세대 웨이퍼 스케일 엔진(WSE-3)을 공개했다. 이 웨이퍼는 단일 칩으로 작동하며 방대한 컴퓨팅 기능을 제공한다. Cerebras는 웨이퍼 스케일 칩 개발 초기부터 이 분야를 선도해 왔으며, 이번에 웨이퍼 스케일 여정의 다음 장을 공개했다.
Cerebras의 CEO이자 공동 창립자인 앤드류 펠드만(Andrew Feldman)은 “AI에서 속도는 생산성이다. 과거에는 빠른 추론을 위해 더 작고 성능이 낮은 모델을 사용해야 했다. Cerebras CS-4는 가장 큰 최신 모델에서 업계 최고 속도를 제공하며 패러다임을 근본적으로 변화시킨다. 모든 설계 측면이 대규모 처리량으로 최고 속도를 제공하도록 최적화되었다. CS-4를 통해 AI는 제품 경험을 근본적으로 재구성할 만큼 빨라졌다”고 말했다.
새로운 WSE-3 Turbo(WSE-3T) 칩은 WSE-3의 후속작이다. 이 칩은 '가장 큰 AI 프로세서'라는 위상을 유지하며, 4조 개의 트랜지스터와 90만 개의 코어를 동일하게 탑재했다. 전체 칩 면적은 46,225mm2이며, 동일한 웨이퍼에 직접 통합된 44GB의 SRAM을 갖췄다.
고수준 성능 측면에서 WSE-3T는 웨이퍼당 125 PFLOPs(희소성 적용 시 250 PFLOPS)로 AI 컴퓨팅 성능을 두 배로 높였으며, 대역폭은 43.2 PB/s로 증가했다. 온칩 패브릭은 53.5 PB/s의 대역폭을 제공하며, 오프칩 I/O는 2.4 Tb/s의 대역폭을 제공한다. 웨이퍼 스케일 엔진 업데이트를 통해 지연 시간은 5ms에서 2ms로 단축되었다.
현재 공개된 칩에 대한 정보는 여기까지지만, 오늘날의 AI는 다르다. 칩은 필수적인 구성 요소이지만, AI 고객은 칩이 아닌 시스템과 원스톱 솔루션을 추구한다. 이에 따라 Cerebras는 최신 CS-4 랙 스케일 솔루션에 WSE-3T 칩을 탑재했다.
Cerebras에 따르면 CS-4는 컴퓨팅, 전력, I/O의 세 가지 계층을 포함하는 모듈식 개념을 중심으로 하는 새로운 Nexus 플랫폼 아키텍처를 기반으로 한다. 각 랙은 플러그형 백팩 설계를 특징으로 하며, 컴퓨팅 서브시스템은 전력 어레이에 수직으로 부착되는 '백팩' 형태로 후면에 장착된다.
이러한 각 독립형 웨이퍼 스케일 '백팩'은 전력 변환, 직접 액체 냉각, 고속 I/O 및 제어 시스템을 소형 패키지에 통합했다.
새로운 설계는 전력 변환을 웨이퍼에 더 가깝게 배치하여 전력 손실을 거의 완전히 제거한다. 손실이 줄어들면서 더 많은 전력을 WSE 칩에 공급할 수 있으며, 이는 엔진에 두 배의 전력을 제공하여 더 높은 주파수와 더 빠른 컴퓨팅을 가능하게 한다.
회사는 GPT-OSS 120B와 같은 모델에서 상당한 컴퓨팅 처리량 기능을 주장한다. 단일 CS-4 랙은 이 모델에서 초당 4,400개 이상의 토큰을 제공한다. GPU 기반 AI 솔루션과도 비교되었다. CS-4가 1초 만에 생성하는 작업을 GPU 랙은 30초가 걸렸다.
전반적으로 Cerebras는 CS-4가 CS-3 대비 와트당 처리량에서 10배 증가했다고 주장한다. 각 CS-4 랙은 3개의 WSE-3T(Turbo) 칩을 제공하며, 750 PFLOPs의 AI 컴퓨팅, 7.2 Tb/s의 I/O 대역폭, 129.6 PB/s의 SRAM 대역폭을 제공한다. 새로운 인터커넥트 솔루션을 통해 AI 팩토리는 CS-4를 대규모 클러스터로 확장하여 50조 개 이상의 파라미터를 가진 모델을 지원할 수 있다.
WSE-3T를 탑재한 첫 CS-4 출하는 이번 분기에 시작될 예정이며, NVIDIA가 주요 경쟁사 중 하나다. Cerebras는 또한 AMD와 협력하여 웨이퍼 스케일 랙 솔루션을 Helios AI 랙과 함께 활용하여 더 높은 AI 처리량을 달성하고 있다. 이는 NVIDIA가 Groq 3 LPX 랙을 활용하여 KV 캐시를 이 칩에 내장된 대규모 SRAM으로 오프로드하는 방식과 유사하다.
출처: Wccftech
원문: https://wccftech.com/cerebras-cs-4-generates-in-1-second-what-a-gpu-rack-needs-30-seconds-for-powered-by-4-trillion-transistor-wse-3-turbo/



