<img height="1" width="1" style="display:none" src="https://www.facebook.com/tr?id=1390824249408914&amp;ev=PageView&amp;noscript=1"> Cerebras CS-4, WSE-3T 탑재로 GPU 랙 대비 30배 빠른 AI 추론 : 다나와 DPG는 내맘을 디피지

비교하고 잘 사는, 다나와 : 가격비교 사이트

다나와 앱
다나와 앱 서비스 목록
다나와 APP
다나와 가격비교 No.1 가격비교사이트 다나와 앱으로
간편하게 최저가를 확인하세요.
- -
QR코드
빈 이미지
다나와 앱 서비스 목록 닫기
PC

Cerebras CS-4, WSE-3T 탑재로 GPU 랙 대비 30배 빠른 AI 추론

IP
2026.08.20. 10:03:11
조회 수
71
2
댓글 수
2

공유하기

레이어 닫기

지금 보는 페이지가 마음에 든다면
공유하기를 통해 지인에게 소개해 주세요.

로그인 유저에게는 공유 활동에 따라
다나와 포인트가 지급됩니다.

자세히 >

URL이 복사되었습니다.
원하는 곳에 붙여넣기(Ctrl+V)하세요.

레이어 닫기
해외 주요 IT 기사를 번역한 내용입니다. 일부 표현이 원문과 다를 수 있으니 참고해주세요.

Cerebras CS-4, WSE-3T 탑재로 GPU 랙 대비 30배 빠른 AI 추론

Cerebras CS-4, WSE-3T 탑재로 GPU 랙 대비 30배 빠른 AI 추론

웨이퍼 스케일 엔진 칩 개발사인 Cerebras가 새로운 WSE-3 Turbo 칩을 탑재한 최신 CS-4 솔루션을 출시했다.

Cerebras는 2024년 3세대 웨이퍼 스케일 엔진(WSE-3)을 공개했다. 이 웨이퍼는 단일 칩으로 작동하며 방대한 컴퓨팅 기능을 제공한다. Cerebras는 웨이퍼 스케일 칩 개발 초기부터 이 분야를 선도해 왔으며, 이번에 웨이퍼 스케일 여정의 다음 장을 공개했다.

Cerebras의 CEO이자 공동 창립자인 앤드류 펠드만(Andrew Feldman)은 “AI에서 속도는 생산성이다. 과거에는 빠른 추론을 위해 더 작고 성능이 낮은 모델을 사용해야 했다. Cerebras CS-4는 가장 큰 최신 모델에서 업계 최고 속도를 제공하며 패러다임을 근본적으로 변화시킨다. 모든 설계 측면이 대규모 처리량으로 최고 속도를 제공하도록 최적화되었다. CS-4를 통해 AI는 제품 경험을 근본적으로 재구성할 만큼 빨라졌다”고 말했다.

새로운 WSE-3 Turbo(WSE-3T) 칩은 WSE-3의 후속작이다. 이 칩은 '가장 큰 AI 프로세서'라는 위상을 유지하며, 4조 개의 트랜지스터와 90만 개의 코어를 동일하게 탑재했다. 전체 칩 면적은 46,225mm2이며, 동일한 웨이퍼에 직접 통합된 44GB의 SRAM을 갖췄다.

고수준 성능 측면에서 WSE-3T는 웨이퍼당 125 PFLOPs(희소성 적용 시 250 PFLOPS)로 AI 컴퓨팅 성능을 두 배로 높였으며, 대역폭은 43.2 PB/s로 증가했다. 온칩 패브릭은 53.5 PB/s의 대역폭을 제공하며, 오프칩 I/O는 2.4 Tb/s의 대역폭을 제공한다. 웨이퍼 스케일 엔진 업데이트를 통해 지연 시간은 5ms에서 2ms로 단축되었다.

현재 공개된 칩에 대한 정보는 여기까지지만, 오늘날의 AI는 다르다. 칩은 필수적인 구성 요소이지만, AI 고객은 칩이 아닌 시스템과 원스톱 솔루션을 추구한다. 이에 따라 Cerebras는 최신 CS-4 랙 스케일 솔루션에 WSE-3T 칩을 탑재했다.

Cerebras에 따르면 CS-4는 컴퓨팅, 전력, I/O의 세 가지 계층을 포함하는 모듈식 개념을 중심으로 하는 새로운 Nexus 플랫폼 아키텍처를 기반으로 한다. 각 랙은 플러그형 백팩 설계를 특징으로 하며, 컴퓨팅 서브시스템은 전력 어레이에 수직으로 부착되는 '백팩' 형태로 후면에 장착된다.

이러한 각 독립형 웨이퍼 스케일 '백팩'은 전력 변환, 직접 액체 냉각, 고속 I/O 및 제어 시스템을 소형 패키지에 통합했다.

새로운 설계는 전력 변환을 웨이퍼에 더 가깝게 배치하여 전력 손실을 거의 완전히 제거한다. 손실이 줄어들면서 더 많은 전력을 WSE 칩에 공급할 수 있으며, 이는 엔진에 두 배의 전력을 제공하여 더 높은 주파수와 더 빠른 컴퓨팅을 가능하게 한다.

회사는 GPT-OSS 120B와 같은 모델에서 상당한 컴퓨팅 처리량 기능을 주장한다. 단일 CS-4 랙은 이 모델에서 초당 4,400개 이상의 토큰을 제공한다. GPU 기반 AI 솔루션과도 비교되었다. CS-4가 1초 만에 생성하는 작업을 GPU 랙은 30초가 걸렸다.

전반적으로 Cerebras는 CS-4가 CS-3 대비 와트당 처리량에서 10배 증가했다고 주장한다. 각 CS-4 랙은 3개의 WSE-3T(Turbo) 칩을 제공하며, 750 PFLOPs의 AI 컴퓨팅, 7.2 Tb/s의 I/O 대역폭, 129.6 PB/s의 SRAM 대역폭을 제공한다. 새로운 인터커넥트 솔루션을 통해 AI 팩토리는 CS-4를 대규모 클러스터로 확장하여 50조 개 이상의 파라미터를 가진 모델을 지원할 수 있다.

WSE-3T를 탑재한 첫 CS-4 출하는 이번 분기에 시작될 예정이며, NVIDIA가 주요 경쟁사 중 하나다. Cerebras는 또한 AMD와 협력하여 웨이퍼 스케일 랙 솔루션을 Helios AI 랙과 함께 활용하여 더 높은 AI 처리량을 달성하고 있다. 이는 NVIDIA가 Groq 3 LPX 랙을 활용하여 KV 캐시를 이 칩에 내장된 대규모 SRAM으로 오프로드하는 방식과 유사하다.

출처: Wccftech
원문: https://wccftech.com/cerebras-cs-4-generates-in-1-second-what-a-gpu-rack-needs-30-seconds-for-powered-by-4-trillion-transistor-wse-3-turbo/

공감/비공감

공감/비공감안내도움말 보기
유용하고 재미있는 정보인가요?
공감이 된다면 공감 버튼을, 그렇지 않다면 비공감 버튼을 눌러 주세요!
공감이나 비공감을 선택 하는 경우 다나와 포인트를 적립해 드립니다. ※ 공감 버튼의 총 선택 횟수는 전체 공개입니다. 비공감 버튼의 선택 여부는 선택한 본인만 알 수 있습니다.

PC_Weekly 님의 다른 글 보기

1/8
컴퓨터 상품포럼 최신 글 전체 둘러보기
1/1
PC 퀄컴, 스냅드래곤 C 전력 효율 벤치마크 일부 철회 (1)
PC 새로운 쿨링과 튜닝의 시작, 러빙쿨(LOVINGCOOL) 국내 론칭 사전예약 특가 진행 (2)
PC (주)에이원아이엔티, 시그니처 80PLUS GOLD 풀모듈러 ATX 3.1 파워서플라이 재입고 (2)
PC Cerebras CS-4, WSE-3T 탑재로 GPU 랙 대비 30배 빠른 AI 추론 (2)
PC LandSpace ZQ-3 부스터, 착륙 성공 (2)
PC Intel Nova Lake 모바일, bLLC 캐시 미탑재 전망 (2)
PC Geekom, AMD 미니 PC 악성 네트워크 드라이버 배포 인정 (2)
PC Snapdragon X2 Elite Extreme, 경쟁사 칩 압도 (3)
PC PBS 방송국, 클라우드 스토리지 제공업체 잠적 후 50TB 데이터 유실 우려 (1)
PC Intel, 보급형 핸드헬드 시장에 Panther Lake 칩 투입 예정 (2)
PC Marvel's Wolverine, PS5서 레이 트레이싱 60FPS 지원 (2)
PC NPO, CPO의 난관 속에서 대안으로 부상
PC Intel, 메모리 사업 복귀 시사…새로운 아키텍처 예고 (1)
PC TSMC, CoWoS AI 칩 패키징 수율 98% 달성 (1)
PC NVIDIA, DGX 및 RTX 시스템 AI 가속화 업데이트 공개 (1)
PC SK하이닉스, 중국 생산량 50% 증대 추진 (1)
PC [에이원아이엔티] 2026년 택배없는 날(14일), 광복절 대체 휴무(17일) 배송 안내 (1)
PC Nvidia Rubin Ultra, HBM 부족으로 메모리 구성 하향 테스트 (1)
PC [쿨엔조이] LEADCOOL EVO-120 ARGB PWM 쿨엔조이 공식 리뷰 & 이벤트 안내 (1)
PC [에이원아이엔티] AONE STORM 500W 80PLUS스탠다드 파워서플라이, 퀘이사존 리뷰 및 이벤트 등록 안내 (1)
이 시간 HOT 댓글!
1/4