
AMD, Cerebras Wafer-Scale Engine 통합으로 AI 추론 성능 강화
AMD는 Helios 랙 스케일 시스템의 추론 기능을 강화하기 위해 Cerebras를 파트너로 현명하게 선택한 것으로 보인다. 최근 OpenAI 연구원은 Cerebras의 Wafer-Scale Engine에 대해 극찬했다.
Helios는 AMD의 첫 번째 AI 워크로드용 풀 스택 랙 레벨 솔루션으로, AMD Instinct MI455X 가속기와 4세대 AMD EPYC 프로세서로 구성된다. AMD는 AI 워크로드용 Helios 시스템의 유용성을 더욱 높이기 위해 Cerebras와 협력하여 Cerebras의 Wafer-Scale Engine을 Helios 시스템에 통합하여 초고속 추론을 구현할 계획이다.
Cerebras의 Wafer-Scale Engine은 전체 AI 슈퍼컴퓨터에 해당하는 메모리와 컴퓨팅을 단일의 거대한 상호 연결된 실리콘 시트에 배치한다. 수십만 개의 컴퓨팅 코어와 수십 GB의 SRAM이 원활하게 연결되어 외부 네트워크 병목 현상 없이 효율적인 데이터 이동을 지원한다. Cerebras의 Wafer-Scale Engine은 전체 중형 모델 또는 대형 모델의 상당 부분을 통합 SRAM 내에 담을 수 있으며, 훈련 및 추론 워크로드 모두에 활용할 수 있다.
AMD의 로드맵에 따르면, Helios는 고성능의 확장 가능한 처리량 엔진을 제공하고, Cerebras 기술은 초고속, 초저지연 디코딩 및 토큰 생성을 담당한다. 이 두 컴퓨팅 엔진은 결합하여 와트당 최대 5배 높은 토큰 처리량을 제공할 것으로 예상된다.
OpenAI 연구원, Cerebras 칩의 빠른 추론 속도에 감탄
OpenAI 연구원 Jeffrey Wang은 Cerebras의 Wafer-Scale Engine 아키텍처를 활용하는 것으로 추정되는 Cerebras 칩에 대해 다음과 같이 평가했다. 그는 “내부적으로 OpenAI 모델 중 일부는 Cerebras 칩을 사용한다. 이 칩들은 추론 속도가 매우 빨라 놀랍다”고 언급했다. 또한 “이것이 일상 업무에 미치는 영향은 이전에 작업 완료까지 몇 분을 기다려야 했던 반면, 이제는 컨텍스트 전환할 시간도 없이 작업이 완료된다는 것이다. 이는 생산성을 크게 높여준다”고 덧붙였다.
AI 모델은 일반적으로 한 작업에서 다른 작업으로 전환할 때 컨텍스트 전환을 수행한다. 이는 모델이 일련의 다양한 작업을 수행해야 하는 다중 에이전트 환경이나, 다양한 하위 신경망이 특정 작업을 수행하는 데 특화된 MoE(Mixture of Experts) 모델에서 발생할 수 있다. OpenAI가 Cerebras 시스템에 이미 깊은 인상을 받았다는 사실은 Wafer-Scale Engine이 통합된 AMD의 Helios 랙 스케일 시스템이 출시와 동시에 큰 성공을 거둘 것임을 시사한다. 추론 비용이 데이터 센터 수익성의 가장 큰 결정 요인이 되고 있다는 점을 고려할 때 이러한 결과는 더욱 중요하게 평가된다.
출처: Wccftech
원문: https://wccftech.com/openai-finds-that-systems-from-amds-helios-partner-cerebras-are-incredible-at-inference-tasks-showing-that-amd-chose-wisely/



