<img height="1" width="1" style="display:none" src="https://www.facebook.com/tr?id=1390824249408914&amp;ev=PageView&amp;noscript=1"> Nvidia, Groq 3 LPX 아키텍처 공개 및 추론 벤치마크 발표 : 다나와 DPG는 내맘을 디피지

비교하고 잘 사는, 다나와 : 가격비교 사이트

다나와 앱
다나와 앱 서비스 목록
다나와 APP
다나와 가격비교 No.1 가격비교사이트 다나와 앱으로
간편하게 최저가를 확인하세요.
- -
QR코드
빈 이미지
다나와 앱 서비스 목록 닫기
PC

Nvidia, Groq 3 LPX 아키텍처 공개 및 추론 벤치마크 발표

IP
2026.08.27. 10:03:13
조회 수
52
1
댓글 수
1

공유하기

레이어 닫기

지금 보는 페이지가 마음에 든다면
공유하기를 통해 지인에게 소개해 주세요.

로그인 유저에게는 공유 활동에 따라
다나와 포인트가 지급됩니다.

자세히 >

URL이 복사되었습니다.
원하는 곳에 붙여넣기(Ctrl+V)하세요.

레이어 닫기
해외 주요 IT 기사를 번역한 내용입니다. 일부 표현이 원문과 다를 수 있으니 참고해주세요.

Nvidia, Groq 3 LPX 아키텍처 공개 및 추론 벤치마크 발표

Artificial Analysis는 Google Cloud를 통해 제공되는 비공개 사전 출시 Gemma 4 31B 엔드포인트에서 비교를 실행했다. 동시성 1에서 50개의 순차적 클라이언트 요청 중앙값을 측정했으며, 비교 대상인 공개 제공업체는 공유 프로덕션 서버리스 엔드포인트를 사용했다. 한 번에 하나의 요청을 처리하는 방식은 하드웨어가 게시할 수 있는 사용자당 최고 토큰 속도를 생성하며, 다른 엔드포인트가 실행되는 다중 테넌트 조건과 직접 비교할 수 없다.

각 LP30은 약 500MB의 온다이 SRAM을 탑재했으며 HBM은 없다. 따라서 256개의 칩으로 구성된 전체 LPX 랙은 128GB 메모리를 보유하며, 40 PB/s의 총 대역폭과 315 PFLOPS의 FP8 연산 성능을 제공한다. Vera Rubin 호환 MGX 액체 냉각 랙에서 칩 간 지연 시간은 350ns이며, 1,000개 이상의 LPU로 확장된다.

모델 가중치를 HBM에서 스트리밍하는 대신 SRAM에 상주시켜 단일 토큰 디코드를 지배하는 메모리 접근 지연 시간을 제거했다. 이 설계는 캐시, 분기 예측, 비순차적 실행을 제거하고 컴파일러가 클록 사이클 단위로 스케줄링하는 완전 결정론적 파이프라인을 채택했다. 이 아키텍처는 전 Google TPU 엔지니어인 조나단 로스(Jonathan Ross)가 설립한 Groq가 2020년 ISCA 논문에서 설명한 Tensor Streaming Processor에서 직접 파생되었으며, 이 논문의 제목은 Arsovski와 Raghavan이 Hot Chips에서 재사용한 “Think Fast”였다.

랙 전반에 걸쳐 Nvidia는 칩을 단일 가상 클록에 동기화하며 이를 플레시오싱크로너스(plesiosynchronous) 네트워크라고 부른다. 각 칩은 프로세서이자 라우터 역할을 하므로 패브릭은 적응형 라우팅이나 혼잡 감지가 필요 없으며, 칩 간 클록 드리프트는 칩 간 링크에서 보상된다. Q&A 세션에서 작업 도중 칩이 실패했을 때의 영향에 대해 질문하자 Arsovski는 사용자들이 “업계의 다른 모든 하드웨어와 동일한 경험을 할 것”이며 “체크포인트를 찍거나 하드웨어를 재구성할 것”이라고 말했다.

Nvidia는 LPX 랙을 Vera Rubin NVL72에 연결되는 디코드 보조 프로세서로 제안한다. Rubin GPU는 연산 집약적인 프리필(prefill) 단계를 처리하고 KV 캐시를 구축하며, LPU는 출력 토큰을 생성한다. Nvidia는 작업을 세 가지 방식으로 분할하는 방법을 시연했다. 첫째, 분리된 프리필 및 디코드; 둘째, 어텐션-FFN 분리 방식으로, 어텐션과 캐시는 GPU HBM에 유지하고 LPU는 피드포워드 레이어를 실행한다; 셋째, 외부 드래프트 추측 디코딩 방식으로, LPU의 작은 모델이 토큰을 제안하고 GPU가 이를 병렬로 검증하며, 드래프트 토큰만 링크를 통해 전달된다.

FPGA는 동기식 LPU 도메인과 호스트 I/O 및 GPU 핸드오프의 비동기식 세계를 연결하며, Nvidia의 Dynamo 런타임은 CUDA의 LPU 확장과 함께 분할을 조율한다. Nvidia는 400K 토큰 캐시 컨텍스트를 가진 2조 파라미터 워크로드에서 이러한 모드를 통해 Rubin 단독 대비 약 3~5배의 성능 향상을 달성했다고 밝혔다.

Cerebras는 동일한 Hot Chips 세션에서 CS4 웨이퍼 스케일 시스템을 발표했다. 최고 시스템 아키텍트 Jean-Philippe Fricker는 이 시스템이 GPU보다 최대 30배 빠르고 CS3의 토큰 속도를 두 배로 높이며 10배의 토큰 용량을 제공한다고 말했다. 각 CS4 랙은 세 개의 웨이퍼 스케일 엔진을 Nexus라는 새로운 모듈형 플랫폼에 통합하며, 이 플랫폼은 전원, 연산, I/O를 분리하는 플러그형 연산 “백팩”을 중심으로 구축되었다. Fricker는 메모리 대역폭이 43 PB/s라고 밝혔으며, 이는 “Nvidia의 차세대 Rubin 칩보다 2,000배 높은 메모리 대역폭”이라고 청중에게 말했다. Cerebras는 또한 동일한 문제의 프리필 측면을 위한 파트너를 보유하고 있다. 지난 7월 AMD Helios GPU를 프리필에, 웨이퍼 스케일 엔진을 디코드에 사용하는 계약을 체결했으며, 이는 Nvidia가 Groq와 함께 자체적으로 구축하는 것과 동일한 작업 분할 방식이다.

출처: Tom's Hardware
원문: https://www.tomshardware.com/tech-industry/semiconductors/nvidia-presents-groq-3-lpx-architecture-and-unveils-its-first-third-party-inference-benchmark

공감/비공감

공감/비공감안내도움말 보기
유용하고 재미있는 정보인가요?
공감이 된다면 공감 버튼을, 그렇지 않다면 비공감 버튼을 눌러 주세요!
공감이나 비공감을 선택 하는 경우 다나와 포인트를 적립해 드립니다. ※ 공감 버튼의 총 선택 횟수는 전체 공개입니다. 비공감 버튼의 선택 여부는 선택한 본인만 알 수 있습니다.

PC_Weekly 님의 다른 글 보기

1/8
컴퓨터 상품포럼 최신 글 전체 둘러보기
1/1
PC NVIDIA NVHBM, HBM4E 대비 대역폭 30%·전력 15% 개선 (2)
PC [에이원아이엔티] 러빙쿨(LOVINGCOOL) 국내 론칭 사전예약 특가, 준비 수량 마감 및 입고 안내 (1)
PC Nvidia, Groq 3 LPX 아키텍처 공개 및 추론 벤치마크 발표 (1)
PC OpenAI Jalapeño ASIC, Nvidia GB300 능가 주장 (1)
PC 삼성 LPDDR5X-PIM, AI 추론 성능 3.01배 향상 (1)
PC Intel Wildcat Lake, Foveros 대신 UCIe MCP 적용으로 비용 최적화 (2)
PC Intel Xeon 7 'Diamond Rapids', 최대 256 P-코어 탑재 (1)
PC zotac 5070 sorid oc (2)
PC SK하이닉스, 차세대 HBM에 인텔 EMIB 등 첨단 패키징 기술 적용 (2)
PC d-Matrix Raptor 3D DRAM, HBM 대비 1/10 전력으로 SRAM급 대역폭 구현 (1)
PC [에이원아이엔티]에이원샵 주말특가 진행! (1)
PC 현대 컴퓨팅에서 메모리 성능이 중요한 이유 (1)
PC 노트북 RTX 5090, M5 Max 대비 LLM 성능 우위 (1)
PC 퀄컴, 스냅드래곤 C 전력 효율 벤치마크 일부 철회 (1)
PC 새로운 쿨링과 튜닝의 시작, 러빙쿨(LOVINGCOOL) 국내 론칭 사전예약 특가 진행 (2)
PC (주)에이원아이엔티, 시그니처 80PLUS GOLD 풀모듈러 ATX 3.1 파워서플라이 재입고 (2)
PC Cerebras CS-4, WSE-3T 탑재로 GPU 랙 대비 30배 빠른 AI 추론 (2)
PC LandSpace ZQ-3 부스터, 착륙 성공 (2)
PC Intel Nova Lake 모바일, bLLC 캐시 미탑재 전망 (2)
PC Geekom, AMD 미니 PC 악성 네트워크 드라이버 배포 인정 (2)
이 시간 HOT 댓글!
1/4