지원 시설과 최첨단 슈퍼컴퓨터는 xAI와 NVIDIA가 수개월에서 수년이 걸릴 수 있는 이 규모의 시스템에 대한 일반적인 기간 대신 단 122일 만에 구축했습니다. 첫 번째 랙이 바닥에 굴러온 후 훈련이 시작될 때까지 19일이 걸렸습니다.
Colossus는 매우 큰 Grok 모델을 훈련하는 동안 전례 없는 네트워크 성능을 달성합니다. 네트워크 패브릭의 세 계층 모두에서 시스템은 흐름 충돌로 인한 애플리케이션 지연 저하나 패킷 손실이 전혀 발생하지 않았습니다. Spectrum-X 혼잡 제어로 활성화된 95%의 데이터 처리량을 유지했습니다.
이 수준의 성능은 표준 이더넷으로는 대규모로 달성할 수 없으며, 표준 이더넷은 수천 개의 흐름 충돌을 발생시키는 반면 데이터 처리량은 60%에 불과합니다.
NVIDIA의 네트워킹 담당 수석 부사장인 Gilad Shainer는 "AI는 미션 크리티컬해지고 있으며 성능, 보안, 확장성 및 비용 효율성이 향상되어야 합니다."라고 말했습니다. "NVIDIA Spectrum-X 이더넷 네트워킹 플랫폼은 xAI와 같은 혁신가에게 AI 워크로드의 더 빠른 처리, 분석 및 실행을 제공하고, 결과적으로 AI 솔루션의 개발, 배포 및 출시 시간을 단축하도록 설계되었습니다."
Elon Musk는 X에 대해 "Colossus는 세계에서 가장 강력한 교육 시스템입니다."라고 말했습니다. "xAI 팀, NVIDIA 및 많은 파트너/공급업체의 훌륭한 작업입니다."
xAI의 대변인은 "xAI는 세계에서 가장 크고 강력한 슈퍼컴퓨터를 구축했습니다."라고 말했습니다. "NVIDIA의 Hopper GPU와 Spectrum-X를 사용하면 대규모로 AI 모델을 교육하는 경계를 넓히고 이더넷 표준을 기반으로 하는 초고속 및 최적화된 AI 팩토리를 만들 수 있습니다."
Spectrum-X 플랫폼의 핵심은 최대 800Gb/s의 포트 속도를 지원하고 Spectrum-4 스위치 ASIC을 기반으로 하는 Spectrum SN5600 이더넷 스위치입니다. xAI는 Spectrum-X SN5600 스위치를 NVIDIA BlueField-3 SuperNIC와 페어링하여 전례 없는 성능을 구현하기로 했습니다. AI용 Spectrum-X 이더넷 네트워킹은 이전에 InfiniBand에서만 제공되었던 낮은 지연 시간과 짧은 테일 지연 시간으로 매우 효과적이고 확장 가능한 대역폭을 제공하는 고급 기능을 제공합니다. 이러한 기능에는 NVIDIA Direct Data Placement 기술을 사용한 적응형 라우팅, 혼잡 제어, 향상된 AI 패브릭 가시성 및 성능 격리가 포함되며, 이는 모두 멀티 테넌트 생성형 AI 클라우드와 대규모 엔터프라이즈 환경에 대한 핵심 요구 사항입니다.
※ 퀘이사존 공식 기사가 아닌 해외 뉴스/기사를 번역한 것으로, 퀘이사존 견해와 주관은 포함되어 있지 않습니다. |