DETAILS / SOURCES
GPU 밖에서 확인할 네 가지
대규모 AI 시스템은 GPU만 빠르다고 완성되지 않습니다. 계산할 데이터를 충분히 빠르게 공급하고, 여러 GPU가 서로 결과를 주고받고, 장비가 요구하는 전력을 공급하고, 발생한 열을 밖으로 옮겨야 합니다.
GPU / COMPUTE
메모리데이터 공급
네트워크GPU·서버 간 데이터 교환
전력에너지 공급
냉각열 제거
메모리
GPU가 계산을 계속하려면 필요한 데이터가 제때 공급돼야 합니다. 그래서 GPU 자체의 연산 성능뿐 아니라 메모리 용량과 대역폭도 실제 시스템 성능을 결정하는 중요한 조건이 됩니다.
네트워크
작업을 여러 GPU와 서버가 나눠 처리하면 계산 중에도 데이터를 계속 주고받습니다.
통신이 늦어지면 빠른 GPU가 다음 데이터를 기다리는 시간이 생길 수 있습니다. GPU 수가 늘어날수록 계산 장치뿐 아니라 그 사이를 연결하는 네트워크의 역할도 커집니다.
전력
GPU가 많아질수록 서버 한 대가 요구하는 전력도 커집니다.
실제 NVIDIA DGX H100은 GPU 8개를 탑재하고 최대 시스템 전력을 10.2 kW로 명시합니다.
데이터센터에서는 장비를 들이는 것뿐 아니라 그 장비에 필요한 전력을 실제로 공급할 수 있는지도 함께 봐야 합니다.
10.2 kW는 DGX H100의 제조사 명시 최대 시스템 전력입니다. 평균 소비전력이나 GPU 하나의 전력 값이 아니며, 배경 AI 생성 서버 이미지의 사양도 아닙니다.
냉각
공급된 전력의 상당 부분은 결국 열로 바뀝니다.
서버에서 발생한 열을 공기나 냉각액을 통해 계속 밖으로 옮기지 못하면 장비를 안정적으로 가동하기 어려워집니다.
그래서 고밀도 AI 인프라에서는 계산 성능만큼이나 열을 얼마나 효율적으로 처리할 수 있는지도 중요해집니다.
결국 AI 인프라는 하나의 GPU가 아니라, 계산·데이터·통신·전력·냉각이 함께 움직이는 시스템입니다.
그래서 AI 설비 투자를 볼 때도 GPU 공급량 하나만 보는 것보다, 그 주변에서 어떤 제약이 생기고 있는지를 같이 보는 편이 훨씬 많은 정보를 줍니다.
오늘의 브리핑 보기 ↗시각 자료는 AI 생성 개념 이미지입니다.