AI 공장 전력 효율 극대화를 위한 통합 인프라 설계
From Megawatts to Tokens: How NVIDIA Maximizes AI Factory Production
NVIDIA BlogAI 데이터센터가 전력망 상황에 맞춰 컴퓨팅 부하를 능동적으로 조절하며, 전력 공급 안정화에 기여하는 것이 상용 규모로 입증되었습니다.
- 고정된 전력 예산 내에서도 시스템 최적화를 통해 컴퓨팅 처리량(토큰 처리량)을 최대 24%까지 끌어올려 효율성을 극대화했습니다.
- AI 인프라 확장의 핵심 병목인 전력 문제를 해결하기 위해, 시설 전체를 아우르는 통합 관리 시스템이 새로운 컴퓨팅 역량 기준을 제시합니다.
- 단순히 GPU 성능에 의존하는 것이 아닌, 냉각, 800V DC 전력 공급, 네트워크 등 공장 전체를 아우르는 통합 설계가 필수적입니다.
AI 데이터센터가 전력망 상황에 맞춰 컴퓨팅 부하를 능동적으로 조절하는 것이 상용 규모로 입증되었다. 에메랄드 AI의 Conductor 플랫폼은 그리드 조건 신호를 받아 데이터센터의 유연한 컴퓨팅 워크로드를 조정하며, 중요도가 낮은 작업은 지연시키고 고우선순위 서비스는 유지한다. 이는 전력망 제약 상황에서 핵심 AI 작업을 중단 없이 운영하는 것을 목표로 하며, 실제로 실리콘 밸리 전력(Silicon Valley Power)의 신호에 따라 공장의 전력이 4메가와트에서 3메가와트로 자동 감소한 사례가 보고되었다.
전력 예산 내에서도 컴퓨팅 처리량을 극대화하는 소프트웨어적 최적화가 가능하다. 클라우드 제공업체 Lambda는 DSX MaxLPS를 사용하여 5랙, 19노드 클러스터에서 테스트를 진행했다. 이 시스템은 및 랙 수준의 전력 소비를 모니터링하고 워크로드 유형에 따라 여유 용량을 재할당하여, 동일한 전력 예산으로 약 24% 더 많은 처리량(약 4백만 TPS에서 5백만 TPS)을 달성하며 성능 대비 전력 효율이 23% 개선되었다.
AI 공장의 전력 병목 현상을 해결하기 위해서는 개별 부품 최적화를 넘어 시설 전체를 설계하는 통합 접근 방식이 필수적이다. NVIDIA DSX는 네트워킹, 냉각 효율성, 시설 설계 등 전체 플랫폼을 아우르며, 800V DC 전력 아키텍처 도입과 같은 차세대 표준을 포함한다. 이러한 통합 관리는 공장 전체의 컴퓨팅 역량을 높이는 새로운 기준이 되며, 더 많은 유용한 작업을 소비 전력 대비 생산하는 것이 핵심 지표가 된다.
용어 풀이
- GPU
- 많은 계산을 한꺼번에 처리하는 칩. AI 학습과 실행에 가장 많이 써요.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.