대형 모델 학습
대형 모델 학습은 많은 GPU가 하나의 작업을 함께 수행하는 것을 뜻합니다. 실행 속도는 가장 느린 연결에 좌우되므로, 네트워크와 메모리가 GPU 모델만큼 중요합니다.
가장 중요한 것
GPU-GPU 간 대역폭
서버 내부에서는 NVLink로 연결된 SXM GPU가 PCIe 카드보다 훨씬 빠르게 통신합니다. 통신량이 많은 작업일수록 효과가 큽니다.
클러스터 네트워킹
서버 간에는 InfiniBand나 잘 구축된 RoCE 패브릭이 GPU를 쉬지 않게 합니다. 클러스터 상품에 실제로 어떤 네트워크가 포함되는지 확인하세요.
GPU당 메모리
GPU당 HBM이 많을수록 배치 크기를 키우거나 샤드 수를 줄일 수 있습니다. 가격을 비교하기 전에 VRAM을 확인하세요.
연속된 용량
학습에는 같은 장소에서 같은 시간에 많은 GPU가 필요하므로, 확인된 가용성이 가격만큼 중요합니다.
일반적인 구성
SXM 폼 팩터의 최신 데이터센터 GPU(Hopper 또는 Blackwell 급)를 노드당 여덟 개씩, InfiniBand 또는 동급 네트워크로 연결해 하나의 리전에 배치합니다.
일반적인 구매 방식
실행 기간이 길고 보장된 가용성이 필요하므로 예약 또는 약정 용량이나 전용 클러스터가 일반적입니다. 제어권과 일관된 성능 때문에 베어메탈도 많이 선택합니다.
흔한 실수
- 인터커넥트를 확인하지 않고 GPU당 가격만 비교하는 것.
- 게시된 가격이 있으면 원하는 날짜에 GPU를 바로 쓸 수 있다고 가정하는 것.
- 체크포인트와 데이터 세트의 아웃바운드 전송 및 스토리지 비용을 무시하는 것.
이는 일반적인 안내이며, 특정 제공업체나 가격을 추천하는 것이 아닙니다. 현재 상품을 확인하고 제공업체와 가용성 및 조건을 확인하세요.
