가장 중요한 것
메모리 용량
모델 가중치와 KV 캐시가 VRAM에 들어가야 합니다. 긴 컨텍스트와 많은 동시 사용자는 캐시를 빠르게 키웁니다.
메모리 대역폭
토큰 단위로 텍스트를 생성하는 작업은 메모리를 읽는 속도에 제한되는 경우가 많으므로, 대역폭이 속도에 큰 영향을 줍니다.
리전과 지연 시간
사용자 가까이에서 실행하면 지연 시간이 줄어들며, 데이터 레지던시 규정에 따라 리전이 정해질 수도 있습니다.
유연한 확장
트래픽은 늘었다 줄었다 합니다. 고정된 학습 실행보다 GPU를 추가하거나 제거할 수 있는 능력이 더 중요합니다.
일반적인 구성
모델 복제본당 GPU 한 개에서 여덟 개로, 가중치와 캐시가 여유 있게 들어가도록 선택합니다. 메모리가 큰 GPU는 더 적은 카드로 더 큰 모델을 서빙할 수 있습니다.
일반적인 구매 방식
기본 부하에는 예약 또는 약정 용량, 피크에는 온디맨드를 섞어 쓰는 것이 일반적입니다. 스팟은 중단을 견딜 수 있는 작업에만 적합합니다.
흔한 실수
- 가중치만 고려해 규모를 산정하고 KV 캐시를 잊는 것.
- 사용자와의 지연 시간을 확인하지 않고 가장 저렴한 리전을 고르는 것.
- 사용자 대상 트래픽에 스팟 용량을 사용하는 것.
이는 일반적인 안내이며, 특정 제공업체나 가격을 추천하는 것이 아닙니다. 현재 상품을 확인하고 제공업체와 가용성 및 조건을 확인하세요.
실제 선택지를 살펴볼 준비가 되셨나요?
출처와 날짜가 있는 추적 상품을 확인하거나, Kova에게 규모 산정을 요청하세요.
