Entraînement de grands modèles
Entraîner un grand modèle suppose que de nombreux GPU travaillent ensemble sur une seule tâche. L’exécution n’est aussi rapide que son maillon le plus lent : le réseau et la mémoire comptent donc autant que le modèle de GPU.
Ce qui compte le plus
Bande passante de GPU à GPU
Au sein d’un serveur, les GPU SXM reliés par NVLink communiquent bien plus vite que les cartes PCIe. Les tâches à forte intensité de communication en profitent le plus.
Réseau du cluster
D’un serveur à l’autre, InfiniBand ou un réseau RoCE bien conçu permet de garder les GPU occupés. Demandez quel réseau comprend réellement une offre de cluster.
Mémoire par GPU
Davantage de HBM par GPU permet de traiter des lots plus grands ou d’utiliser moins de shards. Vérifiez la VRAM avant de comparer les prix.
Capacité contiguë
L’entraînement exige de nombreux GPU au même endroit au même moment : la disponibilité confirmée compte donc autant que le prix.
Une configuration type
GPU de centre de données récents (classe Hopper ou Blackwell) au format SXM, huit par nœud, reliés par InfiniBand ou équivalent, dans une seule région.
Mode d’achat habituel
La capacité reserved ou avec engagement, ou encore un cluster dédié, est courante, car les exécutions sont longues et exigent une disponibilité garantie. Le bare metal est apprécié pour le contrôle qu’il offre et la régularité des performances.
Erreurs courantes
- Comparer les prix par GPU sans vérifier l’interconnexion.
- Supposer qu’un prix affiché signifie que les GPU sont libres de démarrer à votre date.
- Ignorer les coûts d’egress et de stockage des checkpoints et des jeux de données.
Termes à connaître
Il s’agit d’un guide général, et non d’une recommandation portant sur un fournisseur ou un prix précis. Consultez les offres actuelles et confirmez la disponibilité et les conditions auprès du fournisseur.
Prêt à examiner des options réelles ?
Consultez les offres suivies avec leurs sources et leurs dates, ou demandez à Kova de faire le dimensionnement pour vous.
