Mise à disposition des modèles (inférence)
L’inférence tourne en continu dès que vous avez des utilisateurs. Elle est généralement limitée par la mémoire plutôt que par la puissance de calcul brute, et le coût dépend du nombre de demandes que chaque GPU peut servir.
Ce qui compte le plus
Capacité mémoire
Les poids du modèle et le cache KV doivent tenir dans la VRAM. Les contextes longs et un grand nombre d’utilisateurs simultanés font croître le cache rapidement.
Bande passante mémoire
La génération de texte token par token est souvent limitée par la vitesse de lecture de la mémoire : la bande passante influe donc fortement sur la vitesse.
Région et latence
Un déploiement proche de vos utilisateurs réduit la latence, et les règles de résidence des données peuvent vous imposer la région.
Mise à l’échelle flexible
Le trafic monte et descend. Pouvoir ajouter ou retirer des GPU compte davantage qu’avec un entraînement de taille fixe.
Une configuration type
D’un à huit GPU par réplique du modèle, choisis de sorte que les poids et le cache tiennent confortablement. Les GPU dotés de plus de mémoire peuvent servir de plus grands modèles avec moins de cartes.
Mode d’achat habituel
Une combinaison est courante : de la capacité reserved ou avec engagement pour la charge de base, et de l’on-demand pour les pics. Le spot ne convient qu’aux travaux qui tolèrent les interruptions.
Erreurs courantes
- Dimensionner uniquement pour les poids en oubliant le cache KV.
- Choisir la région la moins chère sans vérifier la latence vers les utilisateurs.
- S’appuyer sur de la capacité spot pour le trafic destiné aux utilisateurs.
Termes à connaître
Il s’agit d’un guide général, et non d’une recommandation portant sur un fournisseur ou un prix précis. Consultez les offres actuelles et confirmez la disponibilité et les conditions auprès du fournisseur.
Prêt à examiner des options réelles ?
Consultez les offres suivies avec leurs sources et leurs dates, ou demandez à Kova de faire le dimensionnement pour vous.
