Charges de travail d’IA
Inférence
Exécuter un modèle entraîné pour produire des réponses ou des prédictions destinées aux utilisateurs.
Pourquoi c’est important
L’inférence est généralement limitée par la mémoire et la latence plutôt que par la puissance de calcul brute, et elle fonctionne en continu dès que vous avez des utilisateurs.
Termes associés
Vous souhaitez une réponse plus approfondie ?
Demandez à Kova d’expliquer Inférence dans le contexte de votre charge de travail. Découvrez Kova →
