Charges de travail d’IA
KV cache
Mémoire qui stocke les résultats intermédiaires de l’attention pendant qu’un modèle de langage génère du texte, afin qu’ils n’aient pas à être recalculés.
Pourquoi c’est important
Le cache KV augmente avec la longueur du contexte et le nombre d’utilisateurs simultanés, et détermine souvent le nombre de demandes qu’un GPU peut servir.
Vous souhaitez une réponse plus approfondie ?
Demandez à Kova d’expliquer KV cache dans le contexte de votre charge de travail. Découvrez Kova →
