Cargas de trabajo de IA
KV cache
Memoria que almacena los resultados intermedios de la atención mientras un modelo de lenguaje genera texto, para que no haya que volver a calcularlos.
Por qué importa
La KV cache crece con la longitud del contexto y con el número de usuarios simultáneos, y a menudo decide cuántas solicitudes puede atender una GPU.
Términos relacionados
¿Quieres una respuesta más detallada?
Pide a Kova que explique KV cache en el contexto de tu carga de trabajo. Conoce a Kova →
