Cargas de trabalho de IA
KV cache
Memória que armazena resultados intermediários da atenção enquanto um modelo de linguagem gera texto, para que não precisem ser recalculados.
Por que isso importa
O KV cache cresce com o tamanho do contexto e o número de usuários simultâneos, e muitas vezes determina quantas requisições uma GPU consegue atender.
Termos relacionados
Quer uma resposta mais aprofundada?
Peça à Kova para explicar KV cache no contexto da sua carga de trabalho. Conheça a Kova →
