Tekoälyn työkuormat
KV cache
Muisti, joka tallentaa attention-laskennan välitulokset kielimallin tuottaessa tekstiä, jotta niitä ei tarvitse laskea uudelleen.
Miksi tämä on tärkeää
KV-välimuisti kasvaa kontekstin pituuden ja samanaikaisten käyttäjien määrän mukana, ja se ratkaisee usein, kuinka monta pyyntöä GPU voi palvella.
Liittyvät termit
Haluatko tarkemman vastauksen?
Pyydä Kova-agenttia selittämään KV cache työkuormasi yhteydessä. Tutustu Kova-agenttiin →
