Obciążenia AI
KV cache
Pamięć przechowująca pośrednie wyniki mechanizmu uwagi podczas generowania tekstu przez model językowy, aby nie trzeba było ich ponownie obliczać.
Dlaczego to ważne
KV cache rośnie wraz z długością kontekstu i liczbą jednoczesnych użytkowników i często decyduje o tym, ile zapytań może obsłużyć GPU.
Powiązane terminy
Chcesz dokładniejszej odpowiedzi?
Poproś asystenta Kova o wyjaśnienie pojęcia KV cache w kontekście twojego obciążenia. Poznaj asystenta Kova →
