Loading
英語からの翻訳です。相違がある場合は英語版が優先されます。
言語モデルがテキストを生成する際に、アテンションの中間結果を保存して再計算を不要にするメモリ。
KVキャッシュはコンテキスト長と同時ユーザー数に応じて大きくなり、GPUが処理できるリクエスト数を左右することがよくあります。
お客様のワークロードに即してKVキャッシュを説明するよう、Kovaに依頼できます。 Kovaに会う →