最も重要なこと
メモリ容量
モデルの重みとKVキャッシュがVRAMに収まる必要があります。長いコンテキストや多数の同時ユーザーがあると、キャッシュは急速に大きくなります。
メモリ帯域幅
テキストをトークン単位で生成する処理は、メモリの読み出し速度に制約されることが多いため、帯域幅が速度に大きく影響します。
リージョンとレイテンシー
ユーザーの近くで実行するとレイテンシーが下がり、データレジデンシーのルールによってリージョンが決まる場合もあります。
柔軟なスケーリング
トラフィックは増減します。固定のトレーニング実行に比べて、GPUを追加・削除できることがより重要です。
典型的な構成
モデルのレプリカあたりGPU一基から八基で、重みとキャッシュが余裕をもって収まるように選びます。メモリの大きいGPUなら、より少ない枚数でより大きなモデルを提供できます。
一般的な購入方法
組み合わせが一般的です:ベースの負荷には予約またはコミットのキャパシティ、ピークにはオンデマンド。スポットは、中断を許容できる処理にのみ適しています。
よくある間違い
- 重みだけで規模を見積もり、KVキャッシュを忘れること。
- ユーザーへのレイテンシーを確認せずに、最も安いリージョンを選ぶこと。
- ユーザー向けのトラフィックにスポットのキャパシティを使うこと。
これは一般的なガイダンスであり、特定のプロバイダーや価格を推奨するものではありません。現在のオファリングを確認し、在庫状況と条件はプロバイダーにご確認ください。
実際の選択肢を見てみませんか?
追跡中のオファリングを出典と日付とともに確認するか、Kovaに規模の見積もりを依頼してください。
