大規模モデルのトレーニング
大規模モデルのトレーニングでは、多数のGPUが一つのジョブに協調して取り組みます。実行速度は最も遅いリンクで決まるため、GPUモデルと同じくらいネットワークとメモリが重要です。
最も重要なこと
GPUとGPUの間の帯域幅
サーバー内では、NVLinkで接続されたSXM GPUは、PCIeカードよりはるかに高速に通信します。通信負荷の高いジョブほど恩恵を受けます。
クラスターのネットワーク
サーバー間では、InfiniBandまたは適切に構築されたRoCEファブリックがGPUの稼働を維持します。クラスターのオファーに実際にどのネットワークが含まれているかを確認してください。
GPUあたりのメモリ
GPUあたりのHBMが多いほど、バッチサイズを大きくしたり、分割数を減らしたりできます。価格を比較する前にVRAMを確認してください。
連続したキャパシティ
トレーニングには、同じ場所で同時に多数のGPUが必要なため、価格と同じくらい確認済みの在庫状況が重要です。
典型的な構成
SXMフォームファクターの最新のデータセンター向けGPU(HopperまたはBlackwellクラス)をノードあたり八基、InfiniBandまたは同等のネットワークで接続し、単一のリージョンに配置した構成。
一般的な購入方法
実行期間が長く、在庫の保証が必要なため、予約またはコミットのキャパシティや専有クラスターが一般的です。制御性と安定した性能から、ベアメタルも人気があります。
よくある間違い
- インターコネクトを確認せずに、GPUあたりの価格を比較すること。
- 掲載価格があれば、希望日にGPUを使い始められると思い込むこと。
- チェックポイントやデータセットのエグレス料金とストレージ料金を無視すること。
知っておきたい用語
これは一般的なガイダンスであり、特定のプロバイダーや価格を推奨するものではありません。現在のオファリングを確認し、在庫状況と条件はプロバイダーにご確認ください。
