用語集
計算資源の言葉。
51 語:GPUやネットワークから、データセンター、購入モデルまで、専門用語を使わずに解説します。
ハードウェア
A100H100の前世代にあたる、NVIDIAのAmpere世代のデータセンター向けGPU。B200Hopperの後継アーキテクチャである、Blackwell世代のNVIDIAデータセンター向けGPU。FLOPS毎秒の浮動小数点演算回数(Floating-point operations per second)。純粋な計算スループットの指標で、テラフロップスやペタフロップスで示されることがよくあります。GPUグラフィックス処理装置。多数の計算を並列に実行するために設計されたチップです。GPUは、AIモデルのトレーニングと実行に使われる主要なハードウェアです。H100NVIDIAのHopper世代のデータセンター向けGPUで、AIのトレーニングと推論に広く使われています。SXMやPCIeなど、複数のフォームファクターがあります。H200H100の計算設計に、より大容量で高速なメモリを組み合わせた、NVIDIAのHopper世代のGPU。HBM広帯域メモリ(High Bandwidth Memory)。GPUチップの隣に積層して配置されたメモリで、データを非常に高速にやり取りできます。MI300XAIとハイパフォーマンスコンピューティング向けの、AMDのデータセンター向けアクセラレーター Instinct MI300X。PCIePCI Express。GPUとサーバーの他の部分を接続する標準的なインターフェースです。PCIe GPUはカードとして装着されます。SXMサーバーボードに直接実装される、NVIDIAのソケット型GPUフォームファクター。NVLinkとより高い電力に対応するよう設計されています。TensorコアNVIDIA GPUに内蔵された専用ユニットで、AIの中核をなす行列演算を汎用コアよりはるかに高速に実行します。VRAMGPUに搭載されたメモリで、ギガバイト単位で表されます。GPUの動作中、モデルの重み、作業データ、キャッシュを保持します。アクセラレーターAIなどの特定のワークロードを高速化するために設計されたチップ。GPUが最もよく知られたアクセラレーターで、ほかにTPUやカスタムAIチップなどがあります。メモリ帯域幅GPUが毎秒どれだけのデータをメモリから読み出し、または書き込めるかを示す値で、通常はテラバイト毎秒で表されます。
ネットワーク
AIワークロード
KVキャッシュ言語モデルがテキストを生成する際に、アテンションの中間結果を保存して再計算を不要にするメモリ。MIGMulti-Instance GPU。一つのGPUを、互いに分離された複数の小さなGPUに分割するNVIDIAの機能です。トレーニング大量のデータを処理してパラメーターを調整することで、モデルに学習させること。多数のGPUを数日から数週間連携させる必要があります。ファインチューニング既存のモデルを、より小規模で特定のデータセットでさらにトレーニングし、タスクに適応させること。推論トレーニング済みのモデルを実行して、ユーザー向けの回答や予測を生成すること。精度(FP8、BF16、FP16)計算に使用される数値形式。FP8のような低精度は、数値の正確さを多少犠牲にする代わりに、メモリ使用量が少なく高速に動作します。
データセンター
PUE電力使用効率(Power Usage Effectiveness)。施設全体のエネルギーを、IT機器が使用するエネルギーで割った値です。1に近いほど、冷却などの付帯設備に費やされるエネルギーが少ないことを意味します。TDP熱設計電力(Thermal design power)。チップが発生するよう設計された熱量で、負荷時の消費電力のおおよその目安となります。単位はワットです。コロケーション他社のデータセンター内のスペース、電力、冷却を借りて、自社のハードウェアを設置すること。データレジデンシーデータを特定の国やリージョン内で保存・処理することを求める要件。メガワット(MW)百万ワットに相当する電力の単位。データセンターのキャパシティは通常、利用可能な電力のメガワット数で表されます。ラック密度各サーバーラックが供給・冷却できる電力の量で、ラックあたりのキロワットで表されます。リージョンプロバイダーがキャパシティを提供する地理的なエリアで、都市、都市圏、国などがあります。液冷空気ではなく液体で熱を除去する方式で、チップ単位またはラック全体で行います。空冷よりはるかに高い電力密度に対応できます。
計算資源の購入
Bare metalお客様とハードウェアの間に仮想化レイヤーを挟まず、物理サーバー全体を借りること。GPU-hourGPU一基を一時間使用すること。計算資源の価格を比較するための標準単位です。On-demand長期の契約なしに、計算資源を時間単位または分単位で借りること。在庫状況の範囲内で、好きなときに開始・停止できます。SLAサービスレベル契約(Service level agreement)。稼働率などに関するプロバイダーの書面による約束で、達成できなかった場合の救済措置が定められています。エグレスプロバイダーのネットワークから出ていくデータのことで、ギガバイト単位で課金するプロバイダーもあります。クラスター一つのジョブに共同で取り組めるよう、高速なネットワークで接続されたサーバーのグループ。コミット期間購入者がキャパシティの料金支払いに同意する期間で、一か月、三か月、十二か月などがあります。スポット(中断可能)割引価格で提供される余剰キャパシティで、プロバイダーが短い予告で回収できるもの。ネオクラウド汎用クラウドサービスではなく、GPUとAIインフラに特化した新しいクラウドプロバイダー。ノードクラスター内の一台のサーバー。GPUノードは通常、複数のGPU(一般的には八基)を搭載しています。ハイパースケーラー主要なパブリッククラウドのような、世界規模でデータセンターを運営する非常に大規模なクラウドプロバイダー。予約キャパシティより低い価格や在庫の保証と引き換えに、一定期間(多くは数か月)計算資源を使用することを約束すること。
Kovara
Compute Index独立したプロバイダーの拠出データから、公開された方法論に基づいて算出される、計算資源の価格と在庫状況に関するKovaraのベンチマーク。フィキシングCompute Indexの公式な公表ベンチマーク値。使用した方法論のバージョンとともに記録され、黙って書き換えられることはありません。在庫ステータスオファリングが利用可能、限定的、利用不可のいずれか、あるいは出典に記載がない場合は不明であるかを示します。参考価格公式フィキシングとして公表されていないリアルタイムの推定値。フィキシングと誤認されないよう、参考値と表示されます。信頼度グレード事実がどの程度裏付けられているかを示すKovaraのA–D評価:Aは高度に検証済み、Bは確かなエビデンス、Cは不完全なエビデンス、Dは推定または未検証。正規化価格異なるオファーを比較できるよう、GPU-hourあたりの米ドルのような共通の単位に換算した価格。認証済みプロバイダーKovaraの担当者が身元を審査したプロバイダー。このステータスが自動的に付与されることはありません。
