最重要的是什么
GPU 与 GPU 之间的带宽
在服务器内部,通过 NVLink 连接的 SXM GPU 之间的通信速度远超 PCIe 卡。通信密集型任务受益最大。
集群网络
在服务器之间,InfiniBand 或构建良好的 RoCE 互连能让 GPU 保持满负荷。请询问集群产品实际包含哪种网络。
每 GPU 内存
每个 GPU 的 HBM 越多,批大小就越大,或分片就越少。比较价格前请先查看 VRAM。
连续容量
训练需要大量 GPU 在同一时间位于同一地点,因此已确认的可用性与价格同样重要。
典型配置
近期的数据中心 GPU(Hopper 或 Blackwell 级别),采用 SXM 外形规格,每节点八个,通过 InfiniBand 或同等网络连接,位于同一区域。
通常的采购方式
预留或承诺容量、专用集群较为常见,因为运行时间长且需要有保证的可用性。裸金属因其控制力和稳定的性能而颇受欢迎。
常见错误
- 比较每 GPU 价格时不检查互连。
- 以为有标价就意味着 GPU 在您需要的日期空闲可用。
- 忽略检查点和数据集的出口流量与存储成本。
需要了解的术语
这只是一般性指导,并非对特定服务商或价格的推荐。请查看当前产品,并与服务商确认可用性和条款。
