最重要的是什么
装得下内存
选择 VRAM 足以容纳模型和优化器状态的 GPU,或使用以少量速度换取空间的省内存方法。
短时、突发的任务
运行通常持续数小时到数天,因此按小时计价和快速启动比长期合同更重要。
简单的网络
一个节点通常就够了,因此一般不需要为高端集群互连支付额外费用。
可重复性
您会反复运行实验,因此可预测的价格和便捷的访问很有价值。
典型配置
一个带多个 GPU 的节点,甚至单个大内存 GPU,具体取决于模型规模和方法。
通常的采购方式
按需或短期容量是通常的选择。如果您的任务会保存检查点并可恢复,竞价也可行。
常见错误
- 为单节点任务用不到的集群网络付费。
- 在可中断容量上跳过检查点。
- 低估数据集传输和存储成本。
这只是一般性指导,并非对特定服务商或价格的推荐。请查看当前产品,并与服务商确认可用性和条款。
