最重要的是什么
内存容量
模型权重和 KV 缓存必须能装入 VRAM。长上下文和大量并发用户会使缓存迅速增长。
内存带宽
逐个 token 生成文本时,速度往往受限于内存的读取速度,因此带宽对速度影响很大。
区域与延迟
在靠近用户的地方运行可降低延迟,而数据驻留规定可能会限定区域。
灵活扩展
流量有起有落。与固定的训练运行相比,能够增减 GPU 更为重要。
典型配置
每个模型副本使用一到八个 GPU,以权重加缓存能宽松装入为准。内存更大的 GPU 可以用更少的卡运行更大的模型。
通常的采购方式
通常采用组合方式:基础负载使用预留或承诺容量,峰值使用按需容量。竞价仅适合能容忍中断的工作。
常见错误
- 只按权重估算规模,忘记了 KV 缓存。
- 选择最便宜的区域而不检查到用户的延迟。
- 依赖竞价容量承载面向用户的流量。
这只是一般性指导,并非对特定服务商或价格的推荐。请查看当前产品,并与服务商确认可用性和条款。
