Bereitstellung von Modellen (Inferenz)
Inferenz läuft kontinuierlich, sobald Sie Nutzer haben. Sie wird meist eher durch den Speicher als durch die reine Rechenleistung begrenzt, und die Kosten hängen davon ab, wie viele Anfragen jede GPU bedienen kann.
Worauf es am meisten ankommt
Speicherkapazität
Die Modellgewichte und der KV-Cache müssen in den VRAM passen. Lange Kontexte und viele gleichzeitige Nutzer lassen den Cache schnell wachsen.
Speicherbandbreite
Das Erzeugen von Text Token für Token wird oft dadurch begrenzt, wie schnell der Speicher gelesen werden kann; daher wirkt sich die Bandbreite stark auf die Geschwindigkeit aus.
Region und Latenz
Der Betrieb in der Nähe Ihrer Nutzer senkt die Latenz, und Vorgaben zur Datenresidenz können die Region für Sie festlegen.
Flexible Skalierung
Das Verkehrsaufkommen steigt und sinkt. Die Möglichkeit, GPUs hinzuzufügen oder zu entfernen, ist wichtiger als bei einem Trainingslauf mit festem Umfang.
Eine typische Konfiguration
Eine bis acht GPUs pro Modellreplikat, so gewählt, dass Gewichte und Cache mit ausreichend Spielraum Platz finden. GPUs mit größerem Speicher können größere Modelle mit weniger Karten bereitstellen.
Wie üblicherweise beschafft wird
Typisch ist eine Mischung: Reserved-Kapazität oder Kapazität mit Bindung für die Grundlast und On-Demand für Lastspitzen. Spot eignet sich nur für Arbeiten, die Unterbrechungen tolerieren.
Häufige Fehler
- Nur für die Gewichte dimensionieren und den KV-Cache vergessen.
- Die günstigste Region wählen, ohne die Latenz zu den Nutzern zu prüfen.
- Sich bei Datenverkehr mit direktem Nutzerkontakt auf Spot-Kapazität verlassen.
Begriffe, die Sie kennen sollten
Dies ist eine allgemeine Orientierung, keine Empfehlung für einen bestimmten Anbieter oder Preis. Prüfen Sie aktuelle Angebote und bestätigen Sie Verfügbarkeit und Konditionen beim Anbieter.
Möchten Sie sich konkrete Optionen ansehen?
Sehen Sie sich erfasste Angebote mit ihren Quellen und Datumsangaben an oder bitten Sie Kova, die Dimensionierung für Sie zu übernehmen.
