Обслуговування моделей (інференс)
Інференс працює безперервно, щойно з’являються користувачі. Зазвичай він обмежений пам’яттю, а не чистою обчислювальною потужністю, а вартість залежить від того, скільки запитів може обслужити кожен GPU.
Що найважливіше
Обсяг пам’яті
Ваги моделі та KV-кеш мають уміщатися у VRAM. Довгі контексти й багато одночасних користувачів швидко збільшують кеш.
Пропускна здатність пам’яті
Генерація тексту токен за токеном часто обмежена швидкістю читання пам’яті, тож пропускна здатність сильно впливає на швидкість.
Регіон і затримка
Робота ближче до користувачів знижує затримку, а правила резидентності даних можуть визначити регіон за вас.
Гнучке масштабування
Трафік зростає й спадає. Можливість додавати чи прибирати GPU важить більше, ніж для фіксованого навчального запуску.
Типова конфігурація
Від одного до восьми GPU на репліку моделі, підібраних так, щоб ваги й кеш вільно вміщалися. GPU з більшим обсягом пам’яті можуть обслуговувати більші моделі на меншій кількості карт.
Як це зазвичай купують
Типовий варіант — поєднання: зарезервовані потужності чи потужності із зобов’язанням для базового навантаження та on-demand для піків. Spot підходить лише для роботи, яка допускає переривання.
Поширені помилки
- Розраховувати ресурси лише на ваги й забувати про KV-кеш.
- Обирати найдешевший регіон, не перевіривши затримку до користувачів.
- Покладатися на потужності spot для трафіку, що обслуговує користувачів.
Терміни, які варто знати
Це загальні рекомендації, а не порада щодо конкретного провайдера чи ціни. Перегляньте актуальні пропозиції та підтвердьте доступність і умови у провайдера.
Готові переглянути реальні варіанти?
Перегляньте відстежувані пропозиції з їхніми джерелами та датами або попросіть Kova підібрати ресурси для вас.
