Стоимость аренды GPU: цена часа и цена выполненной задачи

Более дешёвый час GPU не обязательно означает более дешёвую выполненную задачу. Сравнивайте полную конфигурацию инстанса, оплачиваемое время и одинаковый полезный результат. Начните с текущих тарифов или калькулятора конфигурации. Ниже используются условные ставки, а не реальные предложения.

Запишите единицы тарификации

Статья Что записать Частая ошибка
Вычисления Полная ставка инстанса, число GPU, оплачиваемое время Повторно умножать уже общую цену multi-GPU-инстанса на число карт
Подготовка Загрузка модели, сборка окружения, прогрев Считать только генерацию или цикл обучения
Хранение Оплачиваемый объём, единица тарифа, срок хранения Считать, что остановка вычислений делает сохранённый диск бесплатным
Трафик Платное направление, объём и ставка Предполагать одинаковые условия у всех предложений
Повторы Неудачные запуски, рестарты, повторная подготовка Считать первый успешный тест всей стоимостью

Используйте одну валюту и единицы из предложения. Отображение цены за час не означает минимальный шаг оплаты в один час. Проверьте описание биллинга и условия выбранного инстанса.

Пример сравнения

Допустим, оба предложения выполняют один и тот же проверенный batch с одинаковыми моделью, точностью и требованиями к результату:

Предложение A Предложение B
Условная полная ставка инстанса 0,40 денежной единицы/час 0,70 денежной единицы/час
Подготовка и прогрев 0,5 часа 0,5 часа
Время batch в этом примере 3 часа 1,5 часа
Оплачиваемое время вычислений 3,5 часа 2 часа
Стоимость вычислений 1,40 1,40

B завершает работу раньше, но вычисления стоят столько же. Хранение и трафик могут изменить итог. Без подготовки B выглядело бы дешевле: 1,05 против 1,20. Поэтому измерение только основного цикла иногда вводит в заблуждение.

Длительности придуманы для демонстрации арифметики; это не бенчмарки конкретных GPU.

Total = instance_rate × paid_hours
      + storage_cost + transfer_cost + other_charged_items

Cost per accepted output = Total / accepted_outputs

Total — общая стоимость, instance_rate — ставка инстанса, paid_hours — оплачиваемые часы, accepted_outputs — число принятых результатов. Остальные слагаемые — хранение, трафик и другие платные услуги.

При тарифе за ГБ·час умножайте объём на оплачиваемые часы. Для другой единицы используйте условия тарифа. Не считайте, что любую месячную ставку можно разделить ровно на 720 часов.

Порог выгодности по производительности

Если подготовка и прочие расходы одинаковы, а время фиксированной задачи обратно пропорционально производительности:

B is cheaper for compute when:
throughput_B / throughput_A > hourly_rate_B / hourly_rate_A

То есть отношение производительности должно превышать отношение цен часа. При ставке на 50% выше для уменьшения стоимости вычислений нужен устойчивый прирост скорости более 50%. Если меняются подготовка, offload, качество или настройки, используйте полную формулу длительности.

Для интерактивного API сравнивайте задержку при нужном параллелизме. Большое число сгенерированных токенов бесполезно, если ответы опаздывают. Для изображений считайте принятые результаты одного разрешения и workflow. Для обучения сравнивайте одинаковый прогресс, включая оценку и сохранение checkpoint.

Отдельные сессии и постоянно работающий API

В эксперименте учитывайте всю сессию от выделения ресурсов до завершения оплаты. Закрытие SSH и остановка процесса инференса не останавливают арендованный инстанс. Проверьте инструкцию по остановке и удалению; перед удалением сохраните данные отдельно.

Для постоянного API используйте фактическое число часов периода и явное предположение о загрузке. Простаивающая запущенная GPU всё ещё занимает оплачиваемые ресурсы. Универсального процента загрузки, после которого выгоднее другой формат аренды, нет: нужны реальные условия и цена. Не рассчитывайте на spot, резервирование или автоматическое восстановление, если выбранный продукт явно их не предлагает.

Что сохранить для повторного сравнения

Запишите модель и число GPU, CPU/RAM хоста, общий и свободный объём VRAM, диск, версию движка/контейнера, ревизию checkpoint, точность, длины входа/выхода, параллелизм, время подготовки и работы, ошибки и тариф с датой. Для multi-GPU сохраните топологию. Повторите тест после существенной смены ПО или задачи.

Выбор GPU помогает составить список кандидатов, сравнение одной и нескольких карт — проверить стоимость масштабирования. Скрипт Ollama подходит для первого сравнения последовательных запросов, но не измеряет параллельную ёмкость сервиса.

Предложения аренды · Калькулятор GPU · Хранение и перезапуски.

Готовы запустить?

Запустить GPU-сервер