Скидка 5% при первом запуске GPU по промокоду Активировать скидку

Какой GPU нужен для LoRA и сколько стоит обучение

Подбирайте GPU под полную конфигурацию обучения, а не размер готового адаптера. Небольшая LoRA может требовать много памяти: в процессе участвуют базовая модель, активации, текстовые энкодеры и оптимизатор.

Примеры SDXL и FLUX.1 dev дают конфигурацию для проверки. Они не устанавливают измеренный минимум VRAM.

Что сравнивать в предложениях

Ресурс Почему важен Как проверить
Память GPU VRAM делят веса, активации, attention и состояние обучения Выполнить кэширование, хотя бы одно обновление оптимизатора и сохранение при нужном разрешении
RAM сервера Загрузка моделей и CPU offload могут давать пики вне VRAM Смотреть RAM при загрузке и block swapping в FLUX
Диск Веса, Python-пакеты, кэши, адаптеры и состояния накапливаются Сложить объём загрузок и оставить место для нескольких чекпоинтов
Связь GPU и CPU Block swapping переносит тензоры между хостом и видеокартой Измерить шаг после прогрева на конкретном сервере
Загрузка файлов Холодное окружение тратит оплачиваемое время на скачивание Записать подготовку и загрузку отдельно
Условия аренды Выделенные ресурсы, хранение и завершение влияют на счёт Проверить выбранное предложение и управление инстансом

Для SDXLодна GPU с 24 ГБ — разумный кандидат для проверки этого рецепта с batch 1. Для FLUX.1 dev рассмотрите и более ёмкие карты, если хотите меньше CPU swapping. Это отправные точки выбора, а не подтверждённые гарантии вместимости. Небольшая карта может заработать после изменения настроек, а сервер с недостаточной RAM — не справиться даже при большом запасе VRAM.

Сравните RTX 3090, RTX 4090, RTX 5090, A100 и актуальные предложения. Уточните вариант GPU и объём памяти. Две карты не объединяют память автоматически для этого однопроцессного рецепта: подробнее о multi-GPU.

Найдите этап, на котором не хватает памяти

При сбое загрузки сначала проверьте точность модели и RAM хоста, а затем batch. При сбое первого шага вероятнее влияют разрешение, микробатч и активации. При ошибке сохранения проверьте диск и права записи. Генерация примеров во время обучения может добавить отдельный пик памяти; здесь оценка выполняется отдельно.

В готовых настройках используются batch 1, замороженные текстовые энкодеры, кэширование и gradient checkpointing. У FLUX дополнительно включены FP8 и перенос 18 блоков. Больше swapping может снизить расход VRAM, но увеличить время шага. Это измеряемый компромисс, а не бесплатная дополнительная память.

Оцените сеанс и проверьте измерением

Нужно время обновления оптимизатора после прогрева, включая gradient accumulation. Если лог показывает итерации в секунду, сначала переведите их в секунды на обновление. Не умножайте длительность микробатча на число шагов оптимизатора.

session_hours ≈ (setup_seconds + cache_seconds + optimizer_steps × seconds_per_update
                 + checkpoint_seconds + evaluation_seconds + idle_seconds) / 3600
compute_cost ≈ session_hours × selected_hourly_rate

Добавьте хранение, передачу и другие оплачиваемые позиции, если они есть в выбранном предложении. Десятиминутная проверка не даёт точного прогноза на несколько часов, когда загрузка, кэширование и сохранение работают иначе.

Пример сравнения, а не тариф

Предположим, два условных предложения выполняют одинаковую конфигурацию:

Вариант A Вариант B
Условная почасовая ставка 50 ₽ 90 ₽
Подготовка и кэширование 20 минут 15 минут
Время обновления оптимизатора 8 секунд 4 секунды
Число обновлений 1 000 1 000
Сохранение, проверка и простой 20 минут 20 минут
Полный сеанс 2,89 часа 1,69 часа
Только вычисления 144,44 ₽ 152,50 ₽

Все числа условные. Пример показывает, почему быстрая GPU заканчивает раньше, но может стоить чуть дороже, и почему одной почасовой ставки недостаточно. Это не benchmark и не тариф CloudCompute.

Считайте несколько попыток отдельно: три эксперимента с установкой окружения заново могут стоить больше трёх циклов в подготовленной среде. Учитывайте и ручную оценку: сравнивайте стоимость принятого результата, а не просто сохранённого адаптера.

Запишите параметры эксперимента

Сохраните предложение, GPU, драйвер, версию trainer, контрольные суммы базы, версию датасета, разрешение, rank, точность и swapping. Измерьте подготовку, установившееся время обновления, пик памяти и сохранение. Остановитесь после smoke test, если оставшаяся работа выходит за бюджет; позднее уменьшение max_train_steps не вернёт уже оплаченное время.

Скачайте адаптер и резервные копии перед завершением инстанса. Остановка обучения сама по себе не завершает аренду. Используйте актуальные цены, калькулятор и общую методику расчёта аренды. Все руководства по LoRA.

Источник: управление памятью FLUX.

Готовы запустить?

Запустить GPU-сервер