Какой GPU нужен для LoRA и сколько стоит обучение
Подбирайте GPU под полную конфигурацию обучения, а не размер готового адаптера. Небольшая LoRA может требовать много памяти: в процессе участвуют базовая модель, активации, текстовые энкодеры и оптимизатор.
Примеры SDXL и FLUX.1 dev дают конфигурацию для проверки. Они не устанавливают измеренный минимум VRAM.
Что сравнивать в предложениях
| Ресурс | Почему важен | Как проверить |
|---|---|---|
| Память GPU | VRAM делят веса, активации, attention и состояние обучения | Выполнить кэширование, хотя бы одно обновление оптимизатора и сохранение при нужном разрешении |
| RAM сервера | Загрузка моделей и CPU offload могут давать пики вне VRAM | Смотреть RAM при загрузке и block swapping в FLUX |
| Диск | Веса, Python-пакеты, кэши, адаптеры и состояния накапливаются | Сложить объём загрузок и оставить место для нескольких чекпоинтов |
| Связь GPU и CPU | Block swapping переносит тензоры между хостом и видеокартой | Измерить шаг после прогрева на конкретном сервере |
| Загрузка файлов | Холодное окружение тратит оплачиваемое время на скачивание | Записать подготовку и загрузку отдельно |
| Условия аренды | Выделенные ресурсы, хранение и завершение влияют на счёт | Проверить выбранное предложение и управление инстансом |
Для SDXLодна GPU с 24 ГБ — разумный кандидат для проверки этого рецепта с batch 1. Для FLUX.1 dev рассмотрите и более ёмкие карты, если хотите меньше CPU swapping. Это отправные точки выбора, а не подтверждённые гарантии вместимости. Небольшая карта может заработать после изменения настроек, а сервер с недостаточной RAM — не справиться даже при большом запасе VRAM.
Сравните RTX 3090, RTX 4090, RTX 5090, A100 и актуальные предложения. Уточните вариант GPU и объём памяти. Две карты не объединяют память автоматически для этого однопроцессного рецепта: подробнее о multi-GPU.
Найдите этап, на котором не хватает памяти
При сбое загрузки сначала проверьте точность модели и RAM хоста, а затем batch. При сбое первого шага вероятнее влияют разрешение, микробатч и активации. При ошибке сохранения проверьте диск и права записи. Генерация примеров во время обучения может добавить отдельный пик памяти; здесь оценка выполняется отдельно.
В готовых настройках используются batch 1, замороженные текстовые энкодеры, кэширование и gradient checkpointing. У FLUX дополнительно включены FP8 и перенос 18 блоков. Больше swapping может снизить расход VRAM, но увеличить время шага. Это измеряемый компромисс, а не бесплатная дополнительная память.
Оцените сеанс и проверьте измерением
Нужно время обновления оптимизатора после прогрева, включая gradient accumulation. Если лог показывает итерации в секунду, сначала переведите их в секунды на обновление. Не умножайте длительность микробатча на число шагов оптимизатора.
session_hours ≈ (setup_seconds + cache_seconds + optimizer_steps × seconds_per_update
+ checkpoint_seconds + evaluation_seconds + idle_seconds) / 3600
compute_cost ≈ session_hours × selected_hourly_rate
Добавьте хранение, передачу и другие оплачиваемые позиции, если они есть в выбранном предложении. Десятиминутная проверка не даёт точного прогноза на несколько часов, когда загрузка, кэширование и сохранение работают иначе.
Пример сравнения, а не тариф
Предположим, два условных предложения выполняют одинаковую конфигурацию:
| Вариант A | Вариант B | |
|---|---|---|
| Условная почасовая ставка | 50 ₽ | 90 ₽ |
| Подготовка и кэширование | 20 минут | 15 минут |
| Время обновления оптимизатора | 8 секунд | 4 секунды |
| Число обновлений | 1 000 | 1 000 |
| Сохранение, проверка и простой | 20 минут | 20 минут |
| Полный сеанс | 2,89 часа | 1,69 часа |
| Только вычисления | 144,44 ₽ | 152,50 ₽ |
Все числа условные. Пример показывает, почему быстрая GPU заканчивает раньше, но может стоить чуть дороже, и почему одной почасовой ставки недостаточно. Это не benchmark и не тариф CloudCompute.
Считайте несколько попыток отдельно: три эксперимента с установкой окружения заново могут стоить больше трёх циклов в подготовленной среде. Учитывайте и ручную оценку: сравнивайте стоимость принятого результата, а не просто сохранённого адаптера.
Запишите параметры эксперимента
Сохраните предложение, GPU, драйвер, версию trainer, контрольные суммы базы, версию датасета, разрешение, rank, точность и swapping. Измерьте подготовку, установившееся время обновления, пик памяти и сохранение. Остановитесь после smoke test, если оставшаяся работа выходит за бюджет; позднее уменьшение max_train_steps не вернёт уже оплаченное время.
Скачайте адаптер и резервные копии перед завершением инстанса. Остановка обучения сама по себе не завершает аренду. Используйте актуальные цены, калькулятор и общую методику расчёта аренды. Все руководства по LoRA.
Источник: управление памятью FLUX.
Готовы запустить?
Запустить GPU-сервер