Скидка 5% при первом запуске GPU по промокоду Активировать скидку

Подписи и trigger word для LoRA: примеры и ошибки

Подпись объясняет trainer, что находится на изображении. Для LoRA объекта она помогает отделить постоянный предмет от меняющегося окружения. Для LoRA стиля описывает сюжет, а общий идентификатор обозначает визуальную манеру. Подпись не является командой исправить недостатки исходного изображения.

Один UTF-8-файл на изображение

Рядом с mug_001.png положите mug_001.txt с таким же именем. В примерах задано caption_extension = ".txt". Внутри нужен обычный текст без JSON, Markdown-ограждений и заголовка с именем файла. Проверочный скрипт считает отсутствие или пустую подпись ошибкой и не рассчитывает на запасной class label.

Условные подписи для объекта:

mug_001.txt: photo of ohwxmug ceramic mug, front view, on a white table, soft window light
mug_002.txt: photo of ohwxmug ceramic mug, viewed from above, empty interior, grey background
mug_003.txt: photo of ohwxmug ceramic mug on a wooden shelf, handle facing right, warm side lighting

Имена файлов здесь нужны только для пояснения. В соответствующий .txt сохраняйте текст после : . Каждая упомянутая деталь должна действительно присутствовать на изображении.

Используйте trigger word единообразно

ohwxmug — произвольный идентификатор, а не гарантированно свободный токен в словаре модели. Не меняйте его написание и добавляйте название класса, например ceramic mug. В готовом workflow тот же идентификатор стоит в положительном промпте; замените его везде, если обучаете другой объект.

Триггер не создаёт закрытое пространство имён и не изолирует обучение идеально. Проверяйте промпты и с ним, и без него. Если обычный запрос кружки теперь воспроизводит конкретно ваш товар, влияние LoRA может быть слишком сильным или обучение — слишком узким.

Не добавляйте [ohwxmug], угловые скобки или синтаксис загрузки LoRA из A1111, если не хотите включить эти символы в подпись буквально. Загрузка адаптера и запрос нужного объекта — разные действия.

Подписи для объекта и для стиля

Для объекта описывайте меняющиеся фон, ракурс, свет и аксессуары. Не превращайте постоянный фон в часть имени предмета. Характерные признаки тоже можно описывать, но делайте это последовательно и проверяйте, остаются ли они управляемыми.

Для стиля используйте общий идентификатор и разные сюжеты:

ohwxstyle illustration of a bicycle beside a tree, pale background, wide composition
ohwxstyle illustration of a desk with a lamp and two books, close composition

Не используйте идентификатор кружки в примере стиля: это разные проекты обучения. Если на всех референсах стиля велосипеды, у модели мало оснований переносить эту манеру на письменные столы.

Автоматические подписи нужно редактировать

Captioner может сделать черновик, но он способен придумать объект, неверно прочитать надпись, пропустить важную деталь или выдать одинаковую общую фразу для всех изображений. Сверяйте текст с картинкой. Убирайте выдуманные детали и оценки вроде «award-winning masterpiece». Описание должно быть полезным и соразмерным содержимому.

Выбирайте язык и формулировки, с которыми базовая модель справляется. В рецептах используются английские подписи, чтобы они согласовывались с промптами в скачиваемом workflow. Русский язык сайта не означает, что датасету нужны именно русские captions. Для SDXL короткие подписи уменьшают риск потерять важные детали из-за ограничений текстовых энкодеров. У FLUX с T5 другие лимиты, но длиннее не всегда лучше.

При кэшировании подписи фиксируются

Оба стартовых конфига кэшируют выходы текстовых энкодеров и обучают адаптер только для модели изображений. Перемешивание подписей и dropout отключены. Включение этих функций без изменения стратегии кэширования может сделать конфигурацию некорректной.

После редактирования подписей создайте новую папку эксперимента только с изображениями и обновлёнными .txt, затем пересчитайте кэш. Наличие готовых embeddings не доказывает, что trainer прочитал актуальный текст. Исходные подписи храните вместе с исходным запуском, чтобы сравнение чекпоинтов оставалось осмысленным.

Далее: настройки обучения и оценка результата. Также: подготовка датасета, весь кластер.

Источники: параметры подписей, кэширование SDXL, кэширование FLUX.

Готовы запустить?

Запустить GPU-сервер