Как выбрать модель для SillyTavern: русский язык, VRAM и диалоги

Полезная модель для чата должна помещаться на сервере, понимать нужный язык и подходить по стилю диалога. Это три разных проверки. Большой контекст в model card не доказывает, что конкретный арендованный GPU сможет его обслуживать.

Начните с рабочей конфигурации

В текущем приложении с чат-ботом доступны пресеты Llama 3.1 8B, Qwen2.5 7B и Mistral 7B. Это существующие варианты запуска, а не рейтинг самых новых или лучших моделей. Сначала проверьте подключение с одним из них, затем переходите к community fine-tune.

При ручной установке удобнее начать с instruction-tuned модели, в карточке которой указаны chat template и языки. Запишите полное имя репозитория/тега, квантизацию, версию runtime и ID из endpoint. В Ollama посмотрите ollama show MODEL_ID; для vLLM сохраните параметры запуска и точную ревизию модели.

Текущий пресет vLLM в coding-agent использует модель для кода. Совместимый API позволяет подключить её к SillyTavern, но ничего не доказывает о качестве разговоров и художественного текста.

Оцените память без обещаний «точно поместится»

Ниже арифметика только для четырёхбитных весов. Здесь нет метаданных квантизации, слоёв большей точности, рабочих буферов, KV cache и других выделений памяти:

Число параметров Идеальный размер четырёхбитных весов, десятичные GB
7 миллиардов 3.5
14 миллиардов 7
32 миллиарда 16
70 миллиардов 35

Формула: число параметров × 4 / 8 байт. Это не таблица размеров скачивания и не рекомендация GPU. Число активных параметров MoE также не описывает все веса, которые нужно хранить. Сопоставьте конкретный файл, нужный контекст и runtime с расчётом памяти GPU.

Начинайте с одной модели и одного запроса одновременно. Длинный контекст и параллельные запросы требуют дополнительной памяти. CPU offloading может позволить загрузку ценой скорости; технически работающая модель не всегда удобна для общения.

Небольшой повторяемый тест

Сохраните пять запросов вместе с параметрами модели:

  1. Попросите краткое объяснение и проверьте соблюдение длины.
  2. Попросите диалог на нужном языке с привычной для вас степенью формальности.
  3. Задайте три вымышленных факта, продолжите разговор на несколько ходов и спросите о детали, зависящей от одного из фактов.
  4. Дайте неровный абзац для редактирования с условием сохранить имена и числа.
  5. Задайте роль персонажа и проверьте, держит ли модель стиль, не придумывая действия за пользователя.

Оставьте одинаковыми персонажа, бюджет контекста, sampling и лимит ответа. Если результат нестабилен, повторите запрос несколько раз. Сравнивайте выполнение инструкций, естественность языка, противоречия и полезную длину ответа. Холодную загрузку измеряйте отдельно от следующих ходов. Готовых оценок и замеров скорости здесь нет.

Fine-tune, отказы и форматы

Модели с обозначением roleplay или uncensored тоже нужно проверять. Эти слова не гарантируют связный текст, точность, определённое поведение отказов или поддержку любого языка. Самостоятельный запуск не меняет поведение, полученное при обучении.

Формат файла должен подходить runtime. GGUF нельзя автоматически подставить в команду для Transformers/AWQ-модели. Выберите подходящую инструкцию: Ollama, llama.cpp или vLLM. До запуска проверьте лицензию конкретной модели.

Для русского проверяйте естественность диалога, обращения, склонения имён и сохранение языка на длинной дистанции. Английский рейтинг этого не заменяет. Для английского также проверяйте свой жанр и тон: гладкий текст не равен надёжному сохранению фактов. Выбрав кандидата, переходите к контексту и карточкам персонажей, меняя по одному параметру.

Карточки семейств существующих пресетов: Llama 3.1 8B Instruct, Qwen2.5 7B Instruct, Mistral 7B Instruct v0.3. Уточняйте фактически установленный файл: изменяемый тег runtime не фиксирует ревизию модели.

Все руководства по персональному чату.

Готовы запустить?

Запустить GPU-сервер