Персональный AI-чат на GPU: Open WebUI и SillyTavern

У персонального чата три отдельных компонента: интерфейс, языковая модель и сервер, который её запускает. Их можно менять независимо. Например, SillyTavern и историю диалогов оставить на своём компьютере, а GPU арендовать только на время общения с моделью.

Здесь собран весь путь: от первого подключения до длинных диалогов и резервных копий. Используются существующая аренда GPU и приложение с Open WebUI. SillyTavern вы устанавливаете самостоятельно; отдельного управляемого сервиса SillyTavern в кабинете нет.

С чего начать

Что нужно Первый шаг Где работает интерфейс
Привычный веб-чат с выбором модели до запуска Приложение Open WebUI, затем инструкция для первой сессииНа арендованном инстансе
Локальный интерфейс с моделью на арендованном GPU Ручная установка Open WebUIНа вашем компьютере
Диалоги с персонажами, сценарии и lorebook Установка SillyTavern, затем подключение backend В этой инструкции — на вашем компьютере
Помощь с выбором интерфейса Open WebUI или SillyTavernСравнение под вашу задачу

Локальный интерфейс не делает вычисления локальными. Включённые в запрос сообщения передаются серверу модели. На хранение данных также влияют расширения, подключённые API, логи и резервные копии; аренда GPU сама по себе не даёт безусловной гарантии конфиденциальности.

Подключение, настройка, обслуживание

  1. Подключите backend.Ollama через SSH подходит для текущего приложения с чат-ботом и ручной установки Ollama. Для endpoint с API-ключом используйте инструкцию по vLLM/API.
  2. Выберите модель.Руководство по моделям разделяет качество русского языка, размер, квантизацию и память. Модель для программирования не обязательно удачна для диалога.
  3. Распределите контекст. В настройках контекста и генерации показано, как персонаж, lorebook и длина ответа конкурируют с историей сообщений.
  4. Добавьте одного персонажа. Начните с небольшого примера из руководства по карточкам и lorebook, прежде чем импортировать большую коллекцию.
  5. Сохраните данные. Пройдите инструкцию по резервным копиям до обновления, смены сервера или удаления инстанса.
  6. Проверяйте компоненты по очереди.Диагностика начинается с endpoint, затем переходит к модели, промпту и памяти.

Первая полезная сессия

По возможности установите интерфейс до аренды GPU. Когда backend готов, получите список ID моделей, отправьте короткий тест и проверьте обычный диалог. Затем добавляйте персонажа, lorebook или увеличивайте контекст. Сохраните рабочие параметры подключения и точное название модели: следующую сессию проще начинать с известной конфигурации.

Для редких сессий считайте всё время аренды: установку, скачивание, чтение ответов и завершение работы. Закрытие вкладки не освобождает инстанс. Используйте планирование расходов и актуальные предложения GPU. Фиксированную цену или скорость эти примеры не обещают.

Файлы и проверка

Проверка подключения по умолчанию только получает список моделей. Необязательный тест генерации отправляет один настоящий запрос. Русская карточка персонажа содержит небольшой вымышленный lorebook; есть и английская версия. В карточках нет ключей и плагинов.

Инструкции сверены с SillyTavern 1.19.0 и версиями runtime из манифеста источников. Офлайн-проверки покрывают структуру примеров и ошибки подключения. Полная работа через браузер и диалог на арендованном GPU здесь не тестировались. Начните с короткой сессии и измерьте поведение своей модели, контекста и сервера.

Готовы запустить?

Запустить GPU-сервер