Персональный AI-чат на GPU: Open WebUI и SillyTavern
У персонального чата три отдельных компонента: интерфейс, языковая модель и сервер, который её запускает. Их можно менять независимо. Например, SillyTavern и историю диалогов оставить на своём компьютере, а GPU арендовать только на время общения с моделью.
Здесь собран весь путь: от первого подключения до длинных диалогов и резервных копий. Используются существующая аренда GPU и приложение с Open WebUI. SillyTavern вы устанавливаете самостоятельно; отдельного управляемого сервиса SillyTavern в кабинете нет.
С чего начать
| Что нужно | Первый шаг | Где работает интерфейс |
|---|---|---|
| Привычный веб-чат с выбором модели до запуска | Приложение Open WebUI, затем инструкция для первой сессии | На арендованном инстансе |
| Локальный интерфейс с моделью на арендованном GPU | Ручная установка Open WebUI | На вашем компьютере |
| Диалоги с персонажами, сценарии и lorebook | Установка SillyTavern, затем подключение backend | В этой инструкции — на вашем компьютере |
| Помощь с выбором интерфейса | Open WebUI или SillyTavern | Сравнение под вашу задачу |
Локальный интерфейс не делает вычисления локальными. Включённые в запрос сообщения передаются серверу модели. На хранение данных также влияют расширения, подключённые API, логи и резервные копии; аренда GPU сама по себе не даёт безусловной гарантии конфиденциальности.
Подключение, настройка, обслуживание
- Подключите backend.Ollama через SSH подходит для текущего приложения с чат-ботом и ручной установки Ollama. Для endpoint с API-ключом используйте инструкцию по vLLM/API.
- Выберите модель.Руководство по моделям разделяет качество русского языка, размер, квантизацию и память. Модель для программирования не обязательно удачна для диалога.
- Распределите контекст. В настройках контекста и генерации показано, как персонаж, lorebook и длина ответа конкурируют с историей сообщений.
- Добавьте одного персонажа. Начните с небольшого примера из руководства по карточкам и lorebook, прежде чем импортировать большую коллекцию.
- Сохраните данные. Пройдите инструкцию по резервным копиям до обновления, смены сервера или удаления инстанса.
- Проверяйте компоненты по очереди.Диагностика начинается с endpoint, затем переходит к модели, промпту и памяти.
Первая полезная сессия
По возможности установите интерфейс до аренды GPU. Когда backend готов, получите список ID моделей, отправьте короткий тест и проверьте обычный диалог. Затем добавляйте персонажа, lorebook или увеличивайте контекст. Сохраните рабочие параметры подключения и точное название модели: следующую сессию проще начинать с известной конфигурации.
Для редких сессий считайте всё время аренды: установку, скачивание, чтение ответов и завершение работы. Закрытие вкладки не освобождает инстанс. Используйте планирование расходов и актуальные предложения GPU. Фиксированную цену или скорость эти примеры не обещают.
Файлы и проверка
Проверка подключения по умолчанию только получает список моделей. Необязательный тест генерации отправляет один настоящий запрос. Русская карточка персонажа содержит небольшой вымышленный lorebook; есть и английская версия. В карточках нет ключей и плагинов.
Инструкции сверены с SillyTavern 1.19.0 и версиями runtime из манифеста источников. Офлайн-проверки покрывают структуру примеров и ошибки подключения. Полная работа через браузер и диалог на арендованном GPU здесь не тестировались. Начните с короткой сессии и измерьте поведение своей модели, контекста и сервера.
Готовы запустить?
Запустить GPU-сервер