vLLM

Высокопроизводительный сервер инференса LLM с OpenAI-совместимым API.

LLM-инференс Linux от 16 ГБ VRAM

Для кого

Разработчики, которым нужен быстрый API-сервер для языковых моделей: чат-боты, RAG-системы, агенты.

Что внутри

  • vLLM — инференс-движок с PagedAttention для эффективного использования VRAM
  • OpenAI-совместимый API-эндпоинт (/v1/completions, /v1/chat/completions)
  • Поддержка квантизированных моделей (AWQ, GPTQ)
  • Ray Dashboard для мониторинга

Как начать

  1. Запустите инстанс с этим шаблоном
  2. Проверьте команду запуска и модель в логах. Модель шаблона может отличаться от примера в инструкции; не запускайте второй сервер на занятом порту.
  3. Настройте модель, контекст и порт по инструкции. Проверьте /v1/models и выполните тестовый запрос перед подключением клиента.

Рекомендации по GPU

Подбирайте GPU по модели, точности весов, длине контекста и параллельным запросам. Минимум шаблона не гарантирует размещение любой модели. Например, веса 70B в BF16 сами по себе занимают около 140 ГБ без учёта KV-кэша и накладных расходов.

Предустановленное ПО

Ubuntu 22.04 CUDA 12.9 vLLM Python 3.11

Рекомендуемые GPU

Подробное руководство: читать в разделе «Решения» →

Кураторский шаблон Vast.ai — не приложение CloudCompute «в 1 клик».

Образ с предустановленным ПО: вы сами выбираете GPU и настраиваете доступ.

Запустить шаблон