vLLM
Высокопроизводительный сервер инференса LLM с OpenAI-совместимым API.
LLM-инференс
Linux
от 16 ГБ VRAM
Для кого
Разработчики, которым нужен быстрый API-сервер для языковых моделей: чат-боты, RAG-системы, агенты.
Что внутри
- vLLM — инференс-движок с PagedAttention для эффективного использования VRAM
- OpenAI-совместимый API-эндпоинт (
/v1/completions,/v1/chat/completions) - Поддержка квантизированных моделей (AWQ, GPTQ)
- Ray Dashboard для мониторинга
Как начать
- Запустите инстанс с этим шаблоном
- Проверьте команду запуска и модель в логах. Модель шаблона может отличаться от примера в инструкции; не запускайте второй сервер на занятом порту.
- Настройте модель, контекст и порт по инструкции. Проверьте
/v1/modelsи выполните тестовый запрос перед подключением клиента.
Рекомендации по GPU
Подбирайте GPU по модели, точности весов, длине контекста и параллельным запросам. Минимум шаблона не гарантирует размещение любой модели. Например, веса 70B в BF16 сами по себе занимают около 140 ГБ без учёта KV-кэша и накладных расходов.
Предустановленное ПО
Ubuntu 22.04
CUDA 12.9
vLLM
Python 3.11
Подробное руководство: читать в разделе «Решения» →
Кураторский шаблон Vast.ai — не приложение CloudCompute «в 1 клик».
Образ с предустановленным ПО: вы сами выбираете GPU и настраиваете доступ.
Запустить шаблон