Llama.cpp
Лёгкий инференс LLM на CPU и GPU — запускайте модели в формате GGUF без сложной настройки.
LLM-инференс Linux от 8 ГБ VRAM
Для кого
Разработчики и энтузиасты, которым нужен лёгкий и гибкий инференс LLM без тяжёлых фреймворков.
Что внутри
- llama.cpp скомпилирован с CUDA — GPU-ускорение из коробки
- llama-server — встроенный HTTP-сервер с OpenAI-совместимым API
- Поддержка GGUF-моделей с различными уровнями квантизации (Q4, Q5, Q8)
Как начать
- Запустите инстанс с этим шаблоном
- Проверьте в логах путь к GGUF-файлу и команду запуска. Начальная модель шаблона может отличаться от примера в инструкции.
- Укажите GGUF-файл, контекст и порт по инструкции; проверьте
/healthи выполните тестовый запрос. Не запускайте второй сервер на занятом порту.
Рекомендации по GPU
Учитывайте размер конкретного GGUF-файла, KV-кэш, контекст и число слоёв на GPU. Минимум шаблона не гарантирует размещение любой модели. Частичная загрузка слоёв на CPU требует системной RAM и меняет скорость работы.
Предустановленное ПО
Ubuntu 22.04CUDA 12.9llama.cppllama-server
Подробное руководство: читать в разделе «Решения» →
Кураторский шаблон Vast.ai — не приложение CloudCompute «в 1 клик».
Образ с предустановленным ПО: вы сами выбираете GPU и настраиваете доступ.
Запустить шаблон