Llama.cpp

Лёгкий инференс LLM на CPU и GPU — запускайте модели в формате GGUF без сложной настройки.

LLM-инференс Linux от 8 ГБ VRAM

Для кого

Разработчики и энтузиасты, которым нужен лёгкий и гибкий инференс LLM без тяжёлых фреймворков.

Что внутри

  • llama.cpp скомпилирован с CUDA — GPU-ускорение из коробки
  • llama-server — встроенный HTTP-сервер с OpenAI-совместимым API
  • Поддержка GGUF-моделей с различными уровнями квантизации (Q4, Q5, Q8)

Как начать

  1. Запустите инстанс с этим шаблоном
  2. Проверьте в логах путь к GGUF-файлу и команду запуска. Начальная модель шаблона может отличаться от примера в инструкции.
  3. Укажите GGUF-файл, контекст и порт по инструкции; проверьте /health и выполните тестовый запрос. Не запускайте второй сервер на занятом порту.

Рекомендации по GPU

Учитывайте размер конкретного GGUF-файла, KV-кэш, контекст и число слоёв на GPU. Минимум шаблона не гарантирует размещение любой модели. Частичная загрузка слоёв на CPU требует системной RAM и меняет скорость работы.

Предустановленное ПО

Ubuntu 22.04CUDA 12.9llama.cppllama-server

Рекомендуемые GPU

Подробное руководство: читать в разделе «Решения» →

Кураторский шаблон Vast.ai — не приложение CloudCompute «в 1 клик».

Образ с предустановленным ПО: вы сами выбираете GPU и настраиваете доступ.

Запустить шаблон