Скидка 5% при первом запуске GPU по промокоду Активировать скидку
Inference

инференс

Процесс получения предсказаний от обученной модели на новых входных данных.

Что такое инференс

Инференс (inference, «предсказание») — применение обученной нейросети к новым данным для получения выходов: текст, классификация, эмбеддинги, изображение. В отличие от обучения, веса модели при инференсе не изменяются.

Для LLM инференс — авторегрессивная генерация: модель пошагово предсказывает следующий токен, добавляет его к контексту и снова предсказывает, пока не достигнет <EOS> или max_tokens.

Инференс LLM: две фазы

Prefill — обработка входного промпта целиком, заполнение KV-кеша. Ресурсоёмкая, но однократная. Определяет TTFT.

Decode — авторегрессивная генерация по одному токену. Memory-bound: ограничена пропускной способностью GPU-памяти. Определяет TPOT.

Инференс vs обучение

Инференс Обучение
Веса Фиксированы Обновляются
Градиенты Не нужны Необходимы
VRAM Меньше Значительно больше
GPU-время Секунды/минуты Часы/дни
Параллелизм Батч запросов Данные + модель

На одном GPU можно обслуживать модель, требующую меньше VRAM для обучения в 3–5×: не нужны градиенты, оптимизатор, активации для backward pass.

Требования к GPU

Модель VRAM (BF16) Рекомендуемый GPU
7B ~14 ГБ RTX 4090 (24 ГБ)
13B ~26 ГБ A100 40GB
70B ~140 ГБ 2× A100 80GB или H100

С квантизацией (INT4) VRAM снижается в ~3–4×.

Связанные термины

  • prefill и decode — фазы инференса LLM
  • vLLM, TGI, Ollama — фреймворки инференса
  • serving — эксплуатация инференса как сервиса
  • TTFT и TPOT — метрики качества инференса
  • квантизация — снижение требований к VRAM

Готовы запустить GPU-задачу?

Запустить GPU-сервер