инференс
Процесс получения предсказаний от обученной модели на новых входных данных.
Что такое инференс
Инференс (inference, «предсказание») — применение обученной нейросети к новым данным для получения выходов: текст, классификация, эмбеддинги, изображение. В отличие от обучения, веса модели при инференсе не изменяются.
Для LLM инференс — авторегрессивная генерация: модель пошагово предсказывает следующий токен, добавляет его к контексту и снова предсказывает, пока не достигнет <EOS> или max_tokens.
Инференс LLM: две фазы
Prefill — обработка входного промпта целиком, заполнение KV-кеша. Ресурсоёмкая, но однократная. Определяет TTFT.
Decode — авторегрессивная генерация по одному токену. Memory-bound: ограничена пропускной способностью GPU-памяти. Определяет TPOT.
Инференс vs обучение
| Инференс | Обучение | |
|---|---|---|
| Веса | Фиксированы | Обновляются |
| Градиенты | Не нужны | Необходимы |
| VRAM | Меньше | Значительно больше |
| GPU-время | Секунды/минуты | Часы/дни |
| Параллелизм | Батч запросов | Данные + модель |
На одном GPU можно обслуживать модель, требующую меньше VRAM для обучения в 3–5×: не нужны градиенты, оптимизатор, активации для backward pass.
Требования к GPU
| Модель | VRAM (BF16) | Рекомендуемый GPU |
|---|---|---|
| 7B | ~14 ГБ | RTX 4090 (24 ГБ) |
| 13B | ~26 ГБ | A100 40GB |
| 70B | ~140 ГБ | 2× A100 80GB или H100 |
С квантизацией (INT4) VRAM снижается в ~3–4×.
Связанные термины
Готовы запустить GPU-задачу?
Запустить GPU-сервер