Whisper на CPU или GPU: выбор модели на своих записях

См. также — глоссарий

Сначала выберите приемлемое качество текста, затем — дорогую видеокарту. Ускорение мало помогает, если исправление имён и пропущенных фраз занимает больше времени. Соберите небольшой эталонный набор: чистая речь, шум, тишина, характерные акценты и термины.

Модели в примере

Модель Для какого сравнения Что проверить
tiny Установка и проверка полного пути Пригодность результата вне короткой чистой записи
small Первое сравнение CPU/GPU Пропуски слов, имена и шумные фрагменты
medium Более крупная многоязычная модель Улучшение качества относительно памяти и времени
large-v3 Крупная модель для сложных записей Окупается ли дополнительная обработка меньшим объёмом ручной правки

Все четыре варианта многоязычные. Репозитории и фиксированные ревизии указаны в models.json. До offline-запуска загрузите нужную модель. Пример намеренно предлагает короткий список, а не произвольные репозитории.

В семействе Whisper также есть англоязычные .en и turbo. Для русской записи нельзя выбирать англоязычный checkpoint. Транскрибация сохраняет язык речи; отдельная задача перевода в Whisper переводит на английский, а turbo для неё не обучена. Пример выполняет только транскрибацию. См. описание моделей у разработчика.

CPU и GPU проверяйте отдельно

CPU INT8 позволяет проверить обработку редких записей без CUDA. Четыре потока по умолчанию — настройка для измерения, а не обещание уложиться в срок на четырёх vCPU. На время влияют соседние нагрузки, декодирование файла и загрузка модели.

На NVIDIA GPU сначала проверьте FP16, затем сравните INT8/FP16, если устройство это поддерживает. Доступные типы вычислений CTranslate2 зависят от оборудования и сборки. INT8 не гарантирует ускорение на любой карте: см. поведение квантования.

Память не ограничивается весами

Размер скачанной модели не равен потреблению RAM или VRAM. Память нужна состоянию декодирования, beam search, декодированному аудио и соседним процессам. Длинная сжатая запись может занять много системной RAM, даже если GPU-памяти хватает. Проверьте и самый длинный ожидаемый файл, и короткий тестовый фрагмент.

Цифры памяти в README оригинального Whisper относятся к его реализации. Это не фиксированные требования нашего примера на faster-whisper. Измерьте выбранные модель, precision и beam на конкретной машине: пиковую RAM/VRAM и ошибки. Не переносите чужой тест A100 в обещание производительности арендованной RTX.

Методика измерения поможет сравнить стоимость всей сессии и время ручной правки. Переходите к актуальным предложениям GPU, когда понятна нагрузка.

Все инструкции по Whisper · Скачать пример

Готовы запустить?

Запустить GPU-сервер