Whisper на CPU или GPU: выбор модели на своих записях
См. также — глоссарий
Сначала выберите приемлемое качество текста, затем — дорогую видеокарту. Ускорение мало помогает, если исправление имён и пропущенных фраз занимает больше времени. Соберите небольшой эталонный набор: чистая речь, шум, тишина, характерные акценты и термины.
Модели в примере
| Модель | Для какого сравнения | Что проверить |
|---|---|---|
tiny |
Установка и проверка полного пути | Пригодность результата вне короткой чистой записи |
small |
Первое сравнение CPU/GPU | Пропуски слов, имена и шумные фрагменты |
medium |
Более крупная многоязычная модель | Улучшение качества относительно памяти и времени |
large-v3 |
Крупная модель для сложных записей | Окупается ли дополнительная обработка меньшим объёмом ручной правки |
Все четыре варианта многоязычные. Репозитории и фиксированные ревизии указаны в models.json. До offline-запуска загрузите нужную модель. Пример намеренно предлагает короткий список, а не произвольные репозитории.
В семействе Whisper также есть англоязычные .en и turbo. Для русской записи нельзя выбирать англоязычный checkpoint. Транскрибация сохраняет язык речи; отдельная задача перевода в Whisper переводит на английский, а turbo для неё не обучена. Пример выполняет только транскрибацию. См. описание моделей у разработчика.
CPU и GPU проверяйте отдельно
CPU INT8 позволяет проверить обработку редких записей без CUDA. Четыре потока по умолчанию — настройка для измерения, а не обещание уложиться в срок на четырёх vCPU. На время влияют соседние нагрузки, декодирование файла и загрузка модели.
На NVIDIA GPU сначала проверьте FP16, затем сравните INT8/FP16, если устройство это поддерживает. Доступные типы вычислений CTranslate2 зависят от оборудования и сборки. INT8 не гарантирует ускорение на любой карте: см. поведение квантования.
Память не ограничивается весами
Размер скачанной модели не равен потреблению RAM или VRAM. Память нужна состоянию декодирования, beam search, декодированному аудио и соседним процессам. Длинная сжатая запись может занять много системной RAM, даже если GPU-памяти хватает. Проверьте и самый длинный ожидаемый файл, и короткий тестовый фрагмент.
Цифры памяти в README оригинального Whisper относятся к его реализации. Это не фиксированные требования нашего примера на faster-whisper. Измерьте выбранные модель, precision и beam на конкретной машине: пиковую RAM/VRAM и ошибки. Не переносите чужой тест A100 в обещание производительности арендованной RTX.
Методика измерения поможет сравнить стоимость всей сессии и время ручной правки. Переходите к актуальным предложениям GPU, когда понятна нагрузка.
Готовы запустить?
Запустить GPU-сервер