Гайды

Как подготовить запись для локального распознавания речи

Понятный план для whisper.cpp: исходный файл, короткая проба и проверка расшифровки.

Редакция НейроДвижа. Проверено 2026-09-24.

Условная иллюстрация: Как подготовить запись для локального распознавания речи

Сначала сделайте короткую пробу

Не начинайте с многочасовой лекции. Вырежьте минуту с обычной речью, тихим фрагментом и несколькими именами. Это покажет, подходит ли выбранная модель и насколько хорошо записан звук. Сохраните исходник отдельно.

Что делает whisper.cpp

Проект запускает модели распознавания Whisper локально. В официальном README есть инструкции сборки, загрузки весов и запуска примера. Требования различаются по размеру модели и оборудованию. Слова «работает локально» не означают, что любой большой вариант будет быстрым на вашем компьютере.

Подготовьте звук

В документации командного примера указан WAV с 16-битным PCM. Для подготовки файла можно использовать FFmpeg. Следующая команда создаёт отдельный WAV, приводит частоту к 16 кГц и сводит звук в один канал:

ffmpeg -i input.mp3 -ar 16000 -ac 1 -c:a pcm_s16le output.wav

Что проверить в тексте

  • Имена, названия компаний, аббревиатуры и специальные термины.
  • Числа, даты и единицы измерения.
  • Тихие места, паузы и фоновую музыку: в них бывают лишние слова.
  • Границы реплик, если говорят несколько человек.

Как сравнивать модели

Прогоните один и тот же короткий фрагмент через два подходящих варианта. Запишите время и число существенных ошибок. Размер модели сам по себе не отвечает на вопрос, устроит ли вас результат.

Готовая расшифровка — черновик. Для публичной цитаты прослушайте соответствующий фрагмент. Если запись содержит личные сведения, проверьте, что весь процесс действительно выполняется локально, без подключённого облачного сервиса.

Что почитать дальше