Как подготовить запись для локального распознавания речи
Понятный план для whisper.cpp: исходный файл, короткая проба и проверка расшифровки.
Сначала сделайте короткую пробу
Не начинайте с многочасовой лекции. Вырежьте минуту с обычной речью, тихим фрагментом и несколькими именами. Это покажет, подходит ли выбранная модель и насколько хорошо записан звук. Сохраните исходник отдельно.
Что делает whisper.cpp
Проект запускает модели распознавания Whisper локально. В официальном README есть инструкции сборки, загрузки весов и запуска примера. Требования различаются по размеру модели и оборудованию. Слова «работает локально» не означают, что любой большой вариант будет быстрым на вашем компьютере.
Подготовьте звук
В документации командного примера указан WAV с 16-битным PCM. Для подготовки файла можно использовать FFmpeg. Следующая команда создаёт отдельный WAV, приводит частоту к 16 кГц и сводит звук в один канал:
ffmpeg -i input.mp3 -ar 16000 -ac 1 -c:a pcm_s16le output.wavЧто проверить в тексте
- Имена, названия компаний, аббревиатуры и специальные термины.
- Числа, даты и единицы измерения.
- Тихие места, паузы и фоновую музыку: в них бывают лишние слова.
- Границы реплик, если говорят несколько человек.
Как сравнивать модели
Прогоните один и тот же короткий фрагмент через два подходящих варианта. Запишите время и число существенных ошибок. Размер модели сам по себе не отвечает на вопрос, устроит ли вас результат.
Готовая расшифровка — черновик. Для публичной цитаты прослушайте соответствующий фрагмент. Если запись содержит личные сведения, проверьте, что весь процесс действительно выполняется локально, без подключённого облачного сервиса.