Локальная модель Whisper для быстрой расшифровки лекций на ПК

Как настроить локальную модель Whisper для быстрой расшифровки лекций на ПК

Локальная модель Whisper позволяет расшифровывать аудиозаписи лекций прямо на вашем ПК без интернета за несколько минут. Для этого нужно установить Python, скачать Whisper от OpenAI, загрузить выбранную модель и запустить расшифровку через командную строку или графический интерфейс.

Что потребуется для установки

  • Python версии 3.9 или выше
  • Менеджер пакетов pip (устанавливается вместе с Python)
  • Видеокарта NVIDIA с поддержкой CUDA (опционально, для ускорения)
  • Минимум 4 ГБ оперативной памяти
  • Свободное место на диске: 1–5 ГБ в зависимости от размера модели
  • Аудиофайлы лекций в формате MP3, WAV, M4A или другом популярном формате

Пошаговая инструкция по установке и настройке

  1. Откройте сайт python.org и скачайте Python 3.11 или выше (убедитесь, что версия совместима с вашей ОС).
  2. Запустите установщик и отметьте флажок Add Python to PATH перед нажатием кнопки Install Now.
  3. После завершения установки откройте командную строку: нажмите Win+R, введите cmd и нажмите Enter.
  4. Проверьте установку Python, введя команду python --version.
  5. Обновите pip до последней версии: python -m pip install --upgrade pip.
  6. Установите Whisper: pip install openai-whisper.
  7. Дождитесь завершения установки (может занять 1–2 минуты).
  8. Создайте на диске папку для проекта, например C:\Whisper_Work.
  9. Поместите аудиофайлы лекций в эту папку.
  10. Откройте командную строку и перейдите в созданную папку: cd C:\Whisper_Work.
  11. Загрузите нужную модель Whisper (first time это может занять 5–15 минут в зависимости от скорости интернета): whisper audio.mp3 --model base (замените audio.mp3 на название вашего файла).
  12. Дождитесь завершения расшифровки — на экране появится полный текст лекции.
  13. Найдите готовый файл с расшифровкой в папке C:\Whisper_Work — он будет назван как исходный файл с расширением .txt.

Выбор размера модели для оптимальной скорости

Whisper предлагает пять размеров моделей с разной точностью и скоростью обработки:

  • tiny — самая быстрая, но менее точная (требует 1 ГБ памяти)
  • base — оптимальный баланс скорости и точности (требует 1 ГБ памяти)
  • small — высокая точность, среднее время обработки (требует 2 ГБ памяти)
  • medium — очень точная, но медленнее (требует 5 ГБ памяти)
  • large — максимальная точность, самая медленная (требует 10 ГБ памяти)

Для лекций на русском языке рекомендуется использовать модель base или small. Чтобы выбрать другую модель, измените команду на: whisper audio.mp3 --model small.

Ускорение расшифровки с помощью CUDA (для видеокарт NVIDIA)

  1. Скачайте CUDA Toolkit версии 11.8 или выше с сайта nvidia.com/cuda-downloads.
  2. Установите CUDA, следуя стандартной процедуре на вашей системе.
  3. Установите cuDNN (Deep Neural Network library) с той же версией CUDA.
  4. Переустановите PyTorch с поддержкой CUDA: pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118.
  5. Переустановите Whisper: pip uninstall openai-whisper, затем pip install openai-whisper.
  6. Запустите расшифровку — она будет выполняться в 3–5 раз быстрее: whisper audio.mp3 --model base --device cuda.

Использование графического интерфейса (GUI)

Если вам неудобно работать с командной строкой, установите оболочку для Whisper:

  1. Установите пакет whisper-gui: pip install whisper-gui.
  2. Запустите приложение: whisper-gui.
  3. В открывшемся окне выберите кнопку Open File и укажите путь к аудиофайлу.
  4. Выберите размер модели из выпадающего списка.
  5. Нажмите кнопку Transcribe и дождитесь завершения.
  6. Сохраните результат кнопкой Save.

Обработка нескольких файлов одновременно

Для расшифровки всех аудиофайлов в папке используйте цикл в командной строке:

  1. Откройте командную строку в папке с файлами.
  2. Введите команду для Windows: for %f in (*.mp3) do whisper "%f" --model base.
  3. Для macOS и Linux используйте: for f in *.mp3; do whisper "$f" --model base; done.
  4. Нажмите Enter и дождитесь обработки всех файлов.

Настройка языка расшифровки

По умолчанию Whisper автоматически определяет язык, но вы можете явно указать русский язык для повышения точности:

  1. Используйте параметр --language ru при запуске: whisper audio.mp3 --model base --language ru.
  2. Для других языков замените ru на соответствующий код (например, en для английского, fr для французского).

Часто задаваемые вопросы

Как ускорить расшифровку медленнее всего идёт? Установите CUDA для вашей видеокарты NVIDIA или используйте модель tiny вместо base — это ускорит процесс в 2–5 раз, хотя точность слегка упадёт.

Whisper требует интернет для работы? Нет, после первой загрузки модели (которая требует интернета) все последующие расшифровки работают полностью в офлайне.

Как изменить формат выходного файла с текста на другой? Используйте параметр --output_format: whisper audio.mp3 --model base --output_format srt для создания файлов субтитров (доступны форматы txt, vtt, srt, json).

Похожие материалы

Нейросеть AudioCraft для генерации звуков по текстовому ТЗ
RDP или AnyDesk не передают звук с удаленного ИИ сервера
ИИ Udio для генерации треков в хорошем качестве