Whisper — это нейросетевая модель OpenAI для преобразования речи в текст, которая работает офлайн и поддерживает 99 языков. Она точно транскрибирует аудиосообщения, звонки и видеозаписи в печатный текст за счёт глубокого обучения на многоязычных данных. Используй Whisper через веб-интерфейс, API или локальную установку на своём компьютере.
Зачем это нужно
- Преобразование голосовых сообщений в текст для быстрого поиска по содержимому
- Создание субтитров для видеозаписей и вебинаров
- Экономия времени на ручном переводе речи в документы
- Архивирование аудиоконтента в текстовой форме
- Поддержка работы с аудио низкого качества и сильными акцентами
- Интеграция в рабочие процессы без облачных зависимостей
Способ 1: Использование веб-интерфейса OpenAI (самый быстрый)
- Перейди на сайт
openai.comи войди в свой аккаунт или создай новый. - Нажми на
APIв меню верхней навигации. - Перейди в раздел
Playgroundили откройте официальное веб-приложениеChatGPT. - Загрузи аудиофайл (поддерживаются форматы
.mp3,.wav,.m4a,.flac,.ogg). - Нажми кнопку
Transcribeили отправь запрос на транскрибирование. - Ожидай завершения обработки (время зависит от длины аудио).
- Скопируй полученный текст в буфер обмена или скачай в виде файла.
Способ 2: Установка Whisper локально через Python (для полного контроля)
- Установи Python версии 3.8 и выше с официального сайта
python.org. - Открой командную строку или терминал на своём компьютере.
- Выполни команду
pip install openai-whisperдля установки библиотеки. - Убедись, что на компьютере установлен
ffmpeg(требуется для обработки аудио). Для Windows скачай сffmpeg.org, для macOS выполниbrew install ffmpeg, для Linux выполниsudo apt-get install ffmpeg. - Поместь аудиофайл в удобную папку и запомни его полный путь (например,
C:\Audio\recording.mp3на Windows или/Users/username/Audio/recording.mp3на macOS). - В командной строке выполни команду
whisper /path/to/audio.mp3 --language ru(замени/path/to/audio.mp3на реальный путь,ru— код языка транскрибирования). - Ожидай завершения обработки. По умолчанию Whisper загружает модель
base(~140 МБ). Для большей точности используй--model mediumили--model large. - Результат сохранится в файл
audio.txtв той же папке. - Открой файл любым текстовым редактором (например,
Notepad,VS Code) и отредактируй текст при необходимости.
Способ 3: Использование Whisper через API (для интеграции в приложения)
- Зарегистрируйся на
openai.comи перейди в разделAPI keys. - Создай новый API-ключ и скопируй его в безопасное место.
- Установи библиотеку Python: выполни
pip install openaiв командной строке. - Создай новый Python-файл (например,
transcribe.py) в текстовом редакторе. - Вставь следующий код в файл:
from openai import OpenAI client = OpenAI(api_key="YOUR_API_KEY") audio_file = open("/path/to/audio.mp3", "rb") transcript = client.audio.transcriptions.create(model="whisper-1", file=audio_file) print(transcript.text)(ЗамениYOUR_API_KEYна твой реальный ключ и/path/to/audio.mp3на путь к файлу) - Сохрани файл и выполни команду
python transcribe.pyв командной строке. - Транскрибированный текст выведется в консоль.
- Чтобы сохранить результат в файл, добавь в код строку:
with open("transcript.txt", "w") as f: f.write(transcript.text)
Способ 4: Использование веб-приложений третьих лиц (без кодирования)
- Найди в интернете сервис, использующий Whisper (например,
whisper.gg,transcriber.ai, или другие). - Загрузи аудиофайл через веб-форму на сайте.
- Выбери язык транскрибирования (если требуется).
- Нажми кнопку
TranscribeилиОбработать. - Скачай или скопируй полученный текст.
- Учти, что бесплатные сервисы могут иметь ограничения на размер файла и количество запросов в день.
Часто задаваемые вопросы
Какой размер аудиофайла поддерживает Whisper? API OpenAI поддерживает файлы до 25 МБ; локальная установка обрабатывает файлы большего размера, но требует больше оперативной памяти (минимум 4 ГБ для модели base).
Насколько точна транскрибция на русском языке? Whisper демонстрирует точность 85–95% для чистого русского речи; качество падает при сильных акцентах, фоновом шуме и техническом сленге.
Есть ли альтернативы Whisper? Да: Google Speech-to-Text, Microsoft Azure Speech Services, Yandex SpeechKit и локальные модели (например, DeepSpeech), но Whisper считается одной из самых точных и универсальных.