Клонирование голоса через RVC (Retrieval-based Voice Conversion) настраивается локально на компьютере путём установки приложения, загрузки или обучения модели и обработки аудиофайлов через веб-интерфейс. Процесс занимает 15–30 минут при наличии видеокарты NVIDIA и требует минимальных технических навыков.
Почему может потребоваться RVC
- Создание синтетического голоса певца или персонажа для музыкальных проектов без авторских отчислений.
- Озвучивание видеоконтента голосом конкретного человека при наличии образца его речи.
- Экспериментирование с голосовыми эффектами и трансформацией акцента, пола, возраста говорящего.
- Обработка аудио полностью на своём компьютере без загрузки на облачные сервисы (приватность данных).
Пошаговая инструкция по настройке RVC
- Скачайте исходный код RVC с GitHub. Откройте браузер, перейдите на
github.com/RVC-Project/Retrieval-based-Voice-Conversion, нажмите зелёную кнопкуCodeи выберитеDownload ZIP. - Распакуйте архив в удобную папку на системном диске (например,
C:\RVCна Windows или~/RVCна macOS/Linux). - Установите Python версии 3.9 или 3.10. Скачайте с официального сайта
python.orgи при установке отметьте опциюAdd Python to PATH. - Откройте командную строку (на Windows нажмите
Win+R, введитеcmd, нажмитеEnter). - Перейдите в папку RVC командой
cd C:\RVC(или путь к вашей папке). - Установите зависимости выполнением команды
pip install -r requirements.txt. Дождитесь завершения (может занять 5–10 минут). - Если у вас видеокарта NVIDIA, установите дополнительный пакет
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118для ускорения обработки. - Запустите веб-интерфейс командой
python infer-web.py. - Дождитесь появления сообщения в консоли с адресом типа
http://127.0.0.1:7865илиhttp://localhost:7865. - Откройте браузер и перейдите по этому адресу. Загрузится веб-интерфейс RVC.
- Скачайте готовую модель голоса. В интерфейсе перейдите на вкладку
Model, нажмите кнопкуDownload Modelи выберите голос из списка (например,hugging_faceили скачайте с популярного источника, напримерhuggingface.co). - Поместите скачанную модель (файл
.pth) в папкуweightsвнутри директории RVC. - На вкладке
InferenceнажмитеRefreshв разделеModel, чтобы приложение обнаружило вашу модель. - Выберите загруженную модель из выпадающего списка.
- В поле
Upload audio fileзагрузите аудиофайл (MP3, WAV или другой поддерживаемый формат) с голосом, который нужно преобразовать. - Установите параметр
Pitch(высота тона): оставьте 0 для сохранения оригинального тона или отрегулируйте значение (например, +12 для повышения на октаву). - Нажмите кнопку
Convertи дождитесь обработки (время зависит от длины аудио и мощности ПК). - После завершения скачайте готовый аудиофайл, нажав кнопку
Downloadили найдя результат в папкеoutputs.
Часто задаваемые вопросы
Какие минимальные требования к компьютеру? Процессор Intel/AMD с минимум 4 ядрами, 8 ГБ оперативной памяти и видеокарта NVIDIA с 2 ГБ памяти (или работа на CPU, но медленнее в 10–20 раз).
Могу ли я обучить модель на собственном голосе? Да, загрузьте 10–30 минут аудиозаписей вашего голоса в папку datasets, используйте вкладку Train для создания пользовательской модели (процесс займёт 1–3 часа в зависимости от объёма данных).
Почему приложение не запускается после установки? Проверьте версию Python (python --version), переустановите зависимости командой pip install --upgrade -r requirements.txt и убедитесь, что вы находитесь в правильной директории RVC при выполнении команды.