OpenAI представила Jukebox — нейросеть для генерации музыки в различных жанрах и стилях, включая пение. Модель и её код доступны для изучения.
Кратко:
- ●Jukebox генерирует музыку в формате raw audio.
- ●Модель работает на основе VQ-VAE и трансформеров.
- ●Генерация занимает до 9 часов на минуту аудио.
- ●Код и примеры доступны на GitHub и Sample Explorer.
Jukebox — новая эра в генерации музыки
В апреле 2020 года OpenAI представила Jukebox — нейросеть, способную генерировать музыку с элементами пения. Это первый крупный проект, который позволяет создавать raw audio в различных жанрах и стилях артистов, включая пение.
Технические особенности
Архитектура Jukebox основана на иерархическом VQ-VAE (Vector Quantized Variational Autoencoder). Это позволяет сжимать сырой аудиосигнал до дискретных кодов и генерировать его обратно с помощью автогрессивных трансформеров. Модель включает три уровня сжатия: 8×, 32× и 128×, что позволяет сохранять тембр, громкость и мелодику.