Компания Stability AI представила новую версию Stable Audio с расширенным набором функций для создания звуковых клипов.
Наша новая модель поднимает генерацию музыки с помощью искусственного интеллекта на новый уровень, позволяя создавать аудио высокого качества продолжительностью до 3 минут. Каждый пользователь, включая бесплатных пользователей, может генерировать аудио длительностью до 3 минут.
Предыдущая версия могла генерировать аудиофайлы длительностью до 90 секунд. Stable Audio 2.0 создает треки в два раза длиннее и с большим количеством пользовательских настроек.
В отличие от предыдущей версии, новая модель может использовать звуковые клипы в качестве референса. Искусственный интеллект может подбирать стиль генерируемого аудио, что дает более точные результаты.
Представители компании утверждают, что модель способна создавать структурированные композиции с вступлением, развитием и концовкой. Также добавлена возможность создания звуковых эффектов.
Stable Audio основана на диффузионной модели, которая отличается от других ИИ-алгоритмов способом обучения. Модель получает коллекцию звуковых клипов с ошибками и задание восстановить оригинальный звук.
В новой версии используется латентная диффузионная модель, которая преобразует набор данных в математическую структуру, содержащую только важные детали. Это позволяет сократить объем информации, что уменьшает затраты.
Также добавлена новая нейронная сеть на основе архитектуры Transformer, которая учитывает контекстную информацию для получения более точных результатов.
Сочетание этих двух элементов позволяет создавать модель, способную распознавать и воспроизводить крупномасштабные структуры для создания высококачественных музыкальных композиций.
Stable Audio 2.0 доступен бесплатно для пользователей, а API позволяет другим компаниям интегрировать модель в свои приложения.
Ранее компания Adobe представила Project Music GenAI Control, который помогает людям создавать и редактировать музыку без опыта.
В феврале Stability AI анонсировала Stable Diffusion третьего поколения.