Suno и Lyria 3 сглаживают музыку по-разному — это измерили на 800 треках

Опубликованный 6 августа препринт Зои Слендебрук и Данаэ Метаксы описывает аудит генераторов Suno и Lyria 3. Авторы создали по 100 инструментальных треков в четырёх жанрах для каждой системы — всего 800 записей — и сравнили их с человеческой музыкой по 72 вычисляемым аудиопризнакам.
Результат не сводится к утверждению, что вся музыка ИИ звучит одинаково. В этой выборке Lyria 3 сильнее уменьшала акустическое разнообразие внутри отдельных жанров, а Suno сохраняла более широкий внутренний разброс, но стирала различия между самими жанрами. Карточка работы в каталоге Hugging Face независимо фиксирует появление препринта и его центральный вывод, однако не является рецензией или повторной проверкой эксперимента.
Как сравнивали две системы
В аудит вошли афробит, K-pop, танцевальная поп-музыка и хеви-метал. Для каждого жанра исследовательницы сформировали одинаковые по размеру наборы генераций Suno, Lyria 3 и человеческих записей, чтобы сравнение не определялось численным перевесом одной группы.
Основной эксперимент использовал инструкции, составленные на основе характеристик человеческих треков. Все генерации делали инструментальными, после чего из них и из контрольной музыки брали 30-секундные фрагменты. Признаки охватывали ритм и тайминг, спектральную форму, тембр, текстуру, гармоническое содержание, повторяемость и динамику.
Авторы также провели отдельный контрольный эксперимент ещё на 800 генерациях. В нём запрос сокращали до названия жанра и требования не добавлять вокал. Эта дополнительная выборка нужна была, чтобы проверить, сохраняется ли наблюдаемый результат без подробных акустических указаний; число в заголовке относится только к основному эксперименту.
Что означает сглаживание внутри жанра
Разнообразие внутри жанра показывает, насколько далеко друг от друга расположены записи одной категории в пространстве измеренных признаков. Если хеви-метал-треки системы образуют более тесную группу, чем сопоставимые человеческие записи, это трактуется как сокращение внут жанрового акустического разброса.
Именно такой тип сглаживания работа обнаружила у Lyria 3. В трёх из четырёх исследованных жанров её генерации группировались плотнее человеческого ориентира. Речь идёт не обязательно о повторении одной мелодии или одинаковой структуре песен, а о меньшей вариативности набора характеристик, которые извлекал аналитический конвейер.
Контроль с короткими запросами сохранил эту общую картину. Это снижает вероятность того, что результат возник только из-за подробных инструкций, но не раскрывает причину: исследователи не имели доступа ни к обучающим данным, ни к весам модели, ни к внутреннему механизму отбора результата.
Как Suno стирала границы между жанрами
Различимость жанров — другой показатель. Он сопоставляет расстояния между центрами жанровых групп с разбросом записей внутри каждой группы. Две системы могут давать одинаково разнообразные треки внутри категорий, но отличаться тем, насколько отчётливо афробит отделяется, например, от танцевальной поп-музыки.
У Suno внутренний разброс не сжимался так, как у Lyria 3, однако жанровые группы сильнее перекрывались. Поэтому вывод об этой системе точнее формулировать не как «все её песни похожи», а как снижение акустической дистанции между четырьмя заданными жанрами. Разные композиции могли оставаться заметно удалёнными друг от друга, одновременно становясь менее характерными для своей категории по выбранному набору признаков.
Два результата не образуют шкалу с однозначным победителем. Lyria 3 в эксперименте чаще воспроизводила более узкий диапазон внутри жанра, тогда как Suno сильнее размывала межжанровую структуру. Кроме того, акустические профили самих систем не сходились в единую общую точку: сглаживание происходило разными способами.
Почему метрики не измеряют качество музыки
Аудит не устанавливает, какая модель пишет более выразительные, красивые или коммерчески успешные композиции. Вычисляемые признаки не оценивают убедительность мелодии, культурную уместность, эмоциональное воздействие, новизну замысла или предпочтения слушателей. В работе также не проводилось слепое прослушивание с участием музыкантов либо аудитории.
Официальная карточка Lyria 3 описывает её как систему синтеза музыки по текстовой инструкции и перечисляет собственные оценки качества, точности следования запросам и ограничения. Эти проверки отвечают на другие вопросы и не заменяют независимую оценку разнообразия относительно человеческих жанровых корпусов.
Есть и ограничения выборки. Эксперимент охватывает только две версии закрытых сервисов, четыре жанра и генерации, собранные в апреле–мае 2026 года. Часть человеческих записей содержала вокал, тогда как машинные треки были инструментальными; 30-секундные отрывки могут не отражать развитие полной композиции, а четыре широкие жанровые метки не охватывают всё культурное разнообразие музыки.
Насколько надёжен вывод сейчас
Дизайн исследования позволяет различить два типа измеримого акустического сглаживания и проверить их при подробных и минимальных запросах. Однако на 8 августа результат остаётся выводом одного свежего препринта: доступная независимая страница индексирует работу, но отдельной репликации, рецензии или публикации с повторным анализом тех же генераций пока нет.
Поэтому подтверждённое состояние истории уже, чем формулировка «ИИ делает музыку однообразной». В конкретном тесте Suno и Lyria 3 отклонялись от человеческих контрольных корпусов разными способами; распространить этот результат на другие модели, версии, жанры, полные песни или субъективное качество можно будет только после дополнительных сравнений и независимой проверки.
Читайте также:
Подпишитесь на рассылку
Получайте свежие новости Web3, AI и криптовалют прямо на вашу почту.