В последние недели собрал и протестировал 15 пользовательских 1 моделей (CM). Не претендую на полноту изучения опции, но надеюсь, что кому-то мой опыт сэкономит время. Основной вопрос: как на поведение модели влияют материал для тренировки (DS), стили, Lyrics и параметры.

1 Идея витала в воздухе, как только народ услышал генерации очень похожие на известных артистов. В Udio/ Suno требовались танцы с бубном, в Sonauto (ныне Treblo) достаточно было ввести имя в промпт. В конце 2024 г. один проф. певец задал мне вопрос: "Как генерить с моим голосом и манерой?". Сделал его RVC-модель, он: "Тембр точно мой, но манера не везде", а с DS для Suno v3.5: "... похоже, и тембр, и манера. А можно, чтобы вообще как я и чистый звук?" Ответ: "Нужна ваша собственная модель".

Кажется, первыми CM предложили Mureka (Personalized Model): DS из 100+ треков (до 4 мин.), разовый платеж $100-200, тренировка ~3 ч. (сам не пробовал). Zaptrem (основатель Sonauto) на запрос о CM ответил, что не раньше v3. Локальные/ "открытые" инструменты я не смотрел (в своё время помучился с RVC на Google Colab и HuggingFace), но … как-нибудь попробую.

Во всех экспериментах с муз. ИИ меня интересовало 2 момента: а) как это устроено; б) как облагородить свои треки — придать правильное и "живое" звучание. Я не профессионал, но мне не нужно, чтобы ИИ за меня сочинял. Думаю, композитору важно самому отвечать за каждую ноту. Хотя можно и так: "Сгенери в моём стиле, а я выберу".

"Наевшись" вариативности с Persona, Your Voice, да и вообще с генерацией в Suno, я решил тестировать CM сразу на ярком материале. У меня не было и нет планов создавать несуществующие песни знаменитостей 2, но с DS из треков известных певцов поведение CM (похоже/ непохоже) должно быть очевидным для многих. Suno не работает с хитами, но пропускает генерации от Sonauto/ Treblo, т.к. мелодия и текст другие. Треки очень близки к реальным артистам — если не фанат, решишь, что просто не слышал эту песню.

2 К слову, некоторые артисты разрешили использовать свои вокальные клоны: R.Travis, Grimes, Sia, Alec Benjamin, Charlie Puth и др. И до ИИ вокалисты подражали знаменитостям, часто успешно. Теперь ИИ выдаёт похожие треки, но грань "похожести" размыта — окончательное решение за людьми, в суде.

Всего моделей на аккаунте 3. Т.ч. хочешь новую — удаляй существующую. Не такая большая проблема, когда треки (+ описания) загружены; единственное — придётся ещё раз потратить 100 кредитов.

DS для CM в Suno v5.5: минимум — 6 треков, лучше — более 24. Длительность трека — от 10 сек до 4 мин.

Список моделей. Привожу CM в порядке их создания, с кратким описанием DS. (Материалы по ходу тестов выкладывал в каналах в MAX и VK, что-то — на сайте.)

CM1 — DS: 19 треков "Стинга" 3 от Sonauto/ Treblo v2. Описания — авто от Suno.

CM2 — DS: 30 треков "Стинга" от Sonauto/ Treblo v3. Описания — авто от Suno.

3 Треки, по большей части джазовые. Хотя слушатель привык к др. звучанию певца и хотелось услышать что-то похожее на "Shape of My Heart", "Fields of Gold", ан нет: генерации артистов у Treblo немного странные, кажется, что DS включал только музыку 1970-х. Качество с v3 заметно выше v2.

CM3 — DS: 11 треков от Suno, сгенерированных с разными моими голосами (Your Voice). Все они с одним Style (1950s Rock and roll, rhythm & blues, 12 bar blues, rockabilly) — характер одинаковый. Описания к каждому треку сделал сам, вроде такого: "Tonality: C Major Key, Tempo 97 BPM; Meter 4/4, acoustic drums, electric guitar, overdriven guitar, saxophone, brass hits, finger bass, grand piano, male singer".

CM4 — DS: 12 треков друга, певца-любителя. В основном известные песни: из 22 Suno не пропустил 10. По стилю чаще лирика (медленные), но разброс большой. Описания к каждому треку сделал сам. Темпы: 72-134 BPM.

CM5 — DS: 12 черновых треков друга, проф. композитора, в разных стилях, "сборная солянка": некоторые — просто пение под гитару, записанные на тел., некоторые — с кассет, 20-летней давности. Описания — вручную. Темпы: 73-138 BPM.

CM51 — DS: 23 черновых (без включения откровенно грязных) трека друга, проф. композитора, в разных стилях. Описания — вручную. Темпы: 70-146 BPM.

CM6 — DS: 6 фортепианных треков с описанием (En): "Авангардная фортепианная пьеса без чётко выраженной тональности, с переменным темпом, текстурно различимыми разделами и преимущественно атональным звучанием. Помимо фортепиано, в ней не используются другие инструменты". Все треки — перекомпоновка 6 исходных фактур: в каждом треке они стояли в разной последовательности и были искажены (по оси времени, амплитуде и высоте нот). Т.е. по факту это один и тот же материал.

CM7 — модель не "по правилам" — только на своём вокале. DS: 7 "спокойных" DS (Normal, Breathy, SongSet, OneSong1, OneSong2, VowelsVib, VowelsSung), использованных для создания голосовых моделей (Your Voice). Для всех описания, типа: "Male vocal track (a cappella), baritone, free performance; Different Singing Styles in Russian; Probable tonality: A minor, Probable tempo: 93 BPM".

CM8 — DS: 10 треков "А.Челентано" от Sonauto/ Treblo v2 и v3. Описания к каждому треку сделал сам.

CM81 — DS: 10 вокальных треков "А.Челентано" (Split Voc/Instr. тех, что использованы в CM8).

CM9 — DS: 10 треков "Шакиры" от Sonauto/ Treblo v2 и v3.

CM91 — DS: 10 вокальных треков "Шакиры" (Split Voc/Instr. тех, что использованы в CM9).

CM10 — DS: 6 треков из одной (!) своей композиции ("Alove", CD, Канада, 2005. Текст — А.Яковлев, вокал — Е.Силантьева, рояль — Р.Столяр). 5 треков получены из оригинального путем транспорта (± 2 полутона) и изменения темпа (±10%). В некотором смысле это более строгое продолжение опыта с CM6. Здесь не было перекомпоновки частей, а только масштабирование: по времени (X) и частоте (Y).

CM52 — DS: 16 черновых танцевальных треков друга, проф. композитора. Описания — вручную. Темпы: 114-138 BPM.

CM53 — DS: 8 черновых лирических (медленных) трека друга, проф. композитора. Описания — вручную. Темпы: 62-98 BPM.

Соображения о работе моделей — в постах в MAX, VK. Ниже — попытка сделать некоторые выводы.

Описание загружаемого трека.

При загрузке трека Suno автоматически создаёт описание, транскрибацию голоса (Lyrics) и структуру композиции. Последнее выполняется обычно неплохо, а вот с описанием — какой-то ужас: загрузил вокал — получил описание оркестра, загрузил примитивный черновик GM MIDI — описание проф. записи. Причём темп и тональность определяется неверно, да и размер, если это не 4/4. Странно, ведь нормальные алгоритмы, как, например, в проекте Essentia , доступны.

Мне показалось, что верное описание должно влиять на тренировку модели, поэтому, начиная с CM3, я стал делать описания сам. Key, BPM — в Tunebat (есть и др. сервисы), можно на слух и вручную, но так быстрее и несомненно точнее, чем делает Suno. Key, Tempo, Meter здесь как сетка координат, где разночтения почти исключены: 140 и 70 BPM, C major/ A minor, 4/4 и 2/4 — не в счёт. Жанры/ стили я не описывал (они часто смешанные). Решил, что указание инструментов — проще и однозначнее. В общем, слушал и прописывал инструменты. Получалось примерно как в CM3, CM7.

Время тренировки модели.

Сразу удивила быстрота — ~3 мин. (у Mureka 3 часа!). Ладно, возможно, это связано с выделенными ресурсами и улучшенными алгоритмами. Потом стал думать, что часть времени уже потрачена при создании модели одного трека (загрузка, расшифровка, описание) — иногда это 15 сек, а иногда 5 мин. Считается, что при тренировке CM "базовая" модель "дотренировывается" на пользовательском DS. Мне удобнее представлять всё как "сложение" моделей.

Выводы

1. Чем стилистически однороднее треки в DS (правда, не до такой степени, как в CM10), тем ближе генерации к исходному материалу. Не стоит смешивать Dance и Pop Ballad (как у меня в CM4, CM5, CM51), даже если это треки одного автора. Я бы исключал дуэты и бэки, чтобы "не вылезли", когда не требуется. Генерация без стиля (NoStyle), как и прописывание в Style описаний, что были использованы при загрузке, также повышает похожесть.

2. В генерации всегда будет присутствовать что-то, чего в DS не было. Даже если генерить инструментал (без стиля/ NoStyle и с параметрами 0%) из DS, где только инструментал. Lyrics автоматически "подтягивает" явную ритмику и гармонию даже с DS, в котором ни того, ни другого не было (CM6). Т.ч. CM — не совсем ваша модель.

3. CM на однородном материале можно заставить работать и не в своём стиле. Добавление сольного инструмента не так критично, но радикальная смена ритма и темпа приведёт к генерации, далёкой от DS.

4. CM можно сочетать с Your Voice и Audio Upload (Cover), при этом свои характерные признаки она будет заметно терять.

5. Композитор может создать свою модель (авторские мелодии, гармония, ритмика), собрав DS из того, что сыграл на клавишах, т.е. без загрузки полноценных треков (CM6). В этом случае он ещё получает дополнительную свободу в выборе стиля генерации: если в DS Overdriven Guitar, то избавиться от неё будет непросто, а если в DS только Grand-piano, то добавить можно всё что угодно.

6. Известный артист, у которого сотни треков, собрать CM в Suno не сможет — ирония судьбы. Выход — тренировать на др. ресурсах, запускать всё локально на мощном ПК. Или танцы с бубном: искать неопубликованные версии, переигрывать на рояле, записывать варианты с другим текстом и т.п.

7. Отдельно по вокалу.

CM3. Модель на разных моих голосах выдаёт похожий и усреднённый голос, более гарантированно, чем генерации с Your Voice. При этом излишней эмоциональности (смешков, стёба) не было. Генерации близки к характеру DS даже при отличающихся Styles.

CM7. Эта чисто "вокальная" CM выдаёт очень похожий на меня тембр. В генерациях нивелированы "косяки" интонирования, а деградация тембра к концу трека не так заметна. DS был по сути лирическим, поэтому Suno применил дефолтный голос со стилем "Slow rap, hip-hop, minor key". Если в DS только вокал, у вас больше свободы в задании стиля — можно генерить в разных жанрах.

CM4, CM5, CM51, CM52, CM53. Голоса друзей, хотя и приглажены, узнаваемы, диапазон немного расширен вверх. Стилистика DS явно проглядывается. Композитор: "Вот это же моя мелодическая фраза, гармония!". Несколько генераций признал "своими" песнями и теперь будет записывать вживую.

CM1, CM2, CM8, CM81, CM9, CM91 — при том, что "Стинг", "А.Челентано", "Шакира" это — копия с копии, в генерациях они достаточно похожи. Не факт, что такой же результат будет с др. артистами, у которых более усреднённые голоса и манеры.

Если DS составлен правильно, то в целом CM на своём голосе или клоне известного артиста, кажется рабочим подходом создания виртуального исполнителя, когда генерации гарантированно будут с одинаковым тембром и манерой в достаточно широком диапазоне стилей. Но, как и с Your Voice, добавление в промпт описания вокала, не соответствующего его характеру, обычно приводит к переключению на дефолтный.

Кому CM может быть полезной?

а) Мне видится ценной генерация со своим голосом. Кто поработал с Your Voice может попробовать CM как альтернативу или дополнительный инструмент.

б) Очень интересными показались генерации "скрещивания" абстрактного и типичного (CM6), например трек "Надежды всмятку" (Пр5). В музыкальном мире немало виртуозных пианистов и немало композиторов, свободно оперирующих разными стилями. Но музыкантов, совмещающих обе эти грани, крайне мало. В этой генерации, как мне кажется, удивительный сплав авангарда с шансоном/ романсом. Наверное, с CM композитор может расширить свои жанровые границы, не отказываясь от своего "я".

в) Исполнителям, и проф., и любителям часто присылают тексты, демо-песни с не всегда удачной аранжировкой. С CM певец может генерить сразу в своей манере и в нужном стиле — регистр, фразировка, интонации — всё "родное".


Повторюсь: результаты тестов с CM выкладывал в MAX, VK.
Примеры для всех моделей до 1 сентября будут на сайте.

P.S. Полгода назад была мысль приостановить тестирование муз. ИИ: одни стартапы закрываются, другие продаются, быстро меняется функционал, условия использования — как это всё отслеживать и изучать? Но тут Your Voice и Custom Model Suno v5.5, и я снова включился. В сентябре у Suno снова изменения. Наверное, данный материал недолго останется актуальным. С другой стороны, технологии и подходы общие, т.ч. этот опыт ещё может пригодиться.