Генерация музыки нейросетью: как собрать трек с нуля

Музыкальная модель берёт текстовое описание («меланхоличный инди-поп, женский вокал, 90 BPM, акустическая гитара») и выдаёт готовый аудиофайл: сведённый трек с вокалом, инструментами и структурой куплет-припев. Отдельных дорожек вы не получаете, редактировать бас или убрать один инструмент постфактум нельзя. Это финальный микс, и всё управление им происходит до нажатия кнопки.
Дальше по шагам: из чего собрать запрос, чем отличаются версии Suno, как получить минус без вокала, где обычно рассыпается результат и сколько это стоит в кредитах. Если хочется сразу пощупать процесс, есть отдельные страницы, чтобы создать песню из текста или превратить готовые стихи в песню.
Что нейросеть делает с музыкой и чего от неё ждать не стоит
Модель предсказывает звук целиком, а не собирает его из сэмплов по нотам. Поэтому она хорошо держит общий характер (жанр, плотность аранжировки, тембр голоса) и плохо держит точность: сыграть ровно ту гармонию, которую вы задумали, или повторить мотив из первого припева нота в ноту она не обязана.
Что получается стабильно:
- фоновая музыка под видео, подкаст, стрим;
- демо идеи песни: показать аранжировщику, «как примерно должно звучать»;
- джингл или короткая отбивка на 15-30 секунд;
- трек с вокалом на своём тексте, если вас устраивает чужой голос и чужая манера.
Чего ждать не стоит: сведения студийного уровня, предсказуемого повтора одной и той же мелодии между генерациями, точной длительности «ровно 47 секунд под монтаж» и корректного произношения редких слов и имён. Русский вокал модели поют, но артикуляция плавает сильнее, чем на английском. И результат почти всегда придётся отбирать: планируйте три-пять заходов на один нужный трек.
Из чего состоит запрос: жанр, настроение, инструменты, темп, вокал
Хороший запрос к музыкальной модели описывает звук, а не эмоции слушателя. «Красивая песня о любви» не даёт модели ничего, «медленный соул, женский низкий вокал, электроорган, щётки по барабанам, 70 BPM» задаёт почти всё.
Рабочий набор параметров, по порядку важности:
- Жанр и поджанр. Не «электроника», а «дип-хаус» или «эмбиент-техно». Чем уже, тем предсказуемее результат.
- Темп. В BPM. 60-80 для спокойного, 90-110 для среднего, 120-140 для танцевального.
- Инструменты. Три-пять штук: каждый лишний повышает риск каши в миксе.
- Вокал. Пол, регистр, манера: «мужской хриплый баритон», «детский хор», «шёпот». Или прямо «без вокала, инструментал».
- Настроение и контекст. «Спокойное, для работы», «тревожное, кинематографичное».
- Продакшн-детали. «Винтажный шум», «лоу-фай», «сухая запись без реверба».
Чего в запросе быть не должно: имён живых исполнителей и названий групп как способа задать звук - такой трек становится проблемой при публикации. Вместо «как у [артиста]» пишите характеристики звука, которые вам в нём нравятся.

Версии Suno в Молекуле: чем отличаются и что выбрать под задачу
В каталоге доступны пять версий Suno. Разница между ними не только в качестве звука, но и в том, сколько текста модель принимает на вход и насколько связно держит длинную композицию.
| Версия | Что заявлено разработчиком | Под какую задачу |
|---|---|---|
| Suno V3.5 | text-to-music, 1-2 трека до 4 минут, вокал и инструментал | быстрая проба идеи, черновик |
| Suno V4 | лучшее качество вокала и инструментала, чем в V3.5 | фон под видео, простая песня |
| Suno V4.5 | промт до 5000 символов, более широкий стилистический диапазон | длинный текст песни, редкий жанр |
| Suno V4.5 Plus | расширенный длинный промт, сложные композиционные структуры, премиум-цена | трек с проработанной структурой |
| Suno V5 | лучшее качество вокала, когерентность длинных треков, широкий жанровый диапазон | финальный вариант, полная песня |
Практический порядок: черновики и перебор идей гоняйте на младших версиях, а когда описание устоялось, повторите тот же запрос на V5 или V4.5 Plus. Так вы платите премиум-цену один раз, а не пять.
Как сгенерировать первый трек: по шагам
Шаг 1. Соберите описание по каркасу ниже - буквально несколько строк, которые можно скопировать и заполнить.
Жанр: инди-фолк, акустический
Темп: 92 BPM
Инструменты: акустическая гитара, контрабас, тихий бубен
Вокал: мужской, негромкий, близко к микрофону, без двойного дубля
Настроение и продакшн: тёплое, вечернее; сухая запись, минимум реверба
Структура: куплет - припев - куплет - припев - короткий финал
Длительность: около 2 минутШаг 2. Запустите на младшей версии и послушайте первые 20 секунд: на этом отрезке уже слышно, попала модель в жанр и темп или нет.
Шаг 3. Правьте по одному параметру за раз. Изменили сразу жанр, инструменты и темп - и не поймёте, что дало улучшение. Обычно двух-трёх итераций хватает.
Шаг 4. Тот же финальный текст запроса отправьте в старшую версию. Сделайте два-три запуска: модель каждый раз даёт другой вариант.
Шаг 5. Проверьте результат в наушниках и в телефонном динамике. Микс, который развалился на встроенном динамике, развалится и у слушателя.
Проверить весь путь можно на одном готовом описании: запустить инструментальный лоу-фай трек на две минуты. Описание уже подставлено в поле, останется выбрать версию модели.
Текст песни: писать самому или поручить текстовой модели
Свой текст передаётся в том же запросе, рядом с описанием стиля. Версия V4.5 принимает промт до 5000 символов, у V4.5 Plus и V5 расчёт на длинные описания, так что полный текст песни туда влезает.
Что важно в тексте для вокальной модели:
- Разметка структуры. Помечайте части: куплет, припев, бридж. Без разметки модель сама решает, где припев, и часто решает неудачно.
- Короткие строки. 6-10 слогов. Длинные строки модель проглатывает или комкает.
- Простые слова. Аббревиатуры, латиница внутри русского текста, редкие имена произносятся плохо. Числа пишите словами.
- Повторяемость припева. Один и тот же текст припева дважды повышает шанс, что и мелодия повторится.
Если писать лирику самому не хочется, черновик можно сделать текстовой моделью: запрос вроде «напиши текст песни: два куплета и припев, тема - дорога домой, строки по 8 слогов, без сложных слов» на быстрых текстовых моделях стоит дешевле любой музыкальной генерации. Дальше текст всё равно надо вычитать: модели любят штампы, и первые две строки обычно приходится переписывать вручную.

Инструментал, минус и отдельные звуковые эффекты
Минус получается не отдельной кнопкой, а формулировкой запроса. Правило простое: в запросе на инструментал не должно быть ни одной строки текста песни, иначе модель попробует её спеть. Пишите «инструментал, без вокала» и добавляйте состав инструментов, темп, настроение.
Для минуса под свой вокал сразу задавайте структуру и оставляйте место: «восемь тактов вступления, затем куплет с разряженной аранжировкой, припев плотнее». Иначе аранжировка забивает всю частотную середину и петь поверх неё нечем.
Отдельная задача - короткие звуки, а не музыка: шаг по гравию, скрип двери, уведомление в интерфейсе. Для этого в каталоге есть ElevenLabs Sound Effects, генерация звуковых эффектов по описанию. Музыкальную модель на такие задачи гонять смысла нет: она всё равно попытается сделать из шороха композицию.
Что обычно идёт не так
Каша в миксе. Причина почти всегда одна: в запросе перечислено семь инструментов. Оставьте ритм-секцию плюс один-два ведущих инструмента.
Кривой вокал. Лечится не сменой модели, а правкой текста: разбейте длинные строки, замените слова с трудными стыками согласных, числа и сокращения напишите словами. Если строка ломается в трёх генерациях подряд, дело в строке.
Рассыпающаяся структура. Трек обрывается на середине фразы или превращается в бесконечный проигрыш. Помогает явно заданная структура в запросе и переход на версию, где заявлена связность длинных треков.
Не тот жанр. Модель услышала «мелодичный» и ушла в поп. Сужайте жанр до поджанра и добавляйте характерные признаки звука вместо оценочных прилагательных.
Одинаковые генерации. Если пять запусков дают почти одно и то же, описание слишком детальное. Уберите часть уточнений.
Сколько уходит кредитов и на каком тарифе это удобно
Внутри подписки расходуются кредиты, у каждой модели своя цена запуска, и она видна в интерфейсе рядом с моделью до отправки запроса. Смотрите её там: цифры меняются, и подставлять их в статью бессмысленно.
Порядок величин по каталогу: текстовые модели стоят от 1 кредита (DeepSeek V4 Flash, Gemini 3.5 Flash), у старших счёт идёт на десятки, картиночные от 8 до 67. Музыкальные генерации дороже текстовых, а старшие версии Suno дороже младших: у V4.5 Plus премиум-цена заявлена самим разработчиком.
Теперь про стоимость ошибки. Неудачный трек списывает столько же, сколько удачный, и повтор стоит ровно как первая попытка. Если на один нужный результат уходит четыре запуска, умножайте цену запуска на четыре и уже эту сумму сравнивайте с квотой.
По тарифам: на бесплатном квота 5 кредитов, этого хватит попробовать текстовые модели, но не музыку. Дальше «Про» с 2000 кредитов в месяц за 1649 рублей, «Эксперт» с 10000 за 7940 рублей и «Максимум» с 20000 за 9990 рублей. Квота обновляется каждый оплаченный период.
Права на результат: что проверить перед публикацией
Условия использования сгенерированного трека задаёт правообладатель модели, а не сервис доступа: Молекула даёт доступ к чужим моделям через свой интерфейс. Поэтому перед коммерческой публикацией смотрите правила вендора, а не пользовательское соглашение агрегатора.
Что проверить конкретно:
- Тариф и права. У многих музыкальных сервисов объём прав на результат зависит от уровня подписки у самого вендора.
- Чужие голоса и стили. Если в запросе фигурировало имя исполнителя или название группы, трек лучше не публиковать.
- Текст. Сгенерированную лирику прогоняйте на совпадения: модель может воспроизвести узнаваемые строки.
- Требования площадки. Стриминги и рекламные системы отдельно регулируют раскрытие того, что материал создан нейросетью.
Для внутреннего использования (фон в презентации, музыка в корпоративном видео, демо для музыканта) вопрос обычно не встаёт. Он встаёт там, где на треке появляется монетизация: реклама, стриминг, продажа. Разберитесь с этим до релиза, а не после.
Частые вопросы

Корпоративный доступ к ИИ-моделям
Счёт для юрлица, централизованная оплата, приоритетная поддержка
- Доступ к моделям ChatGPT, Gemini, Grok, Claude, DeepSeek
- Библиотека промтов и общий доступ внутри команды