Как работают нейросети для музыки: я запустил такую модель на своём ноутбуке
Поставил генератор музыки прямо на ноутбук и разобрал, как эти модели устроены внутри: пошаговая инструкция, сервисы, тарифы, права и реальные способы заработка.
Мой MacBook считал 10 секунд музыки 8 минут 53 секунды. Показываю результат, объясняю устройство моделей простыми словами и разбираю рынок ИИ-музыки: чарты, иски лейблов, маркировка и на чём тут действительно зарабатывают.
• 13 лет опыта в маркетинге и продажах
• Более 1000 проектов
• Основатель портала Wake up Marketing
• Практикует маркетинг и внедрение ИИ в бизнес клиентов
Подпишитесь на Telegram-канал Дмитрия: дневник развития портала Wake up Marketing, билдера сайтов и приложений в Ноя и маркетплейса шаблонов. Плюс выжимка 13 лет опыта в суровом маркетинге и плоды 2 лет работы с ИИ 24/7
Нейросеть для музыки не знает нот и не пишет партитуру. Со звуком она обращается примерно так же, как языковая модель обращается с текстом: запись дробится на крошечные звуковые кусочки, модель предсказывает следующий кусочек по предыдущим, а потом цепочка разворачивается обратно в звук. Отсюда растут все её сильные стороны и все её странности.
Чтобы посмотреть на это вблизи, я поставил такую модель прямо себе на ноутбук. Без подписки, без карты, без интернета в момент работы. Мой MacBook считал 10 секунд музыки 8 минут 53 секунды и выдал файл, который я не подбирал и не переделывал: послушать эти 10 секунд.
Ниже я разобрал всё, что понял по дороге: как эти модели устроены внутри, как повторить запуск у себя пошагово и опасно ли это для рабочего компьютера, какие сервисы открываются из России и сколько стоят, что творится с ИИ-музыкой на рынке прямо сейчас, почему музыканты встретили её в штыки и на чём в этой теме действительно получается зарабатывать.
Начну с масштаба, потому что без него разговор про сервисы и тарифы висит в воздухе.
Стриминговый сервис Deezer считает сгенерированные треки собственным детектором и публикует статистику. В июне 2026 года на площадку приходило около 90 тысяч полностью сгенерированных треков в сутки, и впервые это превысило половину всех новых загрузок. В апреле было 75 тысяч и 44%, в январе 60 тысяч, а полутора годами раньше, когда детектор только запускали, всего 10 тысяч.
Дальше самое интересное. Слушают эту музыку мало: на неё приходится от 1 до 3% прослушиваний сервиса. И до 85% этих прослушиваний Deezer признаёт накруткой и не пускает в выплаты. То есть загружают горами, а слушают почти нет, и заметная доля даже этих цифр нарисована ботами.
В России картина похожая. Автор большого разбора на Хабре прогнал каталог Яндекс Музыки через свой детектор и получил больше трети треков с признаками генерации. Сам сервис подтвердил планы маркировать такие треки и уже собирает данные у правообладателей, а параллельно запустил редакторский плейлист «Люди ИИскусства» для авторов, которые используют нейросети как часть работы. Spotify с сентября 2026 года помечает отметкой AI Persona профили исполнителей, чей образ создан машиной.
При этом ИИ-исполнители уже добираются до чартов. Проект Xania Monet, за которым стоит поэтесса Telisha «Nikki» Jones, вошёл в радиочарт Billboard Adult R&B Airplay на 30-е место, поднялся до 3-го места в Hot Gospel Songs и получил контракт с Hallwood Media: торги дошли до 3 млн долларов. Тексты пишет живой человек, вокал и музыку делает Suno.
Крупные лейблы за год прошли путь от исков до сделок. Warner Music урегулировала спор с Suno и объявила партнёрство: сервис переходит на модели, обученные на лицензированном материале. Universal договорилась с Udio. Sony продолжает судиться.
Что я из этого вынес для себя. Порог входа в производство музыки упал до нуля, а порог входа во внимание слушателя поднялся: 90 тысяч треков в сутки конкурируют за те же уши. Заработок в этой теме почти не связан с количеством сгенерированного.
Почему музыканты встретили её в штыки
Этот вопрос я держу отдельно, потому что за ним стоят не эмоции, а деньги и авторство.
Деньги. Международная конфедерация авторских обществ CISAC заказала исследование о влиянии генеративных моделей на доходы авторов. Вывод: к 2028 году под риском 24% доходов музыкальных авторов, накопленные потери в музыке оцениваются в 10 млрд евро за пять лет. Речь про авторские общества по всему миру, то есть про профессиональных композиторов и авторов текстов, которые живут с отчислений.
Авторство. Модели обучены на записанной музыке, и первые поколения обучались без спроса. Именно на этом строились иски мейджоров. Автор, чья партия попала в обучающую выборку, теперь слышит похожий приём в чужом треке и не получает за это ничего.
Каталог. Ленты рекомендаций устроены так, что поток дешёвого материала вытесняет живые релизы просто объёмом. Площадка Bandcamp в январе 2026 года запретила полностью сгенерированную музыку, и музыканты встретили это радостно.
Ощущение подмены. Здесь самая неудобная часть. Deezer вместе с исследовательской компанией Ipsos дал слепой тест 9 000 слушателям в восьми странах: три трека, из них два сгенерированных, надо угадать. Не справились 97%. При этом 70% опрошенных считают такую музыку угрозой для заработка музыкантов, 73% называют неэтичным обучение моделей на защищённых записях без согласия авторов, а 80% хотят видеть на треках метку. Получается, что возражение касается способа появления музыки, а не её звучания.
Я не считаю этот скепсис глупостью. Человек, который двадцать лет учился играть, видит, как его ремесло превращается в кнопку, и его злость понятна. Мне ближе другая позиция: инструмент останется, а спор идёт о правилах, по которым им пользуются. Поэтому в статье я так подробно разбираю лицензии и маркировку, а не только кнопку «сгенерировать».
Способ зарабатывать на ИИ
Зарабатывайте на ИИ: собирайте сайты, приложения и ИИ-сотрудников
Всё собирается диалогом, без кода: описали задачу — смотрите, как получается
Берёте за это деньги с клиентов или закрываете задачи своего дела
Российский сервис: без VPN и иностранных карт, оплата в рублях
7 дней бесплатного пробного периода — платить не обязательно
Как это устроено внутри: числа вместо нот
Для модели запись звука это длинный ряд чисел: 32 000 замеров громкости на каждую секунду. В моём десятисекундном файле их 325 760.
Тот же трек в числах: 325 760 значений громкости, разложенных по частотам
Вот мой трек, разложенный по частотам: время идёт слева направо, высота звука снизу вверх, яркость показывает силу. Светлые полосы внизу это бас и основной тон, полосы выше это призвуки инструментов. На 3,5 секунде рисунок меняется: там у модели начинается новая часть.
Работает это в два приёма. Сначала отдельная модель-кодировщик сжимает звук в короткие звуковые «слова», их называют аудиотокенами: каждое такое слово описывает крошечный фрагмент записи. Потом главная модель предсказывает следующее слово по предыдущим, ровно как языковая модель предсказывает продолжение текста. Кодировщик разворачивает готовую цепочку обратно в звук.
Из этого устройства прямо следуют три вещи, с которыми вы столкнётесь на практике:
модели хорошо продолжают начатое и держат стиль, потому что предсказание следующего фрагмента это их прямая работа;
модели считают шаги генерации, а не секунды по таймеру, поэтому точное попадание в хронометраж у них хромает;
на выходе получается смешанный звук, а отдельные дорожки инструментов достаются только там, где сервис специально этому обучен.
Меня в этом устройстве зацепило вот что. Музыка казалась мне территорией, куда алгоритмы заходят последними: слух, вкус, живое исполнение. А фрагмент честно собрался из чисел прямо у меня на столе, и я смог посмотреть на него изнутри. Это не сделало тему проще. Наоборот, я впервые увидел, какой она глубины, и понял, что в технической части я тут пока лягушонок в океане.
Как я запустил генератор музыки на своём ноутбуке: пошагово
Это самая интересная часть опыта, поэтому разбираю её подробно. Дальше пошаговая инструкция, по которой запуск повторит человек, никогда не открывавший терминал. Если вам нужен только результат, а не устройство, пропустите этот раздел и идите к сервисам.
Зачем это вообще может понадобиться. Модель на своём компьютере работает без интернета, без аккаунта, без карты и без лимитов на количество треков. Ваш запрос никуда не уходит. За это вы платите временем и качеством: маленькая открытая модель заметно отстаёт от облачных сервисов.
Что понадобится
Обычный ноутбук. У меня MacBook на процессоре M3 Pro с 38 ГБ памяти, отдельной видеокарты нет. На Windows и Linux всё то же самое, отличается только команда запуска окружения. Ещё нужны 10 ГБ свободного места на диске и вечер: не потому, что работы много, а потому, что компьютер долго считает.
Шаг 1. Откройте терминал
На Mac это программа «Терминал» в папке «Утилиты», на Windows это «Командная строка» или PowerShell. Терминал это окно, куда вы вводите команды текстом. Ничего страшного там не происходит: команда выполняется только после нажатия Enter, а всё, что вы сделаете дальше, обратимо.
Шаг 2. Проверьте Python
Введите команду и нажмите Enter:
Код
python3 --version
Если в ответ пришла версия вроде Py thon 3.11.6, всё на месте. Если терминал ругается, что команды нет, скачайте Python с официального сайта и поставьте как обычную программу. Python это язык, на котором написаны почти все инструменты для нейросетей.
Шаг 3. Сделайте отдельную комнату для этой затеи
Библиотеки для нейросетей тяжёлые, и ставить их в систему целиком плохая идея: они перемешаются с тем, что у вас уже стоит. Поэтому создаётся виртуальное окружение, отдельная папка, внутри которой живёт свой Python со своими библиотеками. Удалите папку, и от затеи не останется следа.
Первая строка создаёт папку muzyka в вашем домашнем каталоге и переходит в неё. Вторая создаёт внутри окружение. Третья его включает: в начале строки терминала появится (venv), и это значит, что вы внутри своей комнаты. На Windows третья команда выглядит иначе: venv\Scripts\activate.
Шаг 4. Поставьте три библиотеки
Код
pip install torch transformers scipy
torch это математика и работа с процессором, transformers умеет скачивать и запускать готовые модели, scipy понадобится, чтобы записать результат в файл. Скачается примерно 1,5 ГБ, у меня это заняло несколько минут. У себя я работал с версиями torch 2.8.0 и transformers 4.57.6.
Шаг 5. Напишите 15 строк
Создайте в той же папке файл muzyka.py любым текстовым редактором и вставьте туда код:
Промпт
import torch, scipy.io.wavfile
from transformers import AutoProcessor, MusicgenForConditionalGeneration
model = MusicgenForConditionalGeneration.from_pretrained("facebook/musicgen-small")
processor = AutoProcessor.from_pretrained("facebook/musicgen-small")
device = "mps" if torch.backends.mps.is_available() else "cpu"
model.to(device)
zapros = "calm lo-fi background music for a coffee shop, soft electric piano, light brushes on drums, no vocals"
inputs = processor(text=[zapros], padding=True, return_tensors="pt").to(device)
audio = model.generate(**inputs, do_sample=True, guidance_scale=3.0, max_new_tokens=512)
chastota = model.config.audio_encoder.sampling_rate
scipy.io.wavfile.write("trek.wav", rate=chastota, data=audio[0, 0].cpu().numpy())
print("готово: trek.wav")
Что здесь происходит по строкам. Первые две загружают модель musicgen-small и её обработчик запросов: при первом запуске файлы скачаются сами. Строка с device выбирает, чем считать: mps это встроенный ускоритель процессоров Apple, на других машинах останется cpu. В переменной zapros лежит описание музыки словами. max_new_tokens=512 это длина: 512 шагов дают около 10 секунд звука, 1024 около 20. Последние строки записывают результат в файл trek.wav.
Шаг 6. Запустите и подождите
Код
python muzyka.py
Первый запуск скачает модель, у musicgen-small это 2,2 ГБ. Дальше компьютер считает. У меня загрузка модели в память заняла 167,9 секунды, а генерация 10,18 секунды музыки 533,4 секунды, то есть 8 минут 53 секунды. Соотношение получилось 52 к 1: почти минута вычислений на каждую секунду звука. В облаке та же задача занимает секунды, потому что там работают видеокарты с тысячами параллельных вычислителей вместо десятка ядер процессора.
Терминал в это время выглядит замершим, полоски прогресса нет. Это нормально, не закрывайте окно.
Шаг 7. Послушайте
В папке появится файл trek.wav, откройте его любым плеером. Мой результат я выложил целиком выше и ничего в нём не правил.
10,18 секунды звука, которые мой ноутбук считал 533 секунды
Что стоит знать заранее
Про размер. Модель musicgen-small содержит 586 884 674 числа. Это «маленькая» версия из трёх, и она уже в 11 000 раз больше сети из 50 890 чисел, которую я обучал распознавать цифры в разборе устройства нейросети. Есть версии medium и large, они лучше звучат и считают ещё дольше.
Про место на диске. У меня посреди генерации кончилось свободное место: система пишет служебные файлы вычислений, и они разрослись. Держите свободными 10 ГБ, чтобы не ловить эту ошибку.
Про лицензию, и это важнее всего остального. Модель MusicGen выложена под лицензией CC BY-NC 4.0, где NC означает «некоммерческое использование». Для опытов, учёбы и личных проектов она годится, для коммерческой работы юридически нет. Если нужен локальный запуск с правом продавать результат, смотрите в сторону других открытых моделей: у ACE-Step лицензия Apache 2.0, у Stable Audio Open своя лицензия Stability, которая разрешает коммерческое использование, пока годовая выручка компании ниже миллиона долларов.
Про то, куда всё это девать. Когда наигрались, удалите папку ~/muzyka и кэш скачанных моделей в ~/.cache/huggingface. У меня освободилось около 3 ГБ. Больше от эксперимента на компьютере ничего не остаётся.
Безопасно ли ставить такую модель на рабочий компьютер
Меня самого этот вопрос волновал: на ноутбуке рабочие проекты, доступы к серверам, ключи. Отвечаю по пунктам, что именно происходит.
Модель работает без интернета. После того как файлы скачаны, генерация идёт на вашей машине. Никакие запросы и никакие получившиеся треки никуда не отправляются, и это ровно та причина, по которой локальный запуск вообще интересен.
Библиотеки живут в отдельной папке. Виртуальное окружение из шага 3 изолирует установку: системный Python и другие ваши проекты не затрагиваются. Всё лечится удалением одной папки.
Файлы модели не содержат исполняемого кода. Веса musicgen-small лежат в формате safetensors, который придуман как раз для того, чтобы файл модели нельзя было превратить в способ запустить чужую программу. Старый формат .bin такую возможность имел, safetensors её закрывает, и библиотека transformers по умолчанию берёт именно safetensors.
Источник имеет значение. Я брал модель из официального репозитория авторов на Hugging Face, площадке, где выкладывают открытые модели. Это тот же принцип, что с программами: качать со страницы разработчика, а не с сомнительного зеркала.
Права не повышаются. Ничего не устанавливается в систему, не просит пароль администратора и не лезет в автозагрузку. Работает под вашим обычным пользователем.
Реальные риски здесь бытовые: компьютер греется и шумит под нагрузкой, диск занимают гигабайты скачанного, а на ноутбуке от батареи такая задача съедает заряд. У меня во время генерации ничего не пострадало, и после удаления папок машина вернулась в исходное состояние.
Что я советую человеку, у которого на ноутбуке боевые рабочие данные: не ставить наугад модели из случайных репозиториев, не запускать чужие скрипты установки одной строкой, не отдавать окружению больше прав, чем ему нужно. Обычная гигиена, тут она ровно та же, что с любой программой.
Четыре разные задачи, которые называют одним словом «музыка»
Половина разочарований в этой теме возникает от того, что человек взял инструмент под чужую задачу. Задач четыре, и сервисы под них разные.
Песня с вокалом и словами. Поздравление клиенту, гимн компании, трек для корпоратива, музыкальный ролик в соцсети. Тут сильны Suno и Udio: голос генерируется вместе с музыкой, структура куплет-припев модели понятна.
Фоновая музыка без вокала. Подложка под ролик, музыка в зале, звук на удержании в телефонии, фон для подкаста. Тут выигрывают Mubert, Soundraw, Beatoven и AIVA: длительность задаётся точно, а лицензии написаны под коммерческое использование.
Джингл и аудиореклама. Музыкальный логотип на 5 или 15 секунд, ролик для радио, звук для точки продаж. Задача ближе к монтажу, чем к сочинению: нужна точная длина, попадание в текст диктора и повторяемость.
Звуки и эффекты. Шаги, дверь, уведомление, шум толпы. Это уже не музыка, и делают её отдельные модели, например Stable Audio и функция звуковых эффектов у Beatoven.
Какие сервисы есть и что из них открывается из России
Собрал в одном месте всё, что имеет смысл открыть и попробовать. Ссылки кликабельные, статус доступа на 5 сентября 2026 года.
Открывшийся сайт это ещё не доступ к работе. Регистрация почти везде просит аккаунт Google или номер телефона, а оплата идёт зарубежной картой: российской картой напрямую не проходит ни один сервис из таблицы. Обходные способы оплаты существуют, но советовать их бизнесу я не берусь.
Бесплатный путь без карты и без регистрации ровно один: открытые модели. Либо страница MusicGen на Hugging Face, где генерация запускается прямо в браузере, либо запуск у себя, как я описал выше. Остальные бесплатные нейросети и их пределы я разбирал отдельно.
ElevenLabs без VPN не открывается, и это тот же сервис, который я разбирал в статье про нейросеть для озвучки видео. Музыка у него есть, но добраться до неё из России сложнее, чем до конкурентов.
Сколько стоят подписки
Цены снял со страниц тарифов 5 сентября 2026 года. Где сервис даёт скидку за годовую оплату, привожу оба числа.
Ориентир по нижней границе: рабочий тариф генератора музыки стоит от 8 до 12 $ в месяц, это примерно от 700 до 1 100 ₽. Верхние тарифы за 149 и 199 $ покупают объём и право работать на клиентов, а звучание там то же самое.
Это место, из-за которого я советую читать тарифы медленно. На странице Suno крупно написано «2 500 кредитов, до 500 песен». А строчкой ниже стоит лимит скачиваний: 20 файлов в месяц на тарифе Pro за 8 $ и 60 на Premier за 24 $.
Генерировать можно сотнями, забрать себе получится двадцать: лимиты стоят прямо на странице тарифов. Причина у ограничения понятная. Осенью 2025 года Warner Music урегулировала иск и заключила с Suno партнёрство, сервис пообещал перейти на модели, обученные на лицензированном материале, и одновременно закрыл сценарий, при котором один аккаунт штампует тысячи файлов на продажу.
Пользовательское соглашение соединяет два ограничения в одно. Коммерчески использовать разрешено только то, что вы скачали официальным способом в пределах лимита своего тарифа. Запись звука с экрана и перехват потока названы прямо и запрещены. Сервис оставляет за собой право вшивать в файл метку с уровнем тарифа, и удалять её нельзя.
Для работы это значит вот что. Двадцать треков в месяц хватает студии, которая делает подложки под ролики. Этого мало для конвейера из сотен треков на стриминги, и именно на таком сценарии обычно строятся ролики про пассивный доход на ИИ-музыке.
Права на трек прописаны по тарифам
Второе место, где написанное на лендинге расходится с написанным в договоре. Собрал условия сервисов, которые читал сам 5 сентября 2026 года.
на бесплатном права на композицию у сервиса и ссылка обязательна; на Standard за 11 € монетизация только на YouTube, Twitch, TikTok и в запрещённой в России соцсети Instagram; права переходят к вам на Pro за 33 €
обучен на музыке собственных композиторов, лицензия на коммерцию без оговорок про происхождение материала
Beatoven
сертификат Fairly Trained за обучение с согласия правообладателей, лицензия приходит письмом на каждое скачивание
Практический вывод, который я вынес для себя: сервис для работы выбирается по трём строчкам в договоре. Кому принадлежит результат, где его можно использовать и сколько файлов в месяц вы имеете право забрать.
Закон: что в России, что в мире
Тему легальности я держу в статье коротко, потому что для большинства читателей она всплывает один раз и по конкретному поводу.
Кому принадлежит сгенерированный трек
По российскому закону автором признаётся человек, творческим трудом которого создано произведение. У полностью сгенерированного трека автора в этом смысле нет, и зарегистрировать на него авторские права как на своё сочинение не получится. Ваши права на использование возникают из договора с сервисом, и объём этих прав написан в его условиях. Поэтому договор, чек и дату скачивания стоит хранить.
Маркировка
Закон от 26.07.2026 № 243-ФЗ о поддержке развития технологий искусственного интеллекта обязывает разработчиков моделей и площадки дать пользователю техническую возможность помечать сгенерированный контент. Основные нормы вступают в силу с 1 марта 2027 года. Обязанности «пометить каждый трек» у частного человека закон не вводит, речь про инструменты у платформ.
Площадки идут впереди закона. Яндекс Музыка готовит маркировку, Spotify метит профили с отметкой AI Persona, сервис «Кион Музыка» летом 2026 года собрал плейлист «Настоящий чарт» без единого сгенерированного трека, Bandcamp такую музыку запретил целиком.
Публичное исполнение и РАО с ВОИС
Если музыка играет в зале для посетителей, это публичное исполнение, и за обычные песни платят дважды: авторам через РАО и исполнителям через ВОИС. По их положениям о ставках фоновое озвучивание в общепите стоит от 38 до 42 ₽ за квадратный метр в месяц каждой организации, у магазинов ставки свои и ниже. Кафе на 100 м² выходит около 8 000 ₽ в месяц на обе организации.
Насколько это ваша тема, зависит от того, где вы работаете. В сетевом общепите, торговых центрах и на федеральных площадках вопрос закрыт заранее: там платят по договорам либо покупают сервис вещания с отчётностью вроде FONMIX за 590 до 1 990 ₽ в месяц. В обычной небольшой кофейне музыка чаще играет из открытого плеера на ноутбуке, и разговор про ставки начинается только после визита проверяющих. Российский малый бизнес про эти платежи в массе не думает вовсе, и я честно говорю: экономить на них через свою музыку интересно тем, кто уже получил письмо или планирует сеть.
Собственный лицензионный плейлист выводит заведение из платежей РАО и ВОИС, потому что эти организации собирают вознаграждение за произведения своего репертуара. Но доказывать придётся вам: договор с сервисом, тариф с коммерческими правами, дата скачивания, файлы лицензий. И отдельно проверьте, что тариф разрешает именно публичное исполнение: Mubert, например, запрещает релизы на стримингах и Content ID на всех тарифах сразу.
На чём в ИИ-музыке действительно зарабатывают
Здесь я собрал векторы, которые вижу живыми, вместе с их честными пределами.
Стриминг: путь есть, лёгких денег нет
Выложить трек на площадки самому нельзя, только через дистрибьютора. Разово это стоит около 1 500 ₽ за релиз на 250 с лишним площадок, по подписке от 549 до 1 290 ₽ в месяц в зависимости от доли роялти, которую вы оставляете себе, у зарубежных сервисов вроде DistroKid и TuneCore от 23 до 30 $ в год.
Дальше начинается арифметика. Ставки за прослушивание площадки не публикуют, оценки дистрибьюторов расходятся: у Яндекс Музыки называют вилку от 0,2 до 0,4 ₽ за прослушивание, у VK Музыки заметно меньше. Из этой суммы дистрибьютор удерживает свою долю. Чтобы вышло 20 000 ₽, трек должен собрать порядка ста тысяч честных прослушиваний, а с учётом того, что на сгенерированную музыку приходится от 1 до 3% прослушиваний и до 85% этих прослушиваний площадки признают накруткой, конвейер из сотен треков даёт ноль.
Работающая версия этого пути выглядит иначе: живой автор, живой замысел, генерация как инструмент производства. Так устроена та же Xania Monet, где тексты пишет человек. Российский рынок стриминга при этом растёт: 46 млрд ₽ в 2025 году, плюс 23% за год и прогноз ещё плюс 20% в 2026, у Яндекс Музыки 33,1 млн подписчиков, у VK Музыки 42,4 млн пользователей в России.
Услуги на заказ: самый предсказуемый доход
Я замерил ценник на бирже Kwork 5 сентября 2026 года, по 48 предложений на запрос, цена базового заказа:
Запрос
Медиана
Половина рынка
Край
Музыка на заказ
2 000 ₽
1 000–5 000 ₽
500–25 000 ₽
Джингл
2 000 ₽
1 000–4 000 ₽
500–23 000 ₽
Написание песни
1 750 ₽
1 000–3 500 ₽
500–13 000 ₽
Аудиореклама
1 500 ₽
1 000–3 000 ₽
500–25 000 ₽
Музыка для видео
1 000 ₽
500–2 500 ₽
500–25 000 ₽
Треть предложений в выдаче это цена за объём, вроде «от 2 000 ₽ за 30 секунд», поэтому реальный чек за готовый трек с правками выходит выше медианы. Как устроена сама биржа и как там получают заказы, я разбирал в статье про Kwork и поток заявок на услуги по ИИ.
Сильная сторона этого вектора в том, что клиент платит за решённую задачу и за скорость, а не за происхождение звука. Джингл, который раньше делали неделю за 2 000 ₽, вы отдаёте на следующий день.
Задачи своего бизнеса: экономия вместо выручки
Подложки под серию роликов, музыкальный логотип в начале каждого видео, аудиореклама в торговом зале, мелодия на удержании в телефонии, фон в кафе. Здесь генератор за 700 ₽ в месяц закрывает то, что стоило десятки тысяч на бирже. Голос диктора к такому ролику делает нейросеть для озвучки, видеоряд собирает нейросеть для создания видео, и полный ролик получается за вечер.
Персональные треки как подарок и знак внимания
Песня с именем клиента, поздравление сотруднику, трек на юбилей компании. Соседнюю механику с видео я разбирал в статье про видеопоздравления нейросетью. Продаётся это дороже фона именно потому, что вещь одноразовая и адресная.
Контент и обучение
Разборы сервисов, шаблоны запросов, готовые наборы треков под нишу. Здесь платят за упаковку знания, а не за музыку. Другие рабочие модели дохода на нейросетях собраны в разборе способов монетизации.
Чего в этом списке нет и почему. Пассивного дохода на сотнях сгенерированных треков нет: площадки научились считать такую музыку и не платить за накрученные прослушивания. Продажи треков на стоках нет: большинство сервисов это прямо запрещает. Это как раз те два сценария, которые чаще всего рекламируют в роликах про заработок.
От замысла к задаче: как думать до генерации
Тут я хочу говорить не про приёмы формулировок, а про то, что происходит до открытия сервиса. Запрос это последний шаг, и почти все промахи случаются раньше.
Сначала честно ответьте, чего вы хотите
Ответов обычно четыре, и они ведут в разные стороны.
Попробовать из любопытства. Тогда вам нужен бесплатный доступ и полчаса времени, а не выбор тарифа. Открывайте Riffusion или страницу MusicGen в браузере и играйте.
Сделать вещь для себя или для близких. Песня на свадьбу, трек в подарок, гимн команды. Тут важен текст и попадание в человека, а качество сведения вторично.
Закрыть задачу бизнеса. Фон под ролики, джингл, музыка в зале. Тут главными становятся лицензия, лимит скачиваний и повторяемость результата, а красота отдельного трека уходит на второй план.
Зарабатывать музыкой. Тогда вы выбираете между услугами на заказ, своим артист-проектом и производством контента. Каждый вариант это отдельная профессия со своими вложениями времени.
Потом опишите носитель и ограничения
Носитель это место, где музыка будет звучать: колонка в зале, наушники, телефонная линия, ролик в ленте. От него зависит всё остальное. Музыка для зала не должна спорить с разговором, музыка для ленты обязана цеплять в первые две секунды, музыка на удержании звучит по кругу и не должна раздражать на десятом повторе.
Дальше ограничения: длительность, наличие голоса, темп, язык текста, где будет опубликовано, нужны ли права на коммерцию. Это те самые вводные, которые потом превращаются в строчки запроса.
И только теперь формулируйте запрос
Работающие приёмы, проверенные на своих запусках:
пишите описание стиля на английском, модели обучены в основном на англоязычных описаниях; текст песни при этом может быть русским;
называйте инструменты, а не эмоции: «soft electric piano, light drums, warm bass» даёт предсказуемый результат, «красивая вдохновляющая музыка» не даёт;
задавайте темп числом: 70–100 BPM для фона под речь, 120–128 BPM для энергичного ролика;
пишите «no vocals» отдельно, если нужен фон, иначе модель добавит голос там, где он мешает диктору;
указывайте назначение: «background music for a coffee shop» задаёт не только стиль, но и плотность звука;
ограничивайте набор инструментов тремя или четырьмя, длинные перечисления модель усредняет;
ссылайтесь на жанр и эпоху, имена артистов у большинства сервисов запрещены правилами;
делайте по 5 попыток на один запрос и слушайте результат на том устройстве, где его будут слышать клиенты.
Критерий «готово» задайте заранее
Это шаг, который пропускают чаще всего. До генерации напишите одной фразой, каким должен быть результат: «фон под ролик о доставке, 40 секунд, не мешает голосу, без вокала, спокойный, узнаваемый на повторе». Тогда из десяти вариантов вы выберете нужный за минуту. Без такой фразы отбор превращается в бесконечное «а давайте ещё разок».
Свой ассистент-наставник по ИИ-музыке
Всё, что я описал выше, это работа мышления, и её удобно вынести в помощника. Идея простая: собрать ИИ-ассистента, который знает про ИИ-музыку то же, что знаю я после этой статьи, и ведёт человека от замысла к готовым запросам.
Такого помощника можно собрать в Ное без программиста: создаёте агента, вставляете системный промпт — дальше он живёт в вашем мессенджере и отвечает голосом или текстом.
Что он делает вместо вас:
пишет запросы под ваш замысел. Не «универсальный промпт из интернета», а формулировку под ваш жанр, темп, длительность и назначение — сразу в трёх вариантах, чтобы было из чего выбирать.
подсказывает, где это делать. Под вашу задачу называет подходящий сервис из тех, что открываются из России, и говорит, что там с бесплатным входом и правами на трек.
задаёт вопросы, которые вы сами себе не задали. Где трек будет звучать, что должно происходить с человеком, который его слышит, по какому признаку вы поймёте, что вариант готов.
помнит ваш проект. Вернулись через неделю — не нужно объяснять заново: он держит и замысел, и то, что уже пробовали.
двигает дальше по теме. Разобрались с джинглом — подскажет следующий шаг: фон под ролики, мелодию на удержании в телефонии, оформление своего артист-проекта.
Мы этот механизм используем для своих задач каждый день, и разбор одного такого конвейера я показывал в кейсе контент-завода.
Вот системный промпт, который я написал под эту задачу. Он длинный намеренно: короткий даёт советы уровня «пишите на английском».
Промпт
Ты наставник по музыке, созданной с помощью нейросетей. Ты работаешь с человеком, который хочет получить конкретный музыкальный результат, но не знает ни сервисов, ни того, как ставить задачу. Твоя работа: довести его от смутного желания до готовых запросов и понятного плана действий.
КАК ТЫ ВЕДЁШЬ РАЗГОВОР
Ты не выдаёшь всё сразу. Ты задаёшь по одному вопросу за раз и ждёшь ответа. Обращаешься к человеку на «вы». Говоришь простым языком, без музыкальной терминологии, а если термин нужен, объясняешь его в том же предложении. Ты не льстишь и не хвалишь замысел авансом. Если задача поставлена нереалистично, говоришь об этом прямо и предлагаешь, чем её заменить. Вопросов у тебя ровно четыре, и ты их нумеруешь вслух. Каждый вопрос начинается со строки «Вопрос 1 из 4», «Вопрос 2 из 4» и так далее. Считаешь заданные вопросы, а не полученные ответы: после четвёртого вопроса твой следующий ответ обязан быть готовым результатом по шагам 3, 4 и 5, без единого нового вопроса. Если человек ответил не на то, что ты спросил, принимаешь сказанное как есть, а на неотвеченное ставишь умолчание и идёшь дальше. Повторно один и тот же вопрос не задаёшь никогда. Всё, что осталось неясным, заполняешь разумным умолчанием и называешь его вслух: «беру 15 треков по 4 минуты, поправьте, если нужно иначе». Не переспрашивай про то, что человек уже сказал, и не уточняй мотив, если задача и так понятна. Если человек затрудняется ответить, предлагай два-три варианта на выбор. Цену тарифа не называешь ни одной цифрой, даже приблизительной: тарифы меняются каждые несколько месяцев, и цифра из твоей памяти будет враньём. Вместо неё пишешь, на какой странице сервиса её посмотреть. Служебные названия шагов из этой инструкции человеку не показываешь: он видит обычный разговор, а не отчёт по пунктам.
ШАГ 1. ЗАМЫСЕЛ
Выясни, чего человек хочет на самом деле. Варианты, между которыми ты его ведёшь: попробовать из любопытства; сделать вещь для себя или в подарок; закрыть задачу бизнеса; зарабатывать музыкой. Не принимай ответ «хочу красивый трек»: спроси, где он будет звучать и что должно произойти у слушателя.
ШАГ 2. НОСИТЕЛЬ И ОГРАНИЧЕНИЯ
Собери вводные: где звучит (зал, наушники, телефонная линия, видео в ленте), сколько длится, нужен ли голос, на каком языке текст, куда будет опубликовано, нужны ли права на коммерческое использование, какой бюджет в месяц. Недостающее спрашивай, не додумывай.
ШАГ 3. КРИТЕРИЙ ГОТОВНОСТИ
Сформулируй вместе с человеком одну фразу, по которой он поймёт, что результат годится. Пример: «фон под ролик о доставке, 40 секунд, не спорит с голосом, без вокала, не раздражает на десятом прослушивании». Покажи эту фразу и попроси подтвердить.
ШАГ 4. ВЫБОР ИНСТРУМЕНТА
Подбери сервис под задачу и объясни выбор одной строкой.
- песня с вокалом и словами: Suno, Udio, Riffusion;
- фон без вокала под видео и подкасты: Mubert, Soundraw, Beatoven, Loudly, Soundful;
- оркестр, кино, игры: AIVA;
- звуки и эффекты: Stable Audio;
- бесплатно и без регистрации: открытая модель MusicGen на Hugging Face.
Обязательно предупреди про две вещи: лимит скачиваний на тарифе и то, что права на коммерческое использование появляются не на всех тарифах.
ШАГ 5. ЗАПРОСЫ
Выдай 3 варианта запроса на английском языке, каждый с пояснением по-русски, чем он отличается от соседнего. В каждом запросе должны быть: жанр, 3-4 инструмента, темп числом в BPM, настроение, назначение, пометка про вокал. Если нужен текст песни, предложи его отдельно и по-русски.
ШАГ 6. ПЛАН ДОВОДКИ
Скажи, что делать с результатами: сколько попыток сделать, по какому признаку отбирать, что править в запросе, если получилось не то. Дай конкретные замены: «звучит слишком плотно» — убрать инструмент; «не попадает в настроение» — сменить слово настроения и темп; «вокал лезет вперёд» — добавить no vocals.
ЧЕГО ТЫ НЕ ДЕЛАЕШЬ
Не обещаешь пассивный доход на генерации треков: площадки распознают такую музыку и не платят за накрутки. Не советуешь копировать конкретных артистов: это запрещено правилами сервисов. Не выдаёшь юридических гарантий: говоришь, что условия использования нужно прочитать в договоре сервиса на его тарифе.
ФОРМАТ ОТВЕТА
Коротко. Не больше пяти предложений на шаг, пока не дошли до запросов. Пока идут вопросы, каждый ответ заканчивай одним вопросом, который двигает работу дальше. Финальный ответ с запросами вопросом не заканчивай: там человеку нужно идти и делать.
Что этот помощник отвечает на деле
Я прогнал промпт с живой моделью и сыграл владельца кофейни. Помощник задал четыре вопроса: про атмосферу, про объём музыки, про бюджет и права, про стиль. После четвёртого ответа выдал вот такой результат, привожу с сокращениями.
Критерий готовности он сформулировал сам: «инструментальный фон для кофейни, электропианино в основе, 3 минуты трек, без резких ударных, не мешает работать с ноутбуком, не раздражает на двадцатом прослушивании за день».
Сервис предложил Mubert или Soundraw, предупредил про лимит скачиваний и про то, что коммерческие права появляются только на платной подписке, а цену отправил смотреть на странице тарифов.
Дальше три запроса на выбор, каждый с пояснением по-русски:
Код
ambient, electric piano, soft pads, Rhodes, 70 BPM, calm,
background music for cafe, no drums, no vocals
lounge, electric piano, soft bass, light percussion, 80 BPM, relaxed,
coffee shop background, no vocals
chillout, electric piano, strings, ambient pads, 75 BPM, peaceful,
work-friendly, no vocals
И план доводки: сделать по 3–5 попыток на каждый вариант, отбирать по признаку «включил фоном, сел работать, через 10 минут не захотелось выключить», убрать инструмент, если звучит плотно, поднять темп до 85 BPM, если получилось скучно.
На весь разговор ушло пять реплик. Мне понравилось, что помощник не даёт советов вообще: он вытягивает из человека вводные, которые тот сам бы не сформулировал.
Промпт можно править под себя: добавить свою нишу, свои площадки, свой бюджет. Дальше такой помощник живёт в мессенджере и отвечает на любой вопрос по теме, а не только по сценарию. Собрать его в Ное можно за вечер, а тот же механизм потом закрывает разговоры с клиентами: заявки, ответы, запись.
Чего эти модели пока не умеют
Здесь то, обо что я спотыкался сам и о чём читал в условиях сервисов.
Русский вокал звучит с акцентом. Модели обучены в основном на английской музыке, и русский текст в припеве часто получает странные ударения и смазанные окончания. Короткие строчки и простые слова помогают, но не лечат до конца.
Точность длительности зависит от типа сервиса. У сервисов фоновой музыки вроде Mubert, Soundraw и AIVA длина задаётся в интерфейсе, и трек собирается под указанный хронометраж. У генераторов песен вроде Suno и Udio вы получаете ту длину, которая получилась, и подгоняете в монтаже. У открытой модели на своём компьютере длина задаётся числом шагов генерации и выходит приблизительной: у меня 512 шагов дали 10,18 секунды.
Партитуру и ноты вы не получите. На выходе звук, а не проект для студийной программы. Разделение на дорожки инструментов есть только на верхних тарифах некоторых сервисов.
Попадание в тайминг видео делается вручную. Модель не получает вашу раскадровку и не знает, что на 7-й секунде смена кадра.
Повторить точно тот же трек не выйдет. Даже с тем же запросом результат будет другим, поэтому удачный вариант скачивайте сразу.
Что проверить перед выпуском трека
Короткий список, который стоит пройти до того, как музыка попадёт в рекламу, в зал или на площадку.
Тариф даёт коммерческие права именно на ваш сценарий, и это написано словами в договоре.
Трек скачан через сервис, а не записан с экрана, и он укладывается в месячный лимит скачиваний.
Сохранены доказательства: договор или чек, дата, файл лицензии, если сервис его присылает.
Проверено, разрешает ли сервис публичное исполнение, если музыка пойдёт в зал.
Проверено, разрешает ли сервис Content ID, если ролик уйдёт на YouTube.
Трек прослушан на той технике, где его будут слышать люди.
Название и имя исполнителя не повторяют реальных артистов, иначе площадка снимет релиз по жалобе.
С чего начать прямо сейчас
Алгоритм для того, кто до этого музыку не генерировал. Шаги идут по зависимости: следующий не имеет смысла без предыдущего.
Шаг 1. Ответьте на один вопрос, 5 минут
Чего вы хотите: попробовать из любопытства, сделать вещь для себя, закрыть задачу бизнеса или зарабатывать. От ответа зависит вообще всё дальше, и честный ответ «пока просто интересно» это нормальный ответ.
Шаг 2. Сделайте первую генерацию бесплатно, 15 минут
Откройте Riffusion или страницу MusicGen, где регистрация не нужна вовсе. Опишите музыку тремя инструментами, темпом и назначением. Сделайте 5 попыток на один запрос и послушайте, как формулировка меняет результат.
Шаг 3. Соберите себе помощника, 20 минут
Возьмите системный промпт из раздела выше, вставьте его в нового агента в Ное и проговорите с ним свою задачу. На выходе у вас будет описанный замысел, критерий готовности и три готовых запроса под ваш случай.
Шаг 4. Доведите до конца одну реальную задачу
Джингл в начало ваших роликов, фон под ближайшее видео, мелодия на удержании в телефонии. Одна задача целиком полезнее десяти начатых, и после неё вы будете понимать про сервисы больше, чем после любой статьи.
Шаг 5. Решайте про деньги
Если задача решилась и повторится, выбирайте тариф по трём пунктам: коммерческие права, лимит скачиваний, разрешённые площадки. Если хочется запускать модели у себя, вернитесь к пошаговой инструкции в начале статьи, там всё бесплатно и без карты.
Шаг 6. Если целитесь в заработок, выберите вектор
Услуги на заказ, свой артист-проект или задачи своего бизнеса. Заведите одного клиента или один релиз и посчитайте деньги на нём, прежде чем строить конвейер. На этом шаге спешить некуда: он единственный, который требует не вечера, а месяцев.
Вопросы и ответы
Можно ли использовать сгенерированную музыку в рекламе?
Да, если тариф даёт коммерческие права и трек получен официальным скачиванием. У Suno это платные тарифы, у AIVA только Pro за 33 €, у Mubert коммерческое использование начинается с третьего тарифа.
Хватит ли бесплатного тарифа?
Для знакомства хватит. Для работы нет: у Suno на бесплатном тарифе скачать трек нельзя вовсе и коммерческих прав там тоже нет, у AIVA права на композицию остаются у сервиса, у Mubert обязательна ссылка на сервис и запрещена коммерция.
Правда ли, что на ИИ-музыке можно получать пассивный доход со стримингов?
Как массовая схема нет. Сгенерированную музыку слушают в пределах 1–3% от общего объёма прослушиваний, и до 85% этих прослушиваний площадки признают накруткой и не оплачивают. Работает другая версия: живой автор, свой замысел и генерация как инструмент производства.
Нужен ли мощный компьютер, чтобы генерировать музыку?
Для облачных сервисов нет, там работают чужие видеокарты. Для запуска модели у себя нужен запас времени: мой ноутбук считал 10 секунд звука почти 9 минут.
Безопасно ли ставить нейросеть себе на компьютер?
Да, если брать модель с официальной страницы авторов и ставить её в отдельное виртуальное окружение. Работает такая модель без интернета, права администратора ей не нужны, а следы удаляются вместе с папкой проекта и кэшем моделей.
Отличит ли слушатель ИИ-музыку от обычной?
В фоне под речь чаще всего нет: там нужен ровный неброский звук. В песне с вокалом на русском разница слышна почти сразу, особенно на длинных гласных и окончаниях слов.
Можно ли поставить такую музыку в кафе вместо оплаты РАО и ВОИС?
Формально да, если весь плейлист состоит из треков, полученных по лицензии, и вы готовы подтвердить это документами при проверке. Отдельно убедитесь, что тариф сервиса разрешает публичное исполнение: не все это оговаривают.
Что в итоге
Нейросеть для музыки собирает трек из чисел: 32 000 замеров громкости на секунду записи, свёрнутых в короткие звуковые фрагменты, которые модель предсказывает один за другим. Я собрал это у себя на ноутбуке и увидел, как десять секунд звука рождаются за девять минут вычислений. Тема после этого не стала для меня проще, она стала больше.
Рынок вокруг устроен жёстче, чем обещают ролики про лёгкие деньги. Треков грузят по 90 тысяч в сутки, слушают из них единицы процентов, площадки вводят маркировку, лейблы переводят сервисы на лицензированные модели, авторские общества считают потери в миллиардах евро. Пассивного дохода на потоке генерации в этой картине нет.
Зато есть работающие векторы: услуги на заказ с медианой 2 000 ₽ за трек на бирже, задачи своего бизнеса, где подписка за 700 ₽ в месяц заменяет десятки тысяч на подрядчиках, персональные треки как знак внимания и свой артист-проект, если у вас есть что сказать словами.
Начните с честного ответа, чего вы хотите от этой темы, сделайте первую генерацию бесплатно, соберите себе помощника по промпту из статьи и доведите до конца одну реальную задачу. Всё остальное вырастет из неё.
Промпту нужно рабочее место
Запустите промпт из статьи в Ное — получите помощника, который работает сам
Промпт становится агентом: помнит ваш проект и отвечает в мессенджере
Работает круглосуточно и во всех каналах сразу, а не только в чате с вами
Бонус 1 000 ₽ при регистрации по этой ссылке вместо обычных 500 ₽