СейчасПлатформенный сервис и модель в собственной инфраструктуре
- Платформенный сервис и модель в собственной инфраструктуре
- Полная песня вместо короткого музыкального фрагмента
- Два текста с разными обязанностями
- Три слоя музыкального управления
- Global Metadata
- Vocal Details
- Arrangement
- Пример структурированного промпта
- Семь правил, которые дают больше контроля
- Промпт может собирать агент
- Первый воспроизводимый тест
- Где заканчивается контроль
- Музыкальная модель становится частью системы
- Следующий шаг
- Связанные материалы
MiniMax выпустила Music 3 — музыкальную модель с открытыми весами, рассчитанную на создание законченных песен продолжительностью до пяти минут.
У нас в команде локальными моделями глубоко занимается Михаил Иванов. Он уже делает музыку с MiniMax Music 3 на своей рабочей станции, и скоро мы покажем результаты. А пока в этой статье — разбор модели и подробное руководство по её промптингу.
По описанию компании, модель поддерживает выразительный вокал и развитие аранжировки по секциям, а на длинной дистанции сохраняет музыкальную тему, ритм и характер голоса. Эти возможности показаны в официальных демо, но независимого сравнительного теста в этой статье нет.
Релиз совпал с изменением правил Suno. Сервис вводит лимиты на скачивание и средства маркировки аудио, пока MiniMax открывает доступ к весам для самостоятельного запуска. Это два разных подхода к одному рынку: готовая платформенная услуга и модель для собственной инфраструктуры.
Практическая ценность Music 3 раскрывается через структурированный промпт. Модели передают два отдельных текста: слова песни с секционными тегами и музыкальное описание. Хороший промпт здесь похож на план развития композиции во времени.
Платформенный сервис и модель в собственной инфраструктуре
С 3 сентября 2026 года Suno ограничивает количество скачиваний: семь за всё время на бесплатном плане, 20 в месяц на Pro и 60 на Premier. Дополнительные скачивания можно будет покупать отдельно. Для Premier с Suno Studio лимит не действует.
Бесплатные пробные скачивания предназначены только для личного некоммерческого использования. Коммерческие права Suno связывает с разрешённым скачиванием на платном плане через официальный канал. Новые условия также запрещают получать копию трека записью потока или через stream ripping.
Компания отдельно объявила об аудиоводяных знаках и цифровых отпечатках, чтобы платформы могли определять происхождение сгенерированных треков. Эти меры объясняются борьбой с массовой выгрузкой музыки и злоупотреблениями.
MiniMax Music 3 предлагает другой контур. Веса опубликованы на Hugging Face, а рекомендуемые пути запуска включают SGLang-Omni и ComfyUI. Интеграция Diffusers на момент проверки устанавливается из отдельного pull request и пока не выглядит таким же зрелым вариантом.
Обычный сценарий Diffusers рассчитан на видеокарту примерно с 24 ГБ VRAM. Автоматический CPU offloading снижает потребление примерно до 22 ГБ, а послойная выгрузка позволяет запустить модель даже с 8 ГБ VRAM ценой заметного падения скорости. Требуется CUDA, поэтому официальный локальный путь ориентирован на NVIDIA. Отдельного подтверждённого сценария для Mac в документации нет, а готовый Inference Provider на Hugging Face пока не подключён.
Открытые веса не равны неограниченному коммерческому использованию. Модель распространяется по собственной MiniMax-Music3 Community License, которую нужно прочитать перед использованием в продукте или коммерческом релизе.
| Задача | С чего практичнее начать |
| Быстро получить песню без настройки инфраструктуры | Suno |
| Запускать генерацию на собственной NVIDIA-системе | MiniMax Music 3 |
| Встроить музыку в серверный или агентный процесс | MiniMax Music 3 |
| Работать только на Mac без CUDA | Облачный сервис или API |
| Использовать результат коммерчески | Сначала проверить условия выбранного сервиса и лицензию модели |
Полная песня вместо короткого музыкального фрагмента
MiniMax позиционирует Music 3 как модель для композиций продолжительностью до пяти минут. Она поддерживает интро, куплеты, пре-хорусы, припевы, пост-хорусы, бриджи, инструментальные части, соло и аутро. По заявлению разработчика, на длинной дистанции модель сохраняет тему, ритм, характер вокала и развитие аранжировки.
За общую структуру отвечает Global LLM на 8 млрд параметров. Local LLM на 0,6 млрд восстанавливает акустические детали внутри каждого фрейма. Затем система на основе Flow Matching и Flow-VAE превращает скрытые состояния моделей в аудио 32 кГц, 16 бит, стерео.
Архитектура объясняет основной принцип промптинга: Music 3 получает описание всей композиции и инструкции о том, как музыка должна меняться от секции к секции. Перечень жанров и инструментов даёт меньше контроля, чем последовательный музыкальный сценарий.
Два текста с разными обязанностями
Подробное руководство на Hugging Face, построенное вокруг официального music-caption-rewriter MiniMax, описывает два входа для каждой генерации.
Lyrics содержат слова и секционные теги. Каждый тег ставится на отдельной строке:
[intro]
[verse]
City lights are moving slow
Every window holds a glow
[pre-chorus]
Hold the moment, let it rise
[chorus]
We are signals in the night
[bridge]
[chorus]
[outro]Это сокращённая демонстрация синтаксиса, а не полный текст песни. Для законченной композиции потребуется больше строк и секций.
В руководстве отдельно предупреждают: запись [verse] City lights… использовать нельзя, потому что текст после ведущего тега на той же строке может быть отброшен. Секционные теги задают макроструктуру, но не гарантируют буквальное исполнение схемы.
Запрошенная длительность служит верхней границей. Модель завершает композицию, когда заканчиваются слова и структура. Для пятиминутной песни нужен материал соответствующего масштаба: несколько куплетов, повторения припева, переходы и финальная секция.
Structured caption описывает музыку. В нём находятся жанр, темп, эмоциональная дуга, вокал, инструменты, характер сведения и изменения внутри каждой части. Слова песни в caption не переносятся.
Три слоя музыкального управления
Руководство на Hugging Face рекомендует caption объёмом примерно 250–450 слов с тремя заголовками в фиксированном порядке.
Global Metadata
Здесь задаются жанр и поджанр, желаемый темп, при необходимости тональность и лад. Затем описываются эмоциональное развитие, подходящая сцена и характер продакшена.
Сцена часто работает точнее набора абстрактных прилагательных. «Ночная поездка по мокрому городу» даёт модели более связный образ, чем последовательность из emotional, modern и cinematic. Такие слова полезны как модификаторы, но не заменяют жанр и музыкальную ситуацию.
Vocal Details
Для вокальной композиции явно указываются тип голоса, тембр и манера исполнения. Можно задать тихую близкую подачу в куплетах, более сильное исполнение в припеве, бэк-вокал и умеренные эффекты.
Авторы руководства называют неопределённый вокал главной причиной ухода модели в инструментальную музыку. Если трек должен быть инструментальным, это тоже фиксируется явно. Одновременно указывается инструмент, который несёт ведущую мелодию.
Arrangement
Этот раздел описывает жизненный цикл инструментов. Какие элементы появляются в интро, что поддерживает куплет, за счёт чего расширяется припев, что исчезает в бридже и как собирается финальная кульминация.
Аранжировка читается как временная шкала. Неподвижный список «синтезатор, бас, ударные, гитара» сообщает состав. Последовательность входов, выходов и изменений сообщает композицию.
Пример структурированного промпта
Ниже — пример структуры, составленный по правилам руководства. Он показывает формат входных данных, но пока не подтверждён отдельной тестовой генерацией.
Предположим, нужна светлая синт-поп-композиция для ночной поездки. Темп 112 BPM выбран намеренно, а тональность оставлена модели.
Global Metadata
Basic Attributes: Mid-tempo synth-pop at 112 BPM with dream-pop textures and a steady electronic groove.
Global Emotional Progression: The song begins with quiet forward motion and a sense of distance. The verses remain intimate and observant. Each pre-chorus adds tension through rising harmony and denser percussion. The choruses open into a bright, confident release. The bridge briefly removes the rhythmic foundation, creating weightless suspension, before the final chorus returns with the widest and most energetic arrangement. The outro settles into calm momentum rather than a dramatic stop.
Application Scenarios & Imagery: A late-night drive through a rain-washed city, reflected lights moving across the windshield, with the road gradually opening toward the horizon.
Sonics & Production Profile: Clean modern production with a wide stereo field, controlled sub-bass, smooth high frequencies, and moderate compression. Keep the lead vocal centered and intimate while synth layers and backing vocals expand toward the sides in the choruses.
Vocal Details
Vocal Gender & Timbre: Singer A (Female), a warm mezzo-soprano with a clear mid-range and a slightly breathy low register.
Vocal Style: Close-miked and restrained in the verses, gradually gaining intensity in the pre-choruses. The choruses use a fuller chest-voice delivery with sustained notes, while preserving lyrical clarity. The bridge returns to a soft, almost weightless performance.
Harmony/Backing Vocals: Light doubles appear at the ends of verse phrases. Stacked harmonies enter in the choruses and become wider in the final chorus. No call-and-response vocals.
Vocal FX: Short plate reverb throughout, subtle delay throws on selected chorus endings, and gentle saturation during the final chorus.
Arrangement
Instrument Lifecycle: A pulsing analog synth and muted electronic kick establish the intro. A rounded synth bass and dry percussion enter with the first verse. The pre-chorus adds an ascending pad and brighter hi-hats. The chorus introduces wide synth chords, a stronger kick, layered claps, and a simple melodic counterline. The bridge removes drums and bass, leaving voice, pad, and a processed piano motif. The final chorus restores the full rhythm section with additional upper-register synth layers.
Groove & Foundation Progression: Keep the verses steady and spacious. Increase rhythmic density in each pre-chorus, then let the chorus land with a firm four-on-the-floor pulse. The final chorus should feel larger through layering rather than a tempo change.
Embellishments, Textures & Spatial FX: Use restrained reverse swells before choruses, short filtered noise transitions, and a long reverb tail leading into the bridge. Avoid aggressive risers and festival-style drops.В этом примере описание не пытается продиктовать каждую ноту. Оно фиксирует музыкальную логику, сохраняет требования к вокалу и показывает, как меняется плотность аранжировки.
Семь правил, которые дают больше контроля
- Не добавляйте выдуманную точность. BPM и тональность нужны только при осознанном музыкальном требовании. В остальных случаях подойдут диапазон или качественное описание темпа.
- Ставьте каждый секционный тег на отдельную строку. Это часть входного контракта модели.
- Всегда определяйте вокал. Для инструментальной музыки явно назовите ведущий мелодический инструмент.
- Сохраняйте требования по всему caption. Пол, тембр голоса, обязательный инструмент и исключения не должны исчезать или противоречить поздним секциям.
- Описывайте энергетическую дугу. Напряжение, разрядка, пауза и кульминация дают модели понятное развитие.
- Не переносите слова песни в caption. Один вход отвечает за текст, другой управляет музыкой.
- При смешении стилей объясняйте их роли. Формулировка
cinematic orchestral with Chinese folk instrumentationполезнее двух жанров, поставленных рядом без описания общей аранжировки.
Если инструкции конфликтуют, руководство предлагает такой приоритет: явные требования, локальные указания секционного тега, смысловые следствия описания, затем жанровые значения по умолчанию.
Промпт может собирать агент
В репозитории Music 3 опубликован официальный skill music-caption-rewriter. Он превращает короткое описание и размеченный текст песни в caption с тремя нужными разделами. По данным prompting guide, для выбора музыкальной лексики skill использует библиотеку примерно из тысячи референсов, организованных в 18 стилевых семейств.
Установка:
npx skills add MiniMax-AI/MiniMax-Music3 --skill music-caption-rewriterПосле установки кодинг-агент может получить запрос вроде «медленный постпанк с нарастающим припевом и мужским баритоном», сохранить обязательные ограничения и развернуть его в музыкальную временную шкалу. Это особенно полезно для серийной работы, когда важно удерживать один формат промпта и менять только творческое задание.
Первый воспроизводимый тест
Самый прямой официальный путь начинается с SGLang-Omni. После установки и подготовки CUDA-среды модель запускается локальным сервером:
sgl-omni serve --model-path MiniMaxAI/MiniMax-Music3 --port 8000Короткую тестовую генерацию можно запросить через совместимый speech endpoint:
curl http://127.0.0.1:8000/v1/audio/speech \
-H 'Content-Type: application/json' \
-d '{
"model": "MiniMaxAI/MiniMax-Music3",
"input": "[verse]\nMorning light filtering through the pine\n[chorus]\nSoftly the world begins to breathe",
"instructions": "A warm acoustic pop song with intimate female vocals, fingerpicked guitar, soft piano, and a gradual emotional build into a wide final chorus.",
"response_format": "wav",
"seed": 7,
"max_new_tokens": 750,
"stream": false
}' \
--output minimax-music3.wavmax_new_tokens задаёт верхнюю границу аудиофреймов при скорости 25 кадров в секунду. Значение 750 соответствует максимуму примерно в 30 секунд, хотя модель может завершить запись раньше. Перед локальной установкой полезно сначала послушать официальные демо.
Где заканчивается контроль
Music 3 остаётся генеративной моделью. Секционные теги, BPM, тональность и инструменты направляют результат, но не дают строгой символической гарантии. Официальная карточка также указывает на CUDA, отсутствие потоковой генерации, лимит текстового промпта в 5 000 токенов и ограничение аудиогенерации в 9 000 акустических фреймов.
Поэтому рабочий процесс всё равно включает несколько вариантов, прослушивание и отбор. Структурированный caption делает итерации осмысленнее: можно менять конкретный слой, например поведение припева или характер вокала, не переписывая всё задание.
Музыкальная модель становится частью системы
Сильная сторона MiniMax Music 3 заключается в сочетании длинной формы, управляемого промпта и доступных весов. Модель можно подключить к агенту, локальной студии или серверному пайплайну, а результаты хранить в собственной инфраструктуре.
На фоне новых правил Suno это выглядит как инфраструктурная альтернатива для тех, кому нужен контроль над процессом и хранением файлов. Прямой заменой Suno модель пока не является: порог входа выше, требуется NVIDIA/CUDA, а часть интеграций ещё развивается. Зато Music 3 позволяет собрать музыкальный инструмент под собственную задачу и связать его с агентным процессом.
По теме
Следующий шаг
Suno — генератор музыки с ИИ: модели, Studio, тарифы и продакшн-процесс
Связанные материалы
- Статья: Локальные модели в работе: Mac Studio, DAWalka и DeepSeek — рассказ Миши Иванова
- Блог: Suno вводит водяные знаки и ограничит массовую заливку в стриминг
- База знаний: Seedance 2.5 — промптинг 30-секундного видео со звуком
Если вы строите собственный процесс генерации музыки или хотите встроить музыкальную модель в агентный контур, здесь особенно важны требования к инфраструктуре и правам на результат.
Если захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov
Если хотите разобрать свою задачу — напишите мне Если хотите разобрать свою задачу — напишите мне.
Можно прийти с идеей, черновым контекстом или уже живой задачей. Помогу быстро понять, где реальный следующий шаг, а где лишний шум.
Обычно хватает 2–3 сообщений, чтобы понять, могу ли я здесь реально помочь и в каком формате лучше двигаться дальше.
Дальше по теме
Руководство по Suno: модель v5.5, Voices и Custom Models, стемы, Suno Studio, промпты и метатеги, тарифы, права на треки и путь до релиза.