База знаний
Как управлять развитием песни в MiniMax Music 3 с помощью структурированного описания
Подробное руководство по Lyrics и Structured Caption в MiniMax Music 3: как задать вокал, структуру и развитие аранжировки без противоречий.
СейчасКак устроены входные данные
- Как устроены входные данные
- Как сформулировать музыкальную задачу
- Что писать в Lyrics
- Как собрать Structured Caption
- Global Metadata задаёт мир песни
- Vocal Details описывает голос явно
- Arrangement раскладывает инструменты по времени
- Готовый шаблон
- Подключение по API
- Полезные сценарии
- Усилить припев без смены темпа
- Сделать разреженный бридж и вернуть финальную энергию
- Подготовить инструментальную композицию
- Как проверить результат
- Ограничения и статус API
- Следующий шаг
- Связанные материалы
- Проверенные источники
Первый материал о MiniMax Music 3 разбирает модель, открытые веса, запуск и ограничения. Это руководство решает более узкую задачу: помогает описать развитие песни от интро до финала через структурированное описание музыки (Structured Caption).
По состоянию на 8 сентября 2026 года MiniMax Music 3 доступна как открытая модель и через облачный API с моделью music-3.0. Репозиторий MiniMax рекомендует Structured Caption для более точного управления. Секционные теги и музыкальные описания дают генеративный контроль. Результат может отличаться от заданных темпа, тональности, инструментов, текста или структуры.
Содержание
- Как устроены входные данные
- Как сформулировать музыкальную задачу
- Что писать в Lyrics
- Как собрать Structured Caption
- Готовый шаблон
- Подключение по API
- Полезные сценарии
- Как проверить результат
- Ограничения и статус API
Как устроены входные данные
MiniMax Music 3 использует два взаимодополняющих входа:
- текст песни и карта формы (
Lyrics) задают слова и макроструктуру через секционные теги; - музыкальное описание задаёт жанр, эмоциональное развитие, вокальную подачу, инструменты, аранжировку и характер продакшена.
В открытой модели текст песни передаётся в поле input, а музыкальное описание — в поле instructions. В облачном API для этих задач используются поля lyrics и prompt: первое передаёт слова, второе описывает музыку.
Структурированное описание содержит три раздела:
- общая музыкальная рамка (
Global Metadata); - параметры вокала (
Vocal Details); - развитие аранжировки по секциям (
Arrangement).
Такое разделение упрощает итерации. Если модель ошибается в словах, проверяйте Lyrics. Если припев не набирает энергию, меняйте Arrangement. Если голос звучит не так, уточняйте Vocal Details.
Как сформулировать музыкальную задачу
Промпт «современный атмосферный синт-поп с женским вокалом, гитарой, басом и хорошими ударными» задаёт состав и настроение, но почти ничего не сообщает о развитии песни.
Сначала опишите обычным языком, как должна меняться композиция:
Сдержанная электронная песня умеренного темпа. В куплетах голос звучит близко и спокойно. Пре-хорусы накапливают напряжение. Припевы становятся шире и плотнее. В бридже ритм почти исчезает, а финальный припев возвращает энергию без ускорения темпа.
В этой формулировке уже есть эмоциональная дуга и последовательность секций. Дальше её можно разложить на три части Structured Caption.
Не добавляйте точный BPM или тональность только ради видимости контроля. Если число не связано с музыкальной задачей, достаточно указать характер темпа и движения.
Что писать в Lyrics
Поле с текстом песни (Lyrics) содержит слова и секционные теги. Облачный API music-3.0 поддерживает, в частности, [Intro], [Verse], [Pre Chorus], [Chorus], [Interlude], [Bridge], [Outro], [Post Chorus], [Transition], [Break], [Hook], [Build Up], [Inst] и [Solo].
Для читаемости и однозначной структуры ставьте тег перед соответствующим текстом на отдельной строке:
[Verse]
Город медленно гасит огни
...
[Chorus]
Нам хватает дороги и тишины
...Теги задают форму, но не определяют музыкальную кульминацию. [Chorus] обозначает припев, а его плотность, инструменты и изменение вокала нужно описать в Structured Caption.
Объём Lyrics также ограничивает доступную форму. Для длинной песни подготовьте несколько секций, повторы припева, переход и финальную часть. Если вы передаёте собственный текст и не включаете автоматическую генерацию, для неинструментальной генерации поле lyrics обязательно и принимает от 1 до 3500 символов. При lyrics_optimizer: true и пустом lyrics API автоматически создаёт текст по prompt.
Как собрать Structured Caption
Global Metadata задаёт мир песни
Укажите жанр и поджанр, примерный темп или характер движения, эмоциональную траекторию, сцену и общий профиль звучания.
Связанный образ полезнее каталога прилагательных. Например: ночная поездка после дождя, огни на мокром стекле, постепенно пустеющий город и дорога к горизонту. Такой контекст помогает согласовать настроение и развитие аранжировки.
Здесь же зафиксируйте общую дугу: сдержанные куплеты, нарастающие пре-хорусы, раскрывающиеся припевы и пауза перед финальным подъёмом.
Vocal Details описывает голос явно
Для вокальной композиции задайте:
- конфигурацию ведущего вокала;
- тембр и регистр;
- манеру исполнения по секциям;
- гармонии и бэк-вокал;
- сдержанную обработку, если она нужна.
Формулировка «красивый женский вокал» слишком расплывчата. Полезнее указать близкий мягкий голос в куплетах, более плотную подачу в припеве и широкие гармонии только в финальном припеве.
Для инструментального трека прямо укажите отсутствие вокала и назовите инструмент или текстуру, которые несут ведущую мелодию. В облачном API для этого предусмотрен параметр is_instrumental: true.
Arrangement раскладывает инструменты по времени
Перечень «синтезатор, бас, ударные, гитара, пэды» описывает состав, но не аранжировку. Добавьте жизненный цикл элементов:
- в интро звучат пульсирующий синтезатор и приглушённая бочка;
- в куплете входят бас и сухая перкуссия;
- в пре-хорусе появляются пэд и более яркие хай-хэты;
- припев расширяется аккордовыми синтезаторами, хлопками и бэк-вокалом;
- в бридже исчезают бас и ударные;
- финальный припев возвращает ритм и добавляет верхние слои;
- в аутро элементы постепенно уходят, оставляя исходный синтезатор.
Проверяйте три линии развития: появление и исчезновение инструментов, изменение ритмической плотности и переходные эффекты. Свип перед припевом или длинный хвост реверберации перед бриджем полезнее общего списка эффектов без привязки ко времени.
Готовый шаблон
Ниже — англоязычный шаблон с названиями полей Structured Caption. Инструкция Music Caption Rewriter в репозитории MiniMax описывает три раздела в таком порядке.
Global Metadata
Genre and subgenre: ...
Tempo and groove: ...
Emotional progression: ...
Overall sonic and production profile: ...
Vocal Details
Lead vocal: ...
Verse delivery: ...
Chorus delivery: ...
Backing vocals and harmonies: ...
Vocal effects: ...
Arrangement
Intro: ...
Verse: ...
Pre-Chorus: ...
Chorus: ...
Bridge: ...
Final Chorus: ...
Outro: ...Заполняйте только обоснованные параметры. Не придумывайте точную тональность, BPM, пол вокалиста или технику обработки, если они не нужны задаче.
После заполнения прочитайте все разделы подряд. Требования должны образовывать последовательный переход. Например, камерный голос в куплетах совместим с широкими гармониями в финальном припеве. Одновременное требование интимной и стадионной подачи во всех секциях создаёт конфликт.
Подключение по API
Для вызова облачного API нужен API-ключ MiniMax. Официальная документация указывает Bearer-авторизацию, обязательный Content-Type: application/json и размещение ключа в разделе Account Management > API Keys. Передавайте ключ через переменную окружения и не вставляйте его в текст материала или репозиторий.
Минимальный запрос к music-3.0:
curl --request POST --url https://api.minimax.io/v1/music_generation --header "Authorization: Bearer ${MINIMAX_API_KEY}" --header "Content-Type: application/json" --data '{
"model": "music-3.0",
"prompt": "Warm electronic pop with an intimate vocal and a gradual build.",
"lyrics": "[Verse]\\nYour verse text\\n[Chorus]\\nYour chorus text",
"audio_setting": {
"sample_rate": 44100,
"bitrate": 256000,
"format": "mp3"
},
"output_format": "url"
}'Вместо ${MINIMAX_API_KEY} подставьте ключ из аккаунта. Успех проверяйте по двум признакам: HTTP 200 и base_resp.status_code: 0 в JSON-ответе. При output_format: "url" скачайте файл в течение 24 часов, потому что ссылка истекает. Приведённый пример основан на документации; его запуск при подготовке материала не выполнялся.
Полезные сценарии
Усилить припев без смены темпа
Исходные данные: готовые Lyrics с куплетом, пре-хорусом и припевом, но генерация звучит ровно.
В Arrangement сохраните постоянный темп и опишите рост через новые слои, более яркие хай-хэты, широкие аккорды и бэк-вокал. Проверяемый признак: при прослушивании припев отличается по плотности и ширине, даже если фактический темп не меняется.
Если различие не слышно, меняйте только описание припева и перехода к нему. Модель может выполнить указания приблизительно, поэтому одного прогона недостаточно для вывода о стабильности управления.
Сделать разреженный бридж и вернуть финальную энергию
Исходные данные: форма с тегами [Bridge] и последующим [Chorus].
Укажите, что в бридже уходят бас и основные ударные, остаются голос, пэд или один гармонический инструмент. Для финального припева явно верните ритм и добавьте верхние слои или гармонии.
Проверяемый признак: бридж воспринимается как снижение плотности, а следующий припев — как восстановление энергии. Этот сценарий не подходит для композиции, где структура должна оставаться намеренно статичной.
Подготовить инструментальную композицию
Исходные данные: музыкальное описание без текста.
Укажите инструментальный режим, ведущий мелодический инструмент и его роль по секциям. В облачном API используйте is_instrumental: true; поле prompt при этом обязательно и принимает от 1 до 2000 символов.
Проверяемый признак: в результате нет вокала, а ведущая мелодия сохраняет узнаваемую роль при изменении аранжировки.
Как проверить результат
Structured Caption полезен как основа контролируемых итераций. Для проверки сохраните:
- исходные
Lyrics; - полный Structured Caption;
- модель и способ запуска;
seed, если выбранный способ запуска его поддерживает;- полученный аудиофайл;
- краткую оценку каждой секции.
Сравнивайте результат по наблюдаемым признакам:
- секции идут в ожидаемом порядке;
- вокальная подача меняется в заданных местах;
- нужные инструменты входят и исчезают;
- припев отличается по энергии;
- бридж создаёт запланированный контраст;
- текст остаётся разборчивым и в достаточной степени соблюдается.
Меняйте за одну итерацию один раздел или одно локальное требование. Так проще понять, повлияла ли правка на результат. Даже при фиксированном входе совпадение с описанием нельзя считать строгой гарантией.
Ограничения и статус API
Открытая MiniMax Music 3 генерирует песни продолжительностью до пяти минут и выдаёт стерео WAV 32 кГц, 16 бит. Официальный репозиторий указывает необходимость двух CUDA GPU, только нестриминговую генерацию, лимит токенизированного текстового промпта в 5000 токенов и ограничение в 9000 акустических кадров.
API reference, проверенный 8 сентября 2026 года, описывает для облачной модели music-3.0 отдельные поля prompt и lyrics, инструментальный режим и автоматическую генерацию текста через lyrics_optimizer. Для неинструментальной генерации prompt может содержать от 0 до 2000 символов, а lyrics обязательны в диапазоне от 1 до 3500 символов, если не включена автоматическая генерация. При is_instrumental: true поле prompt обязательно и принимает от 1 до 2000 символов, а lyrics не требуется.
MiniMax указывает, что начиная с 20 августа 2026 года платные API Music Generation и Lyrics Generation недоступны новым пользователям, а существующие платящие пользователи могут продолжать пользоваться текущими API. Бесплатные API Music-3.0-free, Music-2.6-free и music-cover-free документация сообщает, что будут прекращены. Для доступа к возможностям генерации музыки MiniMax предлагает MiniMax Audio или открытую модель MiniMax Music 3 на Hugging Face.
В исходном материале зафиксировано наблюдение о русском вокале. В описанном эксперименте без применения LoRA результат оказался неприемлемым по совокупности дикции, произношения, следования тексту, фразировки и тембра. LoRA не применялась, причина проблем не установлена, а воспроизводимый русскоязычный набор входов и настроек не сохранён. Это наблюдение одного незавершённого эксперимента, а не общая оценка модели.
Поэтому руководство описывает способ подготовки промпта, предусмотренный документацией и репозиторием, но не обещает качественный русскоязычный вокал или точное выполнение всех музыкальных указаний.
По теме
Следующий шаг
MiniMax Music 3: модель с открытыми весами и практический подход к промптингу
Связанные материалы
- Статья: DAWalka: генератор музыки и звука прямо в Logic Pro — локально, без облака и подписок
- Блог: ACE-Step 1.5 XL — open-source генератор музыки, который обогнал Suno
- База знаний: DAWalka — локальный AI-генератор звука и музыки для DAW
Такой подход полезен командам, которые хотят превратить генерацию музыки в повторяемую работу с брифом, версиями входов и понятными критериями проверки.
Если захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov
Проверенные источники
- Руководство MiniMax по Music Generation — облачный workflow Music 3.0, разделение
promptиlyrics, инструментальная генерация и статус доступности API. - Справочник Music Generation API — модели, поля, секционные теги и актуальные ограничения входов.
- История выпусков моделей MiniMax — выпуск Music-3.0 от 16 июля 2026 года.
- MiniMax Music 3 на GitHub — открытая модель, Structured Caption, схема локального запуска и ограничения генерации.
- Инструкция Music Caption Rewriter — три раздела Structured Caption, приоритет требований и построение аранжировки по секциям.
- Наблюдение о русском вокале и статусе эксперимента — зафиксировано в исходном материале; это не внешний тест и не обобщение.
Если хотите разобрать свою задачу — напишите мне Если хотите разобрать свою задачу — напишите мне.
Можно прийти с идеей, черновым контекстом или уже живой задачей. Помогу быстро понять, где реальный следующий шаг, а где лишний шум.
Обычно хватает 2–3 сообщений, чтобы понять, могу ли я здесь реально помочь и в каком формате лучше двигаться дальше.
Дальше по теме
Руководство по промптингу Seedance 2.5: 30-секундный кадр со звуком, четыре бита, шесть деталей и рабочие правила работы с референсами.