Гостевая статья. Автор — Михаил Иванов.
Несколько лет у меня не доходили руки смонтировать свою свадьбу.
Причина была простой. Оператор, который снимал, не озаботился приблудами для чистой записи звука. Когда я открыл материалы, там оказалось много тостов под звяканье вилок о тарелки. Мой аутичный мозг корёжило в тот же момент — и каждый новый заход в монтаж заканчивался, не начавшись.
Так исходники и лежали. Не потому что лень монтировать: потому что невозможно слушать то, что монтируешь.
За это время поменялось кое-что важное. Стали появляться модельки, которые умеют отделять голос от шума — не «почти как в студии», а реально хорошо. На одну из таких я наткнулся, когда копался в открытых наработках по звуку. И дальше в этой статье — про неё, про то, как я свернул её в маленькое приложение «Звукочист», и про то, что с этим теперь можно делать дома.
Что вообще делает модель очистки звука
Если объяснять без магии: модель берёт запись и решает для каждого кусочка звука — это голос или это фон. Не вырезает частоты ножницами, как эквалайзер, а именно разделяет. Гул толпы, шум улицы, гудение холодильника в кафе и то самое звяканье посуды уходят, речь остаётся.
Модель, которую я выбрал, называется MossFormer2_SE_48K. Она из открытого набора ClearerVoice-Studio — это исследовательский тулкит, который опубликовала команда Alibaba. Веса открытые, крутить у себя можно свободно.
Почему «48K» в названии — это не маркетинг
Большинство моделей шумоподавления рассчитаны на 16 кГц. Это частотный потолок телефонной связи: для созвона по голосу хватает, для монтажа — уже нет. У «телефонного» звука верхняя граница примерно 8 кГц, и после такой обработки голос звучит как из трубки.
MossFormer2_SE_48K работает с полным диапазоном до 48 кГц. Тот самый full-band: звонкие «с» и «ф», дыхание, артикуляция — всё остаётся на месте. Для видео, которое потом будут смотреть в наушниках, это принципиально.
Если заглянуть под капот (там интересно, но можно и не заглядывать): модель смотрит на спектрограмму записи — это такая «карта» звука, где по одной оси время, по другой частоты — и предсказывает так называемую маску. Грубо говоря, карту, которой частицам объясняют: тебе быть, тебя убрать. Дальше маска накладывается на запись, и звук собирается обратно. Саму сеть собрали из 24 блоков, в каждом — трансформерная часть для глобальных связей и рекуррентный модуль для тонких временны́х зависимостей речи. По меркам открытых моделей это современный уровень: в таблицах авторов она обходит другие открытые решения по качеству.
Мне в этой статье важно другое: чтобы почистить получасовую запись, больше не нужна студия. Нужен домашний компьютер.
Почему «просто модель из консоли» мне не подошла
Самый очевидный путь — склонировать репозиторий, создать окружение, запускать обработку скриптом. Он работает. Но у меня не одна запись, а гора исходников с нескольких камер и диктофонов, и каждый раз для каждого файла собирать команду в терминале — то ещё удовольствие.
Когда исходников много, важна не столько сама модель, сколько конвейер: бросил файлы — получил чистые файлы.
Поэтому я вооружился opencode и локальной LLM-моделью qwen flash next — и собрал с ними небольшое приложение «Звукочист». Как и всё остальное, что я делаю, только под macOS. Саму программу я выложил у себя в телеграм-канале.
Что получилось
Интерфейс нарочно простой, на один экран.
Сверху — зона, куда можно перетащить файлы: аудио и видео вместе. WAV, MP3, FLAC, M4A, OGG — и сразу MP4, MOV, MKV, WebM. Видео можно не разматывать: программа сама заберёт из него звук, почистит и вернёт на место.
Пониже — настройки, которых сознательно немного:
- Качество обработки. «Стандартное (fp16)» — быстрый режим, «Высокое (fp32)» — когда важна аккуратность. Я по умолчанию держу высокое.
- Интенсивность очистки — ползунок от 0 до 100%. Это, пожалуй, главная ручка. На 100% модель вычищает фанатично: когда шума больше, чем голоса, — самое то. Но иногда голос после полной зачистки становится чуть «стеклянным». Тогда стоит поиграть со значением пониже.
- Формат результата: WAV, MP3 или FLAC. Для WAV — разрядность (я беру 24 бита) и частота, включая «родную» 48 000 Гц: с какой записывали, с той и отдаём, без лишних пересчётов.
- Куда сохранять — рядом с исходниками или в отдельную папку.
Всё это крутится локально, на Apple Silicon, через MLX. Ни строчки в облако: чужие записи не улетают на чужие серверы, всё остаётся на диске. По времени — практически моментально: очередь из видео обрабатывается быстрее, чем я успеваю налить чай.
Честные границы
Модель разделяет голос и шум — и это стоит помнить.
Гул зала, уличный шум и фон вечеринки она убирает хорошо. Но если под репортажем играет музыка, модель будет пытаться убрать и её: для неё это тоже «не голос». Живые эмоции — смех, хлопки, возгласы прохожих — тоже пограничная зона: иногда остаются, иногда съеживаются. Это не баг конкретной программы, это свойство задачи: у модели нет понятия «это полезный шум, оставь его».
Ещё одно наблюдение: чем выше интенсивность, тем сильнее голос становится «стерильным». Полностью чистая запись — не всегда то же самое, что живая. Для монтажа это чаще плюс (чистый голос можно собрать с любой атмосферой), но пару раз я откатывался со ста процентов назад именно ради воздуха.
С чего начать, если у вас тоже лежит такая гора
Найдите у себя «исходник, который невозможно слушать» — репортаж со мероприятия, интервью на шумной улице, голосовые заметки, записанные на телефон в кафе. Пару лет ждут своей очереди? Отлично, это они.
Возьмите один короткий фрагмент — минуту-две, самый худший. Прогоните через любую открытую модель очистки звука (та же связка ClearerVoice-Studio + MossFormer2_SE_48K ставится за вечер, а готовых программ с интерфейсом уже немало). Послушайте результат в наушниках.
Дальше можно решить, что вам нужнее: разовая обработка архива или свой конвейер на каждый день. У меня вышло второе — и это, пожалуй, самый неожиданный итог: пока чинил звук, собрал инструмент, который теперь использую для любых записей.
За монтаж свадьбы, к слову, я пока так и не засел.
Но теперь у меня хотя бы нет для этого причин.
«Звукочист», как и другие мои приложения для macOS, лежит у меня в телеграм-канале: скачать «Звукочист».
Следующий шаг
Если у вас есть видеоматериалы, которые годами не складываются в монтаж — возможно, дело не в лени, а в звуке.
Локальные модели в работе: Mac Studio, DAWalka и DeepSeek — рассказ Миши Иванова
Если вы работаете с архивом аудио и видео, можно разобрать, какие этапы обработки стоит автоматизировать и как собрать локальный процесс под ваши записи.
Если захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov



