pimenov.ai

Qwen3.8-27B без цензуры: локальная MLX-сборка для Mac в четырёх размерах

OrcaRouter выпустил MLX-сборку Qwen3.8-27B без механизма отказов: четыре квантизации от 8,7 до 27,5 ГБ под Mac с Apple Silicon. Какую выбрать и что учесть.

ИнструментыОбзор

Команда OrcaRouter выложила на Hugging Face официальную MLX-сборку модели Qwen3.8-27B. MLX — это фреймворк Apple для запуска моделей на чипах Apple Silicon, так что для работы не нужны ни облако, ни видеокарта с CUDA: только Mac и веса модели.

Главная особенность релиза — выбор из четырёх квантизаций, то есть степеней сжатия весов: 8, 6, 4 и 2 бита. 8-битная версия занимает около 27,5 ГБ и просит минимум 32 ГБ оперативной памяти, зато почти не теряет в качестве. 4-битная ужимается до 15 ГБ и работает на Mac с 24 ГБ; авторы называют её вариантом по умолчанию. А вот 2-битная (8,7 ГБ, хватит 16 ГБ) добавлена скорее для архива: генерация на ней разваливается в повторы и бессвязный текст, для реальной работы она не подходит. Проще говоря, сборка выбирается под объём памяти конкретного Mac.

Слово uncensored в названии означает, что из модели на уровне весов убрали обученные отказы: она отвечает на запросы, которые исходная Qwen3.8-27B отклоняла. Авторы позиционируют сборку как инструмент для исследований безопасности и red-teaming, то есть проверки моделей на устойчивость. Для продакшена без собственного слоя модерации она не предназначена, и ответственность за применение лежит на том, кто её запускает. Есть и практические нюансы: репозиторий закрыт соглашением, которое нужно принять на странице модели, а в LM Studio дополнительно придётся добавить токен Hugging Face и отключить квантизацию KV-кэша, иначе загрузка обрывается на инициализации.

При этом у сборки сохранились зрение (можно подавать изображения), вызов инструментов и контекст в 262 тысячи токенов. Сама базовая модель с гибридной архитектурой вышла недавно и с открытыми весами, я писал об этом.

Практический вывод: если у вас Mac с 24–32 ГБ памяти и есть задачи, где нужна локальная модель без облачных зависимостей, 4- или 6-битная сборка ставится через LM Studio или mlx-vlm буквально несколькими командами. Замеров скорости на Apple Silicon авторы не приводят, так что производительность имеет смысл проверить на своём железе до того, как строить на ней процессы.

Следующий шаг

Как поднять свою LLM и подключить к Codex

Связанные материалы

Локальные модели на собственном железе — рабочий вариант для приватных задач и исследований, но связку модели и конфигурации стоит подбирать под конкретный сценарий. Если эта тема близка вашей команде, её можно разобрать на вашем примере.

Если захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov