Qwen3.8-27B без цензуры: локальная MLX-сборка для Mac в четырёх размерах
OrcaRouter выпустил MLX-сборку Qwen3.8-27B без механизма отказов: четыре квантизации от 8,7 до 27,5 ГБ под Mac с Apple Silicon. Какую выбрать и что учесть.
Команда OrcaRouter выложила на Hugging Face официальную MLX-сборку модели Qwen3.8-27B. MLX — это фреймворк Apple для запуска моделей на чипах Apple Silicon, так что для работы не нужны ни облако, ни видеокарта с CUDA: только Mac и веса модели.
Главная особенность релиза — выбор из четырёх квантизаций, то есть степеней сжатия весов: 8, 6, 4 и 2 бита. 8-битная версия занимает около 27,5 ГБ и просит минимум 32 ГБ оперативной памяти, зато почти не теряет в качестве. 4-битная ужимается до 15 ГБ и работает на Mac с 24 ГБ; авторы называют её вариантом по умолчанию. А вот 2-битная (8,7 ГБ, хватит 16 ГБ) добавлена скорее для архива: генерация на ней разваливается в повторы и бессвязный текст, для реальной работы она не подходит. Проще говоря, сборка выбирается под объём памяти конкретного Mac.
Слово uncensored в названии означает, что из модели на уровне весов убрали обученные отказы: она отвечает на запросы, которые исходная Qwen3.8-27B отклоняла. Авторы позиционируют сборку как инструмент для исследований безопасности и red-teaming, то есть проверки моделей на устойчивость. Для продакшена без собственного слоя модерации она не предназначена, и ответственность за применение лежит на том, кто её запускает. Есть и практические нюансы: репозиторий закрыт соглашением, которое нужно принять на странице модели, а в LM Studio дополнительно придётся добавить токен Hugging Face и отключить квантизацию KV-кэша, иначе загрузка обрывается на инициализации.
При этом у сборки сохранились зрение (можно подавать изображения), вызов инструментов и контекст в 262 тысячи токенов. Сама базовая модель с гибридной архитектурой вышла недавно и с открытыми весами, я писал об этом.
Практический вывод: если у вас Mac с 24–32 ГБ памяти и есть задачи, где нужна локальная модель без облачных зависимостей, 4- или 6-битная сборка ставится через LM Studio или mlx-vlm буквально несколькими командами. Замеров скорости на Apple Silicon авторы не приводят, так что производительность имеет смысл проверить на своём железе до того, как строить на ней процессы.
Следующий шаг
Как поднять свою LLM и подключить к Codex
Связанные материалы
- Статья: Локальные модели в работе: Mac Studio, DAWalka и DeepSeek — рассказ Миши Иванова
- Блог: Qwen3.8-27B вышла с открытыми весами и контекстом до миллиона токенов
- База знаний: LM Studio — локальный запуск LLM и агент Bionic
Локальные модели на собственном железе — рабочий вариант для приватных задач и исследований, но связку модели и конфигурации стоит подбирать под конкретный сценарий. Если эта тема близка вашей команде, её можно разобрать на вашем примере.
Если захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov
Если хотите разобрать свою задачу — напишите мне Если хотите разобрать свою задачу — напишите мне.
Можно прийти с идеей, черновым контекстом или уже живой задачей. Помогу быстро понять, где реальный следующий шаг, а где лишний шум.
Обычно хватает 2–3 сообщений, чтобы понять, могу ли я здесь реально помочь и в каком формате лучше двигаться дальше.
Дальше по теме
Higgsfield выпустил The Cully Hill Boys: 110 минут, лицензированный каст реальных людей, $2 млн. Это второй фильм студии за неделю после Hell Grind.