Qwen — экосистема языковых, мультимодальных и агентных моделей и инструментов Alibaba. Официальный репозиторий представляет Qwen3.8 как последнее открытое поколение серии Qwen3.5. В открытый выпуск входят Qwen3.8-2.4T-A95B и Qwen3.8-27B. Локальные серверы для них можно запускать через Transformers, SGLang, vLLM и TokenSpeed. Для работы с кодом из терминала используйте Qwen Code.
Данные проверены 10 сентября 2026 года по официальному репозиторию Qwen3.8, документации Qwen Code и документации Alibaba Cloud Model Studio. Команды в рамках подготовки материала не запускались.
Основные модели и инструменты экосистемы
| Семейство или инструмент | Основное назначение | Что учитывать |
| Qwen3.8 | Программирование, профессиональные задачи, исследования и длительные агентные сценарии | Открытые модели Qwen3.8-2.4T-A95B и Qwen3.8-27B |
| Qwen3.6 | Языковые задачи и агентное программирование | Предыдущее открытое поколение; сравнивайте с Qwen3.8 на своих данных |
| Qwen3.5 | Мультимодальные базовые модели на визуально-языковой основе | В README заявлены раннее слияние мультимодальных токенов, разреженная смесь экспертов и поддержка 201 языка и диалекта |
| QwenCloud / qwen3.8-max | Облачный API для Qwen3.8 | Идентификатор модели и отдельные возможности зависят от региона и снимка |
| Qwen Code | Работа с кодовой базой из терминала | Открытый агент, оптимизированный для моделей Qwen |
Релизы и возможности Qwen3.8
Модель Qwen3.8-2.4T-A95B опубликована 12 августа 2026 года, а Qwen3.8-27B — 14 августа. Официальный репозиторий относит основные улучшения поколения к следующим направлениям:
- программирование, профессиональная работа и исследования;
- автономное планирование и обработка обратной связи от среды;
- выполнение длинных многошаговых агентных задач;
- совместимость с распространёнными средствами разработки и оценки;
- управление глубиной рассуждений через
reasoning_effort; - сохранение контекста рассуждений между сообщениями через
preserve_thinking.
Разработчик называет Qwen3.8 первым открытым выпуском модели класса Qwen-Max. Это описание производителя, а не универсальная оценка качества. Перед внедрением сравните модели на собственных задачах, включая качество кода, задержку, потребление памяти и корректность вызова инструментов.
Qwen3.6 остаётся доступным предыдущим открытым поколением. Модели Qwen3.6-35B-A3B и Qwen3.6-27B опубликованы 16 и 22 апреля 2026 года соответственно. Репозиторий выделяет в этом выпуске улучшенное агентное программирование, включая работу с фронтендом и рассуждение на уровне репозитория, а также сохранение контекста рассуждений в истории диалога.
Открытые модели и облачная qwen3.8-max
Открытые веса Qwen3.8 и облачная модель qwen3.8-max относятся к одному поколению, но подключаются по-разному. Идентификатор облачной модели нельзя автоматически подставлять вместо имени локальной модели с Hugging Face.
По документации Alibaba Cloud Model Studio на 10 сентября 2026 года:
- идентификатор облачной модели —
qwen3.8-max; - поддерживаются текст, изображения и видео на входе и текст на выходе;
- карточка модели отмечает поддержку вызова функций, структурированных ответов и кэширования контекста в перечисленных регионах;
- контекстное окно составляет 1 000 000 токенов;
- максимальный ввод без режима рассуждений — 991 808 токенов, с ним — 983 616;
- максимальный вывод — 131 072 токена;
- максимальная длина цепочки рассуждений — 262 144 токена.
Веб-поиск зависит от выбранного идентификатора и региона: для базового qwen3.8-max карточка отмечает его поддержку в Пекине и Сингапуре, а для снимка qwen3.8-max-0902 поддержка указана во всех перечисленных регионах. Допустимая длина контекста зависит от сочетания параметров API.
В документации также указан снимок qwen3.8-max-0902, он же qwen3.8-max-2026-09-02. Для воспроизводимого приложения лучше фиксировать снимок, а не плавающий идентификатор, если выбранный регион его поддерживает.
Официальный репозиторий называет облачный сервис QwenCloud и указывает совместимость со спецификациями OpenAI и Anthropic. Alibaba Cloud Model Studio отдельно документирует OpenAI-совместимый Chat API с региональными адресами, зависящими от рабочего пространства. Перед подключением проверьте доступность модели, адрес, лимиты и стоимость для своего региона.
Локальный запуск Qwen3.8-27B
Официальный README приводит четыре варианта запуска сервера. Фактические требования к памяти и скорость зависят от оборудования, формата весов и версии фреймворка.
Transformers
transformers serve Qwen/Qwen3.8-27B --port 8000 --continuous-batchingПосле успешного запуска OpenAI-совместимый API доступен по адресу http://localhost:8000/v1.
SGLang
sglang serve --model-path Qwen/Qwen3.8-27B --port 8000 --tp-size 4 --context-length 262144 --reasoning-parser qwen3 --tool-call-parser qwen3_codervLLM
vllm serve Qwen/Qwen3.8-27B --port 8000 --tensor-parallel-size 4 --max-model-len 262144 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coderTokenSpeed
tokenspeed serve Qwen/Qwen3.8-27B --port 8000 --tensor-parallel-size 4 --max-model-len 262144 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coderДля серии Qwen3.5 репозиторий также указывает поддержку llama.cpp. На Apple Silicon доступны mlx-lm для текста и mlx-vlm для текста с изображениями. Unsloth предлагает локальный интерфейс и руководства для запуска квантизованных вариантов Qwen3.8.
Проверка локального API
Сначала запросите список загруженных моделей:
curl http://localhost:8000/v1/modelsПризнак успеха: сервер возвращает JSON без ошибки соединения, а в списке присутствует загруженная модель.
Затем возьмите точное значение model из ответа /v1/models и отправьте минимальный запрос:
curl http://localhost:8000/v1/chat/completions -H "Content-Type: application/json" -d '{"model":"Qwen/Qwen3.8-27B","messages":[{"role":"user","content":"Ответь одним словом: готово"}]}'Успешная проверка должна вернуть HTTP-ответ с JSON и сгенерированным сообщением. При ошибке загрузки проверьте доступную память, версию фреймворка и точный идентификатор модели.
Полезные сценарии
Подключение существующего приложения к локальной модели
Задача: проверить Qwen3.8-27B в приложении, которое уже использует формат OpenAI.
Исходные условия: модель помещается в доступную память, установлен поддерживаемый сервер, порт 8000 свободен.
Действие: запустите сервер и укажите в тестовом клиенте базовый адрес http://localhost:8000/v1.
Наблюдаемый результат: запрос к /v1/chat/completions возвращает структурированный JSON с сообщением модели.
Ограничение: совместимость API не гарантирует одинаковое поведение моделей. Отдельно проверьте системные инструкции, потоковую выдачу и обработку ошибок.
Агент для ограниченного изменения в репозитории
Задача: изучить кодовую базу и подготовить проверяемое изменение из терминала.
Исходные условия: установлен Qwen Code, настроен поддерживаемый модельный провайдер, репозиторий открыт в рабочей директории.
Действие: задайте точную цель и область файлов, запросите анализ, затем проверьте список изменений и тесты до применения результата.
Наблюдаемый результат: агент находит связанные файлы и показывает согласованный набор изменений.
Ограничение: возможности длительной агентной работы не гарантируют корректность правок. Ограничивайте права и не принимайте изменения без ревью.
Сервер с вызовом инструментов
Задача: подключить Qwen3.8-27B к приложению, которому нужен автоматический выбор функций.
Исходные условия: подготовлен vLLM или TokenSpeed, приложение передаёт описания инструментов в OpenAI-совместимом формате.
Действие: запустите сервер с --enable-auto-tool-choice и --tool-call-parser qwen3_coder. Первую проверку выполните с функцией без побочных эффектов.
Наблюдаемый результат: при корректной настройке приложение получает структурированный запрос инструмента, который может распознать.
Ограничение: запись, удаление и внешняя публикация требуют отдельного контроля на стороне приложения.
Возможности Qwen Code
Актуальная документация описывает интерактивный и безинтерактивный режимы (headless), проверку кода, MCP, изоляцию выполнения, подтверждение операций, плагины, структурированный вывод, рабочие деревья Git и интеграции с редакторами и системами непрерывной интеграции (CI).
Для безопасного начала:
- Откройте только нужный репозиторий.
- Ограничьте задачу конкретными файлами и результатом.
- Оставьте подтверждение операций включённым.
- Проверьте изменения и тесты перед принятием результата.
- Не передавайте агенту секреты и лишние права.
Лицензии проверяются для каждой модели
Официальный README предписывает проверять лицензионный файл, опубликованный вместе с весами на Hugging Face Hub или ModelScope. Лицензию репозитория нельзя автоматически переносить на все модели, исторические выпуски и облачные сервисы.
Перед коммерческим использованием откройте страницу именно выбранной модели и сохраните версию её лицензии вместе с технической конфигурацией проекта.
Как выбрать между локальным запуском, API и Qwen Code
- Для нового локального проекта сначала оцените Qwen3.8-27B на своём оборудовании и с выбранным сервером.
- Для Qwen3.8-2.4T-A95B заранее оцените инфраструктуру и условия лицензии.
- Если система уже работает на Qwen3.6, сравните поколения на одном наборе задач до миграции.
- Для управляемого облачного API рассмотрите
qwen3.8-maxи проверьте региональные ограничения Alibaba Cloud Model Studio. - Для мультимодального облачного сценария учтите, что карточка
qwen3.8-maxуказывает текст, изображения и видео на входе и текст на выходе. - Для интерактивной работы с репозиторием подходит Qwen Code.
Окончательный выбор делайте после теста на своих данных. Зафиксируйте модель или снимок, версию сервера, длину контекста и параметры рассуждений: без этого результаты сравнения трудно воспроизвести.
Официальные источники
- Официальный репозиторий Qwen3.8
- Коллекция Qwen3.8 на Hugging Face
- Коллекция Qwen3.8 на ModelScope
- Документация Qwen Code
- OpenAI-совместимый Chat API Alibaba Cloud Model Studio
- Параметры облачной модели qwen3.8-max
- QwenCloud
Следующий шаг
Для запуска моделей через графический интерфейс без ручной настройки серверных флагов изучите LM Studio — локальный запуск LLM и агент Bionic.
Если вы выбираете модель или проектируете безопасный агентный сценарий, полезно заранее сопоставить требования к качеству, инфраструктуре и доступным правам.
Если захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov



