Qwen — экосистема языковых, мультимодальных и агентных моделей и инструментов Alibaba. Официальный репозиторий представляет Qwen3.8 как последнее открытое поколение серии Qwen3.5. В открытый выпуск входят Qwen3.8-2.4T-A95B и Qwen3.8-27B. Локальные серверы для них можно запускать через Transformers, SGLang, vLLM и TokenSpeed. Для работы с кодом из терминала используйте Qwen Code.

Данные проверены 10 сентября 2026 года по официальному репозиторию Qwen3.8, документации Qwen Code и документации Alibaba Cloud Model Studio. Команды в рамках подготовки материала не запускались.


Основные модели и инструменты экосистемы

Семейство или инструментОсновное назначениеЧто учитывать
Qwen3.8Программирование, профессиональные задачи, исследования и длительные агентные сценарииОткрытые модели Qwen3.8-2.4T-A95B и Qwen3.8-27B
Qwen3.6Языковые задачи и агентное программированиеПредыдущее открытое поколение; сравнивайте с Qwen3.8 на своих данных
Qwen3.5Мультимодальные базовые модели на визуально-языковой основеВ README заявлены раннее слияние мультимодальных токенов, разреженная смесь экспертов и поддержка 201 языка и диалекта
QwenCloud / qwen3.8-maxОблачный API для Qwen3.8Идентификатор модели и отдельные возможности зависят от региона и снимка
Qwen CodeРабота с кодовой базой из терминалаОткрытый агент, оптимизированный для моделей Qwen

Релизы и возможности Qwen3.8

Модель Qwen3.8-2.4T-A95B опубликована 12 августа 2026 года, а Qwen3.8-27B — 14 августа. Официальный репозиторий относит основные улучшения поколения к следующим направлениям:

  • программирование, профессиональная работа и исследования;
  • автономное планирование и обработка обратной связи от среды;
  • выполнение длинных многошаговых агентных задач;
  • совместимость с распространёнными средствами разработки и оценки;
  • управление глубиной рассуждений через reasoning_effort;
  • сохранение контекста рассуждений между сообщениями через preserve_thinking.

Разработчик называет Qwen3.8 первым открытым выпуском модели класса Qwen-Max. Это описание производителя, а не универсальная оценка качества. Перед внедрением сравните модели на собственных задачах, включая качество кода, задержку, потребление памяти и корректность вызова инструментов.

Qwen3.6 остаётся доступным предыдущим открытым поколением. Модели Qwen3.6-35B-A3B и Qwen3.6-27B опубликованы 16 и 22 апреля 2026 года соответственно. Репозиторий выделяет в этом выпуске улучшенное агентное программирование, включая работу с фронтендом и рассуждение на уровне репозитория, а также сохранение контекста рассуждений в истории диалога.


Открытые модели и облачная qwen3.8-max

Открытые веса Qwen3.8 и облачная модель qwen3.8-max относятся к одному поколению, но подключаются по-разному. Идентификатор облачной модели нельзя автоматически подставлять вместо имени локальной модели с Hugging Face.

По документации Alibaba Cloud Model Studio на 10 сентября 2026 года:

  • идентификатор облачной модели — qwen3.8-max;
  • поддерживаются текст, изображения и видео на входе и текст на выходе;
  • карточка модели отмечает поддержку вызова функций, структурированных ответов и кэширования контекста в перечисленных регионах;
  • контекстное окно составляет 1 000 000 токенов;
  • максимальный ввод без режима рассуждений — 991 808 токенов, с ним — 983 616;
  • максимальный вывод — 131 072 токена;
  • максимальная длина цепочки рассуждений — 262 144 токена.

Веб-поиск зависит от выбранного идентификатора и региона: для базового qwen3.8-max карточка отмечает его поддержку в Пекине и Сингапуре, а для снимка qwen3.8-max-0902 поддержка указана во всех перечисленных регионах. Допустимая длина контекста зависит от сочетания параметров API.

В документации также указан снимок qwen3.8-max-0902, он же qwen3.8-max-2026-09-02. Для воспроизводимого приложения лучше фиксировать снимок, а не плавающий идентификатор, если выбранный регион его поддерживает.

Официальный репозиторий называет облачный сервис QwenCloud и указывает совместимость со спецификациями OpenAI и Anthropic. Alibaba Cloud Model Studio отдельно документирует OpenAI-совместимый Chat API с региональными адресами, зависящими от рабочего пространства. Перед подключением проверьте доступность модели, адрес, лимиты и стоимость для своего региона.


Локальный запуск Qwen3.8-27B

Официальный README приводит четыре варианта запуска сервера. Фактические требования к памяти и скорость зависят от оборудования, формата весов и версии фреймворка.

Transformers

transformers serve Qwen/Qwen3.8-27B --port 8000 --continuous-batching

После успешного запуска OpenAI-совместимый API доступен по адресу http://localhost:8000/v1.

SGLang

sglang serve --model-path Qwen/Qwen3.8-27B --port 8000 --tp-size 4 --context-length 262144 --reasoning-parser qwen3 --tool-call-parser qwen3_coder

vLLM

vllm serve Qwen/Qwen3.8-27B --port 8000 --tensor-parallel-size 4 --max-model-len 262144 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder

TokenSpeed

tokenspeed serve Qwen/Qwen3.8-27B --port 8000 --tensor-parallel-size 4 --max-model-len 262144 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder

Для серии Qwen3.5 репозиторий также указывает поддержку llama.cpp. На Apple Silicon доступны mlx-lm для текста и mlx-vlm для текста с изображениями. Unsloth предлагает локальный интерфейс и руководства для запуска квантизованных вариантов Qwen3.8.

⚠️
Внимание: параметр 262 144 в командах задаёт большой лимит контекста и может заметно увеличить потребление памяти. Начните с короткого запроса и повышайте лимит после проверки памяти под свою задачу.

Проверка локального API

Сначала запросите список загруженных моделей:

curl http://localhost:8000/v1/models

Признак успеха: сервер возвращает JSON без ошибки соединения, а в списке присутствует загруженная модель.

Затем возьмите точное значение model из ответа /v1/models и отправьте минимальный запрос:

curl http://localhost:8000/v1/chat/completions -H "Content-Type: application/json" -d '{"model":"Qwen/Qwen3.8-27B","messages":[{"role":"user","content":"Ответь одним словом: готово"}]}'

Успешная проверка должна вернуть HTTP-ответ с JSON и сгенерированным сообщением. При ошибке загрузки проверьте доступную память, версию фреймворка и точный идентификатор модели.


Полезные сценарии

Подключение существующего приложения к локальной модели

Задача: проверить Qwen3.8-27B в приложении, которое уже использует формат OpenAI.

Исходные условия: модель помещается в доступную память, установлен поддерживаемый сервер, порт 8000 свободен.

Действие: запустите сервер и укажите в тестовом клиенте базовый адрес http://localhost:8000/v1.

Наблюдаемый результат: запрос к /v1/chat/completions возвращает структурированный JSON с сообщением модели.

Ограничение: совместимость API не гарантирует одинаковое поведение моделей. Отдельно проверьте системные инструкции, потоковую выдачу и обработку ошибок.

Агент для ограниченного изменения в репозитории

Задача: изучить кодовую базу и подготовить проверяемое изменение из терминала.

Исходные условия: установлен Qwen Code, настроен поддерживаемый модельный провайдер, репозиторий открыт в рабочей директории.

Действие: задайте точную цель и область файлов, запросите анализ, затем проверьте список изменений и тесты до применения результата.

Наблюдаемый результат: агент находит связанные файлы и показывает согласованный набор изменений.

Ограничение: возможности длительной агентной работы не гарантируют корректность правок. Ограничивайте права и не принимайте изменения без ревью.

Сервер с вызовом инструментов

Задача: подключить Qwen3.8-27B к приложению, которому нужен автоматический выбор функций.

Исходные условия: подготовлен vLLM или TokenSpeed, приложение передаёт описания инструментов в OpenAI-совместимом формате.

Действие: запустите сервер с --enable-auto-tool-choice и --tool-call-parser qwen3_coder. Первую проверку выполните с функцией без побочных эффектов.

Наблюдаемый результат: при корректной настройке приложение получает структурированный запрос инструмента, который может распознать.

Ограничение: запись, удаление и внешняя публикация требуют отдельного контроля на стороне приложения.


Возможности Qwen Code

Актуальная документация описывает интерактивный и безинтерактивный режимы (headless), проверку кода, MCP, изоляцию выполнения, подтверждение операций, плагины, структурированный вывод, рабочие деревья Git и интеграции с редакторами и системами непрерывной интеграции (CI).

Для безопасного начала:

  1. Откройте только нужный репозиторий.
  2. Ограничьте задачу конкретными файлами и результатом.
  3. Оставьте подтверждение операций включённым.
  4. Проверьте изменения и тесты перед принятием результата.
  5. Не передавайте агенту секреты и лишние права.

Лицензии проверяются для каждой модели

Официальный README предписывает проверять лицензионный файл, опубликованный вместе с весами на Hugging Face Hub или ModelScope. Лицензию репозитория нельзя автоматически переносить на все модели, исторические выпуски и облачные сервисы.

Перед коммерческим использованием откройте страницу именно выбранной модели и сохраните версию её лицензии вместе с технической конфигурацией проекта.


Как выбрать между локальным запуском, API и Qwen Code

  • Для нового локального проекта сначала оцените Qwen3.8-27B на своём оборудовании и с выбранным сервером.
  • Для Qwen3.8-2.4T-A95B заранее оцените инфраструктуру и условия лицензии.
  • Если система уже работает на Qwen3.6, сравните поколения на одном наборе задач до миграции.
  • Для управляемого облачного API рассмотрите qwen3.8-max и проверьте региональные ограничения Alibaba Cloud Model Studio.
  • Для мультимодального облачного сценария учтите, что карточка qwen3.8-max указывает текст, изображения и видео на входе и текст на выходе.
  • Для интерактивной работы с репозиторием подходит Qwen Code.

Окончательный выбор делайте после теста на своих данных. Зафиксируйте модель или снимок, версию сервера, длину контекста и параметры рассуждений: без этого результаты сравнения трудно воспроизвести.


Официальные источники

Следующий шаг

Для запуска моделей через графический интерфейс без ручной настройки серверных флагов изучите LM Studio — локальный запуск LLM и агент Bionic.

Если вы выбираете модель или проектируете безопасный агентный сценарий, полезно заранее сопоставить требования к качеству, инфраструктуре и доступным правам.

Если захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov