Найти материал

Поиск по опубликованным материалам, разборам и форматам работы. После согласия на аналитику запросы помогают улучшать поиск. ⌘K / Ctrl+K — поиск · ↑↓ — выбор · Enter — открыть

Поиск по полным текстам на отдельной странице →

Все разборы

Разбор / Локальная модель

Материал от

Как локальный Qwen получил посильную редакционную задачу

Я хотел подключить локальную Qwen3.8 на Mac mini M4 Pro к привычной работе в Codex. Обычный чат с моделью отвечал, но полная агентная сессия зависала на обработке входа. Увеличение времени ожидания не решало проблему.

Рабочий результат появился после сужения задачи. Основной Codex собрал проверенные факты и редакционные требования, а локальная модель получила компактный пакет и вернула черновик статьи. Доступ к инструментам и публикация для этой задачи ей не понадобились.

Зафиксированный вход

196 784 токена

Один простой вопрос разросся до такого запроса в полной агентной среде.

Граница ожидания

Около 10 минут

Один воспроизводимый запуск отменился до завершения обработки большого префикса.

Рабочий результат

Черновик статьи

Qwen вернул Markdown по компактному пакету; финальная проверка осталась у основного Codex и автора.

Подключили модель, но передали ей слишком большой служебный пакет

Исходная ситуация

В исследованной среде было 586 инструментов, включая 553 MCP-инструмента. Их метаданные и остальной контекст стали существенной частью входа. Успех короткого чата не доказывал, что модель справится с такой нагрузкой.

От большого агентного входа перешли к одному редакционному пакету

Ход работы

  1. Сравнить короткий чат и полную сессию

    Отдельный диалог работал, поэтому проверили, что именно меняется при входе через Codex. Журналы показали размер запроса и длительную обработку до первого ответа.

  2. Найти подтверждённую границу сбоя

    В одном запуске обработалось 55 296 токенов примерно за 9,5 минуты, затем запрос отменился. Увеличение тайм-аута до 600 секунд лишь продлило ожидание того же исхода.

  3. Выделить отдельного исполнителя

    Для рабочего редакционного маршрута использовали изолированный MLX-процесс. Локальной модели не передавали файловую систему, Notion, браузер и весь каталог инструментов.

  4. Передать факты и получить текст

    Основной Codex подготовил компактный пакет: подтверждённые данные, редакционные правила и задачу. Qwen вернул Markdown-черновик, который затем прошёл проверку и доработку.

Готовый текст подтвердил узкий сценарий

Проверка

Итогом стал черновик исходной статьи. Это конкретная выполненная работа локальной модели, а не вывод о её пригодности для любых задач Codex. Уменьшили объём входа и ответственность исполнителя — и проверили результат на настоящем материале.

Локальная модель написала черновик о собственной установке

Результат

У задачи появился подходящий вход

Вместо огромной агентной сессии модель получила пакет, достаточный для написания одного текста.

Основной Codex сохранил управление

Подготовка фактов, работа с инструментами, проверка и дальнейшие действия остались в основном процессе. Локальный исполнитель отвечал за черновик.

Что этот результат подтверждает — и чего не обещает

Границы вывода

По журналам подтверждены большой вход, медленная обработка префикса и отмена около десятиминутной границы. Они не доказывают, что причиной был именно KV cache: в статье это отделено от сходных публичных сообщений.

Числа описывают конкретную конфигурацию августа 2026 года. Это не сравнительный тест моделей, не замер общей экономии и не обещание заменить облачный Codex на любой локальной машине.

Исходная статья

Подробности, иллюстрации и контекст описанного этапа — в полном авторском материале.

От чтения — к своей практике

Спасибо, что дочитали. Если хотите применить прочитанное к своей задаче, приходите обсудить её со мной. Для регулярной практики, общения и вебинаров есть Перезагрузка.