Зафиксированный вход
196 784 токена
Один простой вопрос разросся до такого запроса в полной агентной среде.
Я хотел подключить локальную Qwen3.8 на Mac mini M4 Pro к привычной работе в Codex. Обычный чат с моделью отвечал, но полная агентная сессия зависала на обработке входа. Увеличение времени ожидания не решало проблему.
Рабочий результат появился после сужения задачи. Основной Codex собрал проверенные факты и редакционные требования, а локальная модель получила компактный пакет и вернула черновик статьи. Доступ к инструментам и публикация для этой задачи ей не понадобились.

196 784 токена
Один простой вопрос разросся до такого запроса в полной агентной среде.
Около 10 минут
Один воспроизводимый запуск отменился до завершения обработки большого префикса.
Черновик статьи
Qwen вернул Markdown по компактному пакету; финальная проверка осталась у основного Codex и автора.
Исходная ситуация
В исследованной среде было 586 инструментов, включая 553 MCP-инструмента. Их метаданные и остальной контекст стали существенной частью входа. Успех короткого чата не доказывал, что модель справится с такой нагрузкой.
Ход работы

Отдельный диалог работал, поэтому проверили, что именно меняется при входе через Codex. Журналы показали размер запроса и длительную обработку до первого ответа.
В одном запуске обработалось 55 296 токенов примерно за 9,5 минуты, затем запрос отменился. Увеличение тайм-аута до 600 секунд лишь продлило ожидание того же исхода.
Для рабочего редакционного маршрута использовали изолированный MLX-процесс. Локальной модели не передавали файловую систему, Notion, браузер и весь каталог инструментов.
Основной Codex подготовил компактный пакет: подтверждённые данные, редакционные правила и задачу. Qwen вернул Markdown-черновик, который затем прошёл проверку и доработку.
Проверка
Итогом стал черновик исходной статьи. Это конкретная выполненная работа локальной модели, а не вывод о её пригодности для любых задач Codex. Уменьшили объём входа и ответственность исполнителя — и проверили результат на настоящем материале.
Результат

Вместо огромной агентной сессии модель получила пакет, достаточный для написания одного текста.
Подготовка фактов, работа с инструментами, проверка и дальнейшие действия остались в основном процессе. Локальный исполнитель отвечал за черновик.
Границы вывода
По журналам подтверждены большой вход, медленная обработка префикса и отмена около десятиминутной границы. Они не доказывают, что причиной был именно KV cache: в статье это отделено от сходных публичных сообщений.
Числа описывают конкретную конфигурацию августа 2026 года. Это не сравнительный тест моделей, не замер общей экономии и не обещание заменить облачный Codex на любой локальной машине.
Подробности, иллюстрации и контекст описанного этапа — в полном авторском материале.
Я установил Qwen3.8 на Mac mini M4 Pro, подключил его к полному Codex, затем собрал тонкий MLX-контур — и модель написала черновик этой статьи.
Спасибо, что дочитали. Если хотите применить прочитанное к своей задаче, приходите обсудить её со мной. Для регулярной практики, общения и вебинаров есть Перезагрузка.
