GPT-5.6 Sol разогнали до 750 токенов в секунду
OpenAI и Cerebras показали Ultrafast для GPT‑5.6 Sol: до 750 токенов в секунду, в 14 раз быстрее Standard, пока в ограниченном API-превью.
OpenAI и Cerebras показали Ultrafast — новый режим для GPT‑5.6 Sol, который выдаёт до 750 токенов в секунду. По данным OpenAI, это до 14 раз быстрее стандартной обработки той же модели. Пока режим доступен ограниченной группе клиентов через API.
Такая скорость меняет сам ритм работы с ИИ. Если агент успевает закончить задачу раньше, чем человек переключится в другое окно, сложная модель начинает ощущаться как интерактивный инструмент. Это особенно полезно при разборе сбоев, голосовой поддержке, финансовом анализе и исследованиях, где каждый следующий шаг зависит от предыдущего ответа.
Cerebras отдельно прогнала GPT‑5.6 Sol Ultrafast по всем 2 500 вопросам Humanity’s Last Exam. По внутреннему тесту компании модель справилась за 11 часов 11 минут. Claude Fable 5 потребовалось 78 часов 27 минут при сопоставимой точности. Условия запусков и даты различались, поэтому этот результат показывает потенциал режима, но не заменяет независимое сравнение.
Практическая ценность Ultrafast — в сжатии цикла обратной связи. Исследование, которое раньше оставляли на ночь, можно несколько раз уточнить за рабочий день. Агент для реагирования на инциденты способен анализировать меняющиеся логи и проверять гипотезы, пока проблема ещё развивается.
Сейчас главные вопросы связаны с ценой, лимитами, стабильностью под реальной нагрузкой и сроками расширения доступа. Если экономика окажется разумной, мощные ИИ‑агенты приблизятся к синхронным рабочим инструментам, а ожидание между запросом и действием перестанет диктовать устройство процесса.
Следующий шаг
OpenAI открыла превью GPT-5.6: три модели Sol, Terra и Luna
Связанные материалы
- Статья: Как стать продвинутым пользователем Codex: полная настройка
- Блог: Лимиты Codex обнулили: почему GPT-5.6 Sol сжигал их быстрее ожидаемого
- База знаний: Контекст-инжиниринг — как собирать рабочий контекст для моделей нового поколения
Скорость модели особенно важна там, где агент включён в живой рабочий процесс и должен отвечать без пауз. Такое применение стоит обсуждать вместе с архитектурой, лимитами и ответственностью команды.
Если захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov
Если хотите разобрать свою задачу — напишите мне Если хотите разобрать свою задачу — напишите мне.
Можно прийти с идеей, черновым контекстом или уже живой задачей. Помогу быстро понять, где реальный следующий шаг, а где лишний шум.
Обычно хватает 2–3 сообщений, чтобы понять, могу ли я здесь реально помочь и в каком формате лучше двигаться дальше.
Дальше по теме
Anthropic объявила маркировку текстов Claude, а следом появился репозиторий, обещающий удалять такие метки. Но его возможности пока ограничены.