TestingCatalog: в Codex готовят повторный запуск задач из диалогов Claude
Не удалось запустить аудио. Нажмите кнопку воспроизведения в плеере.
TestingCatalog сообщил о подготовке Codex Replay — функции для повторного выполнения задач из импортированных диалогов и сравнения результатов разных моделей. В приведённом описании речь идёт о выборе старых диалогов Claude и запуске отдельных реализаций через Codex.
Предполагаемый сценарий выглядит так: пользователь выбирает одну или несколько прошлых задач, назначает модели и запускает их в изолированных окружениях. Для каждого диалога отдельно определяются прежнее состояние и конфигурация. Результаты можно смотреть по мере готовности, пока остальные задачи ещё выполняются.
Выбор задач, запуск, проверка и сравнение собраны в браузерной панели управления. Описана возможность нескольких параллельных сессий. По данным TestingCatalog, доступные модели GPT-5.6 Sol, Terra и Luna выбираются по умолчанию.
Практический смысл такого инструмента — проверять модели на собственных задачах. Например, повторно запустить задачу, с которой раньше возникли проблемы, и сравнить получившиеся реализации. Но точность такого сравнения будет зависеть от того, насколько полно воспроизводятся исходные условия: одного текста переписки для этого недостаточно.
Официального подтверждения именно этой функции на момент подготовки материала найти не удалось. Сроки выхода и условия доступа в сообщении не указаны.
У Codex уже есть другая функция с похожим названием — Record & Replay: она превращает показанный пользователем рабочий процесс в повторно используемый навык. Сообщение TestingCatalog касается повторного выполнения задач из истории диалогов и сравнения моделей.
Следующий шаг
Codex App — единый справочник по среде от OpenAI
По теме
Если вы выбираете ИИ-модели для рабочих задач, можно обсудить, как организовать сравнение на своих примерах и задать критерии результата.
Если захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov