Skill Doctor проверяет скиллы по реальным сессиям
Warp выпустила открытый Skill Doctor: он анализирует реальные сессии Claude Code, Codex и Warp, оценивает работу и предлагает правки к SKILL.md.
Скилл, то есть рабочая инструкция для ИИ-агента, может выглядеть безупречно и всё равно плохо работать. Проблема проявляется в реальных задачах: агент пропускает шаги, повторяет поиск или редко использует инструкцию.
Команда Warp выпустила Skill Doctor — открытый скилл, который превращает историю работы агента в обратную связь для инструкций. Он:
- собирает недавние локальные сессии Claude Code, Codex и Warp;
- оценивает ход работы и качество кода по заданным рубрикам;
- считает долю сессий, в которых скиллы сработали;
- готовит конкретные изменения в SKILL.md и показывает различия в формате diff.
В официальном SKILL.md указано: транскрипты остаются на компьютере, а черновики новых версий складываются отдельно. Рабочие скиллы автоматически не перезаписываются.
Инструкцию для агента стоит развивать по следам реальной работы. Skill Doctor ставит оценки по рубрикам, поэтому его правки всё равно надо читать и проверять на собственных задачах.
Практический цикл выглядит так: увидеть сбой, предложить правку и проверить её в следующих сессиях.
Следующий шаг
На pimenov.ai уже есть разбор ручного варианта такого ретроспективного аудита: Пусть Codex перепишет ваш скилл по вашим же сессиям.
Связанные материалы
- Статья: Мои Codex skills: как мы собираем дисциплину для ИИ-агента
- Блог: Скиллы больше не дают преимущества: выигрывают циклы и графы
- База знаний: Skills в OpenAI Codex — как расширить возможности coding-агента
Такой аудит особенно полезен командам, у которых инструкции для агентов уже стали частью ежедневного процесса и начали расходиться с реальной работой.
Если захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov
Если хотите разобрать свою задачу — напишите мне Если хотите разобрать свою задачу — напишите мне.
Можно прийти с идеей, черновым контекстом или уже живой задачей. Помогу быстро понять, где реальный следующий шаг, а где лишний шум.
Обычно хватает 2–3 сообщений, чтобы понять, могу ли я здесь реально помочь и в каком формате лучше двигаться дальше.
Дальше по теме
Консультации, аудит процессов, работа с контентом и сайтами, сессии для команд и решения под конкретную задачу.