pimenov.ai

Экономика агентной компании: стоимость решения вместо стоимости рабочего часа

Как считать модели, инфраструктуру, проверку, переделки и человеческое внимание, чтобы увидеть реальную стоимость принятого результата.

ИИИИ-агентыБизнесПрактика

Это часть серии «ИИ-компания», в которой я последовательно разбираю, как ИИ-агенты меняют ответственность, структуру, роли и экономику организации.

В предыдущем материале — «Один человек и рой агентов: где заканчивается микрокомпания» — мы пришли к простой формуле: производительность агентной компании полезнее измерять количеством принятых результатов на единицу человеческого внимания.

Теперь к этой формуле нужно добавить деньги.

ИИ-агент может работать несколько часов, запустить десятки инструментов и произвести сотни файлов. Всё это ещё не означает, что компания получила результат. Кто-то должен проверить сделанное, принять решение, вернуть ошибки на исправление и взять на себя последствия.

Поэтому цена токенов сама по себе ничего не говорит об экономике агентной компании. Считать нужно весь путь до результата, который действительно принят и может быть использован.

Рабочий час перестаёт объяснять себестоимость

В традиционной модели работа часто оценивалась через время человека. Известны зарплата или ставка специалиста, количество затраченных часов и стоимость необходимых инструментов.

ИИ-агент нарушает эту привычную связь.

Пока агент работает над задачей, человек может заниматься чем-то другим. Несколько агентов способны действовать одновременно. Один процесс может обращаться к разным моделям, поисковым системам, базам данных и программам. Часть запусков завершается успешно, часть требует исправления, а часть приходится останавливать.

Рабочий час сохраняет значение при расчёте человеческого труда, но перестаёт быть достаточной единицей для всей системы.

Компания сравнивает три варианта:

  1. Специалист выполняет задачу за четыре часа.
  2. Один агент работает сорок минут, после чего специалист проверяет результат ещё час.
  3. Пять агентов работают параллельно двадцать минут, а затем руководитель два часа разбирает противоречия между их результатами.

Третий вариант выглядит самым быстрым только до тех пор, пока мы считаем продолжительность работы агентов. Если учитывать человеческую проверку, исправления и вероятность ошибки, экономическая картина может оказаться противоположной.

Токен — сырьё, а не единица результата

Стоимость моделей удобно сравнивать по цене входных и выходных токенов. Для управления бюджетом инфраструктуры это полезно. Для оценки работы компании этого недостаточно.

Исследователи Stanford Digital Economy Lab изучили траектории восьми моделей на задачах SWE-bench Verified. В этом конкретном программном бенчмарке агентные задачи требовали примерно в тысячу раз больше токенов, чем запросы на рассуждение о коде и кодовый чат. Расход разных запусков одной задачи различался до тридцати раз. При этом увеличение расхода не гарантировало повышения точности: качество часто достигало максимума раньше, чем система прекращала тратить дополнительные токены. How Do AI Agents Spend Your Money?

Это исследование относится к агентному программированию и не описывает все бизнес-процессы. Однако оно хорошо показывает ограниченность самой метрики: количество использованных токенов отражает потребление вычислительного ресурса, но не ценность полученного результата.

Дешёвая модель способна несколько раз ошибиться, вызвать дополнительные инструменты и отправить работу человеку на переделку. Более дорогая модель может решить ту же задачу за один проход. В таком случае дорогой запуск окажется более экономичным.

Возможна и обратная ситуация: сильная модель используется там, где с задачей стабильно справляется простая. Тогда компания оплачивает качество, которое не влияет на принятие результата.

От Cost-of-Pass к стоимости принятого результата

В работе Cost-of-Pass: An Economic Framework for Evaluating Language Models, представленной на ICLR 2026, предлагается считать ожидаемую денежную стоимость получения одного правильного решения.

Упрощённо эту логику можно записать так:

стоимость одной попытки / вероятность правильного ответа

Такой подход позволяет сравнивать модели по конечному успеху. Модель с низкой ценой запроса может проиграть более дорогой модели, если для правильного ответа ей требуется больше попыток.

Для реальной компании этого всё ещё мало. Правильный ответ в тесте и результат, пригодный для работы, не всегда совпадают. Между ними появляются проверка, ответственность, интеграция с другими системами и последствия возможной ошибки.

Поэтому в рамках проекта «ИИ-компания» я предлагаю собственную управленческую единицу: стоимость принятого результата.

Стоимость принятого результата — полная стоимость получения результата, который соответствует задаче, прошёл необходимые проверки, имеет владельца и может быть использован без скрытой обязательной переделки.

Для уже завершённого периода её можно считать так:

все расходы производственного контура / количество принятых результатов

Для планирования будущего процесса подходит вероятностная форма:

ожидаемая стоимость одного цикла / вероятность принятия результата

Главное — не учитывать переделку дважды. Если расходы на повторные циклы уже вошли в фактический числитель, дополнительно делить их на вероятность успеха не нужно.

Из чего складывается реальная стоимость

В агентном процессе появляется несколько групп расходов.

Модели и вычисления

Сюда входят токены, кэширование контекста, локальные вычисления и вызовы специализированных моделей.

Стоимость одного запроса относится к этому слою. Она ничего не говорит о том, сколько запросов потребуется до принятого результата.

Инструменты и инфраструктура

Агент использует поиск, базы данных, облачные сервисы, файловые хранилища, браузеры, среды выполнения и системы наблюдения. Часть расходов возникает за каждый вызов, другая часть оплачивается подпиской или содержанием собственной инфраструктуры.

Прямые и распределённые расходы лучше хранить отдельно. Стоимость вызова API подтверждается счётом провайдера. Доля месячной подписки всегда зависит от выбранного способа распределения.

Человеческое внимание

Человек ставит задачу, уточняет критерии, рассматривает варианты, принимает результат и решает, что делать при отклонении.

Количество минут здесь обычно важнее продолжительности автономной работы агента. Два часа фонового исполнения могут потребовать пяти минут проверки. Пятиминутный запуск способен породить час разбора ошибок.

Координация

Несколько исполнителей должны получать непротиворечивый контекст, понимать границы своей роли и передавать результаты друг другу.

Координационные расходы проявляются в повторной постановке задач, синхронизации состояния, разрешении конфликтов и восстановлении потерянного контекста.

Проверка

Генерация результата и доказательство его пригодности — разные операции.

Проверкой могут быть тесты, сверка с источниками, редактура, согласование человеком, контроль прав доступа или чтение результата непосредственно в рабочей системе.

Переделка

Непринятый результат создаёт новый производственный цикл. Агент получает комментарии, возвращается к источникам и повторяет часть работы.

Если эти циклы не учитывать, система выглядит эффективной даже тогда, когда постоянно производит почти готовую работу.

Задержка

Дешёвый результат может прийти слишком поздно. Очередь на проверку, ожидание доступа или последовательная работа нескольких агентов увеличивают календарное время до принятия решения.

Для срочной задачи задержка становится самостоятельным экономическим фактором.

Ошибка и восстановление

Некоторые ошибки исправляются дополнительным запросом. Другие приводят к потере данных, ошибочному платежу, публикации недостоверной информации или репутационному ущербу.

Полная экономическая модель должна учитывать вероятность такого события и тяжесть его последствий.

Один результат, три маршрута

Человека, одного агента и агентную команду можно сравнить только при одинаковом контракте результата.

Например, компании нужен аналитический материал, который:

  • отвечает на определённый вопрос;
  • опирается на проверяемые источники;
  • не содержит существенных фактических ошибок;
  • соответствует редакционному стандарту;
  • принят владельцем материала.

После этого можно сравнивать три маршрута:

ПоказательЧеловекОдин агентРой агентов
Календарное времяфиксируетсяфиксируетсяфиксируется
Активное время владельцафиксируетсяфиксируетсяфиксируется
Прямые расходыфиксируютсяфиксируютсяфиксируются
Количество возвратовфиксируетсяфиксируетсяфиксируется
Результат принятда или нетда или нетда или нет
Последствия ошибокучитываютсяучитываютсяучитываются

Условие принятия остаётся одним и тем же. Иначе компания начинает сравнивать качественно разные результаты и называть разницу экономией.

Три маршрута исполнения сходятся к одним воротам приёмки
Три маршрута исполнения сходятся к одним воротам приёмки

Когда рой действительно окупается

Многоагентная система расходует больше вычислительных ресурсов и требует дополнительной координации. Эти расходы могут быть оправданны, если задачу действительно можно разделить.

Google Research исследовал 180 конфигураций агентных систем. В параллельной финансовой задаче централизованная многоагентная архитектура улучшила результат относительно одиночного агента на 80,9%. В последовательной задаче многоагентные варианты, наоборот, ухудшили результат на 39–70%. Towards a science of scaling agent systems

Anthropic сообщает, что в их исследовательской системе обычные агенты использовали примерно в четыре раза больше токенов, чем чат, а многоагентная система — примерно в пятнадцать раз больше. Компания прямо связывает экономическую оправданность такой архитектуры с высокой ценностью задачи и возможностью выполнять её части параллельно. How we built our multi-agent research system

Рой имеет экономический смысл, когда:

  • части работы достаточно независимы;
  • параллельность сокращает значимую задержку;
  • дополнительное качество или охват имеют измеримую ценность;
  • результаты можно проверить по ясным критериям;
  • стоимость координации ниже полученного выигрыша.

Если работа состоит из длинной цепочки зависимых решений, дополнительные агенты могут ускорить размножение несовместимых предположений.

Больше агентов не исправляет плохую декомпозицию. Оно её ускоряет.

Маршрутизация моделей становится экономическим решением

Все задачи необязательно отправлять одной модели.

Авторы RouteLLM показали, что запросы можно динамически направлять более сильной или более дешёвой модели. В отдельных тестах такой маршрутизатор сокращал расходы более чем вдвое без снижения измеряемого качества.

Это результат ограниченных бенчмарков, поэтому он не обещает такую же экономию в любом производственном процессе. Сам принцип полезен: модель следует выбирать под контракт конкретной задачи.

Простая классификация, извлечение полей и черновая обработка могут выполняться дешёвым контуром. Сложное решение, финальная проверка или работа с высоким риском получают более сильную модель и дополнительные контрольные точки.

Так экономика постепенно переходит от выбора «лучшей модели» к управлению портфелем исполнителей.

Человеческое внимание остаётся дефицитным ресурсом

Производительность агента может расти быстрее, чем способность человека принимать его результаты.

Если десять агентов одновременно подготовят десять сложных документов, владельцу всё равно придётся понять, какие из них достаточно хороши, где находятся риски и что можно отправлять дальше.

В этой точке дешёвая генерация создаёт дорогую очередь незавершённой работы.

Исследования производительности тоже сталкиваются с этой проблемой. В 2026 году METR пришлось изменить дизайн эксперимента с разработчиками: участники избегали задач, которые не хотели выполнять без ИИ, работали с несколькими агентами параллельно и меняли сам набор выбираемых задач. Из-за этого обычное сравнение времени перестало надёжно показывать создаваемую ценность. We Are Changing Our Developer Productivity Experiment Design

Отдельный опрос METR среди 349 технических специалистов дал медианную самооценку прироста ценности работы в диапазоне от 1,4 до 2 раз. Авторы предупреждают о самоотборе участников и ограниченной надёжности подобных оценок. Measuring the Self-Reported Impact of Early-2026 AI

Поэтому агентные часы нельзя автоматически превращать в сэкономленные человеческие часы.

Для управления компанией полезнее другой показатель:

Количество принятых результатов на единицу человеческого внимания.

А для экономики к нему добавляется стоимость каждого такого результата.

Первый эксперимент pimenov.ai

Эту статью мы используем как первый измеряемый производственный цикл pimenov.ai и как часть более широкого эксперимента. В процессе создания серии «ИИ-компания» мы проверяем исходные гипотезы на собственной работе. Здесь же рождаются термины, метрики и способы описания агентной организации, которых нам не хватает в готовом виде.

Производство материала разделено на исследование, построение методики, создание и проверку текста. По журналу редакционной сессии до принятия основной версии можно восстановить следующий профиль:

  • одна принятая статья;
  • три производственных этапа;
  • шесть агентских циклов;
  • 77 обращений к модели;
  • 12 117 487 входных токенов, из них 11 379 456 кэшированных и 738 031 некэшированных;
  • 40 586 выходных токенов, включая промежуточные рассуждения и редакционные версии;
  • 87 инструментальных операций: 11 операций веб-исследования, 42 операции в Plane, четыре чтения из Notion и 30 локальных проверок и операций с рабочими материалами;
  • 20 минут подтверждённого человеческого внимания: семь минут на оценку структуры и 13 минут на полное чтение текста.

Структура и основной текст были приняты с первого просмотра. Измерительный блок получил один редакционный возврат: календарное время было показано без модельного и инструментального объёма и поэтому ничего не объясняло о составе затрат.

Этот набор данных пока не даёт денежной себестоимости статьи и не служит эталоном эффективности. Первый цикл включал создание самой методики измерения и работу внутри большой редакционной истории. Почти 94% входного объёма пришлось на повторно используемый кэшированный контекст. Это не означает пропорциональных денежных расходов, но показывает отдельный фактор стоимости: архитектуру памяти и размер контекста.

Так в ходе эксперимента появился ещё один наш термин — ресурсный профиль принятого результата.

Ресурсный профиль принятого результата — состав фактически использованных ресурсов: человеческое внимание, модельные вызовы, токены, инструменты, проверки, возвраты, координация и инфраструктура.

Ресурсный профиль отвечает на вопрос «что и сколько было израсходовано». Стоимость принятого результата появляется на следующем шаге, когда каждому ресурсу назначена цена и добавлена оценка риска.

Несколько потоков ресурсов сходятся в один принятый результат
Несколько потоков ресурсов сходятся в один принятый результат

Минимальная карточка измерения

Для первого измерения достаточно фиксировать:

  1. Что считается принятым результатом.
  2. Когда начался и закончился производственный цикл.
  3. Сколько активных минут потратил владелец.
  4. Сколько агентских циклов и обращений к модели потребовалось.
  5. Сколько входных и выходных токенов обработано, какая часть пришлась на кэш.
  6. Какие инструменты вызывались и сколько раз.
  7. Сколько результатов было принято с первого раза.
  8. Сколько потребовалось возвратов и почему.
  9. Какие прямые и распределённые расходы возникли.
  10. Какие ошибки были найдены и сколько стоило их исправление.

Через несколько повторений появятся данные для содержательных решений:

  • какой класс задач можно передать более дешёвой модели;
  • где требуется сильный агент;
  • где рой окупает координацию;
  • на каком этапе возникает очередь проверки;
  • какая автоматизация действительно освобождает человеческое внимание;
  • как размер контекста влияет на ресурсный профиль результата.

Что можно заключить после одного цикла

Один эксперимент показывает устройство конкретного процесса. Он не доказывает общую экономику ИИ-агентов.

Большая часть доступных исследований относится к программированию, поиску и тестовым средам. Их нельзя автоматически переносить на продажи, финансы, управление или клиентскую работу. Цены моделей быстро меняются. Стоимость риска и человеческого внимания зависит от самой компании.

Поэтому практический путь начинается с ограниченного контура, одинакового контракта результата и нескольких повторяемых измерений.

Только после этого можно решать, действительно ли агентная архитектура дешевле существующего процесса, какую модель использовать и сколько автономии ей давать.

Экономика начинается после приёмки

Экономический продукт агентной компании — результаты, за которые кто-то готов отвечать.

Пока компания считает только цену модели, значительная часть расходов остаётся невидимой. Проверка выглядит бесплатной, внимание руководителя не учитывается, а переделка растворяется между новыми запусками.

Стоимость принятого результата возвращает экономике связь с реальной работой. Ресурсный профиль показывает, из чего эта стоимость должна складываться.

Вместе эти две единицы позволяют увидеть, где агент создаёт ценность, где система перекладывает работу на человека, а где рой становится дороже задачи, ради которой его собрали.

Следующий шаг

10 контуров ИИ-компании: как отличить новую операционную модель от набора ИИ-инструментов

Связанные материалы

  • Один человек и рой агентов: где заканчивается микрокомпания
  • Не стройте сверхмашину — соберите то, что поедет сегодня
  • LiteLLM — модели по подписке вместо API-ключей для ваших агентов

Если вы хотите разобрать реальную экономику агентного процесса, начинать стоит с одного результата, его владельца и полной цепочки расходов.

Если захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov