pimenov.ai

База знаний

ИИ-агенты в России в 2026 году: сервисы, API и реальные ограничения

Карта агентного стека для России в 2026 году: сервисы, API, оплата, приватность, локальный запуск, риски поставщика и безопасный пилот.

Опубликовано

ИИ-агент — это система, которая получает цель, выбирает следующий шаг, вызывает инструменты и проверяет результат. Модель отвечает только за часть этого цикла. Рабочий агентный стек также включает оркестратор, доступ к данным, управление правами, наблюдаемость и механизм остановки.

Для российского пользователя выбор осложняют доступность сервисов, способы оплаты, требования к персональным данным и зависимость от поставщиков. Поэтому начинать стоит с архитектуры и проверяемого пилота, а не с рейтинга моделей.

📌
Материал проверен по официальной документации на 1 сентября 2026 года. Тарифы, лимиты и условия обработки данных меняются; перед закупкой сверяйте текущую документацию и договор. Раздел о персональных данных — инженерный чек-лист, а не юридическая консультация.

Карта стека: пять независимых слоёв

СлойЗа что отвечаетЧто проверить
Интерфейс и бизнес-процессГде начинается задача и где человек принимает результатроли, журнал действий, ручное подтверждение
Оркестратор агентаПлан, состояние, повторы, остановка и маршрутизациятайм-ауты, лимиты шагов, идемпотентность, откат
МодельАнализ текста, выбор действия, генерация ответакачество на своём наборе задач, цена, контекст, стабильность API
Инструменты и данныеПоиск, CRM, документы, базы, голос, внешние APIминимальные права, происхождение данных, защита от вредных инструкций
Эксплуатационный контурСекреты, логи, бюджет, мониторинг и инцидентыхранение журналов, оповещения, резервный маршрут, выключатель
Пять слоёв агентного стека: человек, оркестратор, модель, инструменты и эксплуатационный контур.
Пять слоёв агентного стека: человек, оркестратор, модель, инструменты и эксплуатационный контур.

Такое разделение позволяет заменить модель или провайдера, не переписывая весь процесс. Если один продукт объединяет несколько слоёв, всё равно зафиксируйте их границы в собственной схеме.

Какие классы решений доступны

Ниже — карта классов, а не исчерпывающий рейтинг поставщиков. Доступность конкретной функции надо подтверждать в выбранном тарифе и договоре.

КлассКогда подходитЧто даётГлавный риск
Готовый агентный SaaSбыстрый эксперимент на несекретных данныхинтерфейс и сценарии без собственной инфраструктурынепрозрачный маршрут данных и слабый контроль экспорта
Управляемая агентная платформакорпоративный пилот с API, журналами и облачной инфраструктуройоркестрация, модели, поиск, инструменты и эксплуатационные сервисыпривязка к облачным компонентам и составной счёт
Прямой API модели или API-роутерсобственный оркестратор уже естьединый программный доступ к одной или нескольким моделямроутер не решает права, состояние, аудит и безопасность инструментов
Локальный inference-контурчувствительные данные, предсказуемая среда или особые требования к задержкеконтроль размещения модели и журналовоборудование, обновления, безопасность и качество становятся вашей обязанностью

Ориентир для быстрого выбора класса:

  • данные конфиденциальные или персональные, а внешний маршрут не согласован — локальный inference-контур или выделенный контур у провайдера с подходящим договором;
  • нужен быстрый эксперимент на открытых данных — готовый агентный SaaS;
  • нужен корпоративный пилот с журналами и контролем доступа, но без своей инфраструктуры — управляемая платформа;
  • собственный оркестратор уже есть — прямой API модели или API-роутер.

Из российских управляемых контуров официальная документация описывает, например, Yandex AI Studio и Cloud.ru AI Agents. Yandex AI Studio объединяет модели, Agent Atelier, AI Search и MCP Hub; MCP — это протокол подключения внешних инструментов и контекста. Cloud.ru AI Agents даёт сборку и эксплуатацию агентов, RAG, секреты, журналирование, мониторинг и аудит. Это примеры платформенного класса, а не рекомендация покупать их без пилота.

Для прямого доступа к модели можно рассматривать документированные российские API. У GigaChat есть OAuth-аутентификация, отдельные области доступа для физических лиц и бизнеса и вызов функций. Yandex AI Studio предоставляет API к моделям и связанным сервисам. Если нужен выбор среди посредников, используйте отдельное сравнение российских API-роутеров: агентная архитектура шире этой задачи.

Локальный вариант обычно строят вокруг движка запуска модели. Ollama предоставляет локальный API и частичную совместимость с OpenAI API; vLLM — OpenAI-совместимый сервер для ряда конечных точек. Совместимый интерфейс не гарантирует одинаковую поддержку вызова функций (function calling), структурированных ответов (structured output), потоковой выдачи (streaming) и обработки ошибок. Проверяйте каждую нужную возможность интеграционным тестом.

Как проверять API до интеграции

1. Доступ и жизненный цикл ключей

  • Есть ли отдельные service accounts, роли и области доступа?
  • Как отозвать ключ, ограничить его права и сменить без простоя?
  • Можно ли разделить development, test и production?
  • Куда отправляются запросы после входной точки провайдера?

У GigaChat токен доступа получается через OAuth и действует ограниченное время; каждый запрос к API требует обязательного заголовка RqUID с уникальным идентификатором в формате uuid4. С 17 июля 2026 года целевой адрес для новых подключений — https://api.giga.chat: прежний gigachat.devices.sberbank.ru остаётся доступным только для уже подключённых клиентов и в дальнейшем будет выведен из эксплуатации, поэтому новые интеграции начинайте с актуального адреса. У других сервисов могут использоваться API-ключи или IAM-токены. В приложении храните секрет в менеджере секретов, а не в коде, промпте или журнале.

2. Реальная совместимость

Проверьте не только формат `/chat/completions`, но и поведение:

  • вызов функций и нескольких инструментов;
  • структурированный JSON и валидацию схемы;
  • потоковую выдачу;
  • лимиты контекста и размера ответа;
  • коды ошибок, `Retry-After`, тайм-ауты и повторные запросы;
  • версионирование моделей и срок уведомления о снятии версии.

Сделайте небольшой адаптер модели внутри своей системы. Тогда замена endpoint или формата ответа останется локальным изменением.

OpenAI-совместимый интерфейс сегодня есть у всех рассмотренных классов решений. Yandex AI Studio предоставляет официальные OpenAI-compatible API для моделей, агентов, файлов и поиска; Ollama и vLLM реализуют совместимость локально. Это упрощает резервный маршрут: основной и запасной провайдеры могут работать через один клиентский интерфейс. Оговорка про совместимость остаётся в силе: единый формат не гарантирует одинаковую поддержку вызова функций, структурированных ответов и потоковой выдачи, поэтому каждый маршрут проверяйте интеграционным тестом.

3. Наблюдаемость и контроль расходов

Для каждого запуска храните безопасный технический след: идентификатор сценария, выбранную модель, число шагов, задержку, расход, ошибки инструментов и решение человека. Не записывайте в обычный лог исходные персональные данные и секреты.

Поставьте три независимых ограничения: число агентных шагов, стоимость одного запуска и суточный бюджет. Агент должен завершать работу с понятным статусом, когда достигнут любой лимит.

Оплата: считать нужно весь маршрут

Цена токенов модели — только одна строка. В управляемом агенте счёт может включать:

  • входные и выходные токены;
  • вычислительные ресурсы оркестратора;
  • поиск, RAG и хранение индекса;
  • объектное хранилище, журналирование и исходящий трафик;
  • распознавание и синтез речи;
  • внешние платные API, которые вызывает агент.

Официальная документация Cloud.ru отдельно учитывает ресурсы агента и зависимые сервисы. В SpeechKit синтез речи тарифицируется блоками по 250 символов, а распознавание — 15-секундными единицами с посекундным учётом начиная с 16-й секунды; цены публикуются в рублях, тенге и долларах, условия по НДС различаются. У GigaChat опубликованы тарифы для физических лиц и бизнеса, но фактический бюджет всё равно определяется профилем запросов.

Для пилота собирайте стоимость на один завершённый бизнес-кейс. Месячный прогноз считайте по формуле:

стоимость кейса = модель + оркестратор + данные/поиск + инструменты + эксплуатация
месячный бюджет = стоимость кейса × объём + резерв на повторы и пики

Пример с условными цифрами, который показывает порядок расчёта (это иллюстрация, а не тариф конкретного провайдера). Пусть миллион входных токенов стоит 100 ₽, миллион выходных — 300 ₽. Агент поддержки тратит на один кейс 6 шагов: 30 000 входных и 3 000 выходных токенов, один поисковый запрос по базе знаний и одно ручное подтверждение. Модель на кейс: 30 000 × 100 ₽ / 1 млн + 3 000 × 300 ₽ / 1 млн ≈ 3,9 ₽. Добавьте поиск, оркестратор и журналы: пусть ещё столько же, итого около 8 ₽ за кейс. При 1 000 кейсов в месяц и 15% повторных запусков месячный бюджет составит около 9 200 ₽ плюс резерв на пики. Подставьте в эту схему свои тарифы и нагрузочный профиль.

Не переносите цену из демонстрации на production без нагрузочного профиля: длинный контекст, повторные шаги и голос способны изменить экономику на порядок.

Доступность и vendor risk

Vendor risk — риск зависимости от поставщика. Его надо оценивать до того, как агент получит критичный бизнес-процесс.

РискЧто запросить или проверитьКак снизить
Изменение API или моделиполитика версий, changelog, срок уведомлениясобственный адаптер и контрактные тесты
Недоступность сервисаSLA, история инцидентов, регион размещенияочередь задач, тайм-аут, резервный маршрут
Рост цены или новый состав счётаединицы тарификации и детализация usageлимиты, алерты, тестовый бюджет, регулярный пересчёт
Закрытый формат данныхэкспорт промптов, индексов, журналов и конфигурациихранить каноническую конфигурацию у себя
Зависимость от чужой моделисписок фактических upstream-провайдеров и правила заменытестовый набор и минимум два проверенных маршрута
Потеря контроля над даннымидоговор, список субподрядчиков, сроки хранения и удаленияклассификация данных, минимизация, локальный контур для чувствительных наборов

Маркетинговая фраза «данные не используются для обучения» не отвечает на вопросы о логах, резервных копиях, сотрудниках с доступом, субподрядчиках и сроке удаления. Нужны договор и техническая схема маршрута.

Приватность и персональные данные

Перед подключением агента разделите данные минимум на четыре уровня: публичные, внутренние, конфиденциальные и персональные. Для каждого уровня задайте допустимых провайдеров, инструменты, срок хранения и владельца решения.

Для процессов с персональными данными проверьте с юристом требования Федерального закона № 152-ФЗ и актуальных подзаконных актов. В инженерном плане особенно важны:

  • локализация при первоначальном сборе персональных данных граждан России;
  • отдельная оценка трансграничной передачи и требуемых уведомлений;
  • правовое основание, цель и минимальный состав данных;
  • договорные роли оператора и обработчика;
  • порядок удаления, выгрузки и ответа на инцидент.

Масштаб ответственности конкретный. С 30 мая 2025 года за утечку персональных данных действует прогрессивная шкала штрафов: до 15–20 млн ₽ в зависимости от числа пострадавших и категории данных. За повторную утечку назначают оборотный штраф от 1% до 3% годовой выручки (минимум 20 млн, максимум 500 млн ₽), а неуведомление Роскомнадзора об инциденте штрафуется отдельно. Поэтому классификация данных и выключатель внешнего маршрута защищают от самого дорогого сценария.

Не отправляйте чувствительные данные посреднику, который не раскрывает юридическое лицо, маршрут обработки, условия хранения и фактических поставщиков моделей. Не используйте серые способы оплаты или обход ограничений: они добавляют риск блокировки, потери доступа и отсутствия договорной защиты.

Локальная модель сокращает число внешних передач, но сама по себе не делает систему безопасной. Остаются контроль доступа, уязвимости зависимостей, защита API, журналы, резервные копии и права инструментов.

⚠️
Внимание: локальный API Ollama по умолчанию принимает подключения только с localhost и не требует аутентификации. Публиковать его в сеть без отдельного защищённого шлюза (gateway) нельзя.

Базовая безопасная архитектура

Рабочая схема для большинства компаний выглядит так:

  1. Бизнес-сервис хранит состояние процесса и определяет допустимые переходы.
  2. Оркестратор передаёт модели только нужный контекст и ограниченный набор действий.
  3. Адаптер модели скрывает различия API и позволяет переключить проверенный маршрут.
  4. Инструменты работают с минимальными правами; чтение отделено от записи.
  5. Любая значимая запись, платёж, отправка сообщения или публикация проходит человеческое подтверждение.
  6. Секреты находятся в менеджере секретов, а пользовательский текст считается недоверенным вводом.
  7. Журнал фиксирует решение и технический результат без лишних чувствительных данных.
  8. Лимиты шагов, времени и денег останавливают зацикливание.
  9. Есть выключатель, резервная модель и детерминированный ручной процесс.

Начинайте с инструментов только для чтения (read-only). Право записи выдавайте отдельно для одного действия и только после того, как журнал и восстановление доказали работоспособность.

Пример переносимого описания маршрута:

scenario: support_draft
data_class: internal
model_route: primary-managed
fallback_route: approved-secondary
tools:
  - name: knowledge_search
    mode: read-only
limits:
  max_steps: 8
  max_runtime_seconds: 90
  max_cost_per_run: "<company-limit>"
write_gate: human_approval
logging: metadata_only

Три практических сценария

Исследование по открытым источникам

Для малого бизнеса достаточно управляемой платформы или собственного простого оркестратора с поиском, моделью и хранилищем результатов, доступным только на чтение. Главные проверки — происхождение источников, ссылки в ответе, лимит стоимости и запрет на автоматическую публикацию.

Работа с внутренней базой знаний

Для компании с закрытыми документами нужен договорно подтверждённый маршрут: российское облако с подходящими условиями, выделенный контур или локальный inference. RAG-индекс следует отделить от исходных документов, настроить права на уровне пользователя и проверить, что агент не возвращает фрагменты из чужого раздела.

Голосовой агент

Здесь добавляются распознавание и синтез речи, телефония, запись разговоров и требования к согласию. Считайте задержку всей цепочки, а не одной модели. Бюджет речи, модели и звонка ведите отдельно; запись и расшифровка должны следовать утверждённой политике хранения.

Пилот за десять шагов

  1. Выберите один процесс с понятным владельцем и обратимым результатом.
  2. Соберите 20–50 реальных обезличенных примеров, включая ошибки и редкие случаи.
  3. Зафиксируйте критерии успеха: точность, время, долю ручных исправлений и максимальную стоимость.
  4. Нарисуйте маршрут данных и классифицируйте каждое поле.
  5. Получите от поставщика документацию, договорные условия и состав тарификации.
  6. Реализуйте адаптер модели и только инструменты чтения.
  7. Добавьте лимиты, журнал, выключатель и ручное подтверждение результата.
  8. Прогоните одинаковый набор через основной и резервный маршруты.
  9. Проведите ограниченный проверочный запуск (canary) на реальных задачах под наблюдением владельца процесса.
  10. Решение о production принимайте по измерениям и плану выхода, а не по качеству демонстрации.

Минимальная таблица приёмки:

ПроверкаНаблюдаемый результат
Качестводостигнут заранее заданный порог на закрытом наборе
Безопасностьзапрещённые данные не уходят во внешний маршрут; запись требует подтверждения
Надёжностьтайм-аут, отказ модели и ошибка инструмента завершаются контролируемо
Экономикавидна стоимость каждого кейса и срабатывает бюджетный лимит
Переносимостьрезервный маршрут проходит тот же контрактный набор
Операциивладелец умеет остановить процесс и восстановить ручной режим

Что не стоит делать

  • Не давать агенту широкие права «на время теста».
  • Не смешивать production-секреты с пользовательским вводом и промптами.
  • Не выбирать поставщика только по списку моделей или цене миллиона токенов.
  • Не считать OpenAI-совместимый endpoint полной взаимозаменяемостью.
  • Не доверять посреднику без понятного юридического лица и маршрута данных.
  • Не строить критичный процесс без выключателя, журнала и ручного резерва.
  • Не обходить ограничения сервиса, оплаты или доступа сомнительными схемами.

Источники


Следующий шаг

Если модельный слой должен работать через российского посредника, продолжите с руководством «Российские API-роутеры иностранных ИИ-моделей: сравнение шести сервисов».

Связанные материалы

Если вы проектируете агентный стек для компании, полезно заранее сверить маршрут данных, права инструментов и план выхода из зависимости от поставщика.

💬
Если захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov