База знаний
ИИ-агенты в России в 2026 году: сервисы, API и реальные ограничения
Карта агентного стека для России в 2026 году: сервисы, API, оплата, приватность, локальный запуск, риски поставщика и безопасный пилот.
СейчасКарта стека: пять независимых слоёв
- Карта стека: пять независимых слоёв
- Какие классы решений доступны
- Как проверять API до интеграции
- 1. Доступ и жизненный цикл ключей
- 2. Реальная совместимость
- 3. Наблюдаемость и контроль расходов
- Оплата: считать нужно весь маршрут
- Доступность и vendor risk
- Приватность и персональные данные
- Базовая безопасная архитектура
- Три практических сценария
- Исследование по открытым источникам
- Работа с внутренней базой знаний
- Голосовой агент
- Пилот за десять шагов
- Что не стоит делать
- Источники
- Следующий шаг
- Связанные материалы
ИИ-агент — это система, которая получает цель, выбирает следующий шаг, вызывает инструменты и проверяет результат. Модель отвечает только за часть этого цикла. Рабочий агентный стек также включает оркестратор, доступ к данным, управление правами, наблюдаемость и механизм остановки.
Для российского пользователя выбор осложняют доступность сервисов, способы оплаты, требования к персональным данным и зависимость от поставщиков. Поэтому начинать стоит с архитектуры и проверяемого пилота, а не с рейтинга моделей.
Карта стека: пять независимых слоёв
| Слой | За что отвечает | Что проверить |
| Интерфейс и бизнес-процесс | Где начинается задача и где человек принимает результат | роли, журнал действий, ручное подтверждение |
| Оркестратор агента | План, состояние, повторы, остановка и маршрутизация | тайм-ауты, лимиты шагов, идемпотентность, откат |
| Модель | Анализ текста, выбор действия, генерация ответа | качество на своём наборе задач, цена, контекст, стабильность API |
| Инструменты и данные | Поиск, CRM, документы, базы, голос, внешние API | минимальные права, происхождение данных, защита от вредных инструкций |
| Эксплуатационный контур | Секреты, логи, бюджет, мониторинг и инциденты | хранение журналов, оповещения, резервный маршрут, выключатель |
Такое разделение позволяет заменить модель или провайдера, не переписывая весь процесс. Если один продукт объединяет несколько слоёв, всё равно зафиксируйте их границы в собственной схеме.
Какие классы решений доступны
Ниже — карта классов, а не исчерпывающий рейтинг поставщиков. Доступность конкретной функции надо подтверждать в выбранном тарифе и договоре.
| Класс | Когда подходит | Что даёт | Главный риск |
| Готовый агентный SaaS | быстрый эксперимент на несекретных данных | интерфейс и сценарии без собственной инфраструктуры | непрозрачный маршрут данных и слабый контроль экспорта |
| Управляемая агентная платформа | корпоративный пилот с API, журналами и облачной инфраструктурой | оркестрация, модели, поиск, инструменты и эксплуатационные сервисы | привязка к облачным компонентам и составной счёт |
| Прямой API модели или API-роутер | собственный оркестратор уже есть | единый программный доступ к одной или нескольким моделям | роутер не решает права, состояние, аудит и безопасность инструментов |
| Локальный inference-контур | чувствительные данные, предсказуемая среда или особые требования к задержке | контроль размещения модели и журналов | оборудование, обновления, безопасность и качество становятся вашей обязанностью |
Ориентир для быстрого выбора класса:
- данные конфиденциальные или персональные, а внешний маршрут не согласован — локальный inference-контур или выделенный контур у провайдера с подходящим договором;
- нужен быстрый эксперимент на открытых данных — готовый агентный SaaS;
- нужен корпоративный пилот с журналами и контролем доступа, но без своей инфраструктуры — управляемая платформа;
- собственный оркестратор уже есть — прямой API модели или API-роутер.
Из российских управляемых контуров официальная документация описывает, например, Yandex AI Studio и Cloud.ru AI Agents. Yandex AI Studio объединяет модели, Agent Atelier, AI Search и MCP Hub; MCP — это протокол подключения внешних инструментов и контекста. Cloud.ru AI Agents даёт сборку и эксплуатацию агентов, RAG, секреты, журналирование, мониторинг и аудит. Это примеры платформенного класса, а не рекомендация покупать их без пилота.
Для прямого доступа к модели можно рассматривать документированные российские API. У GigaChat есть OAuth-аутентификация, отдельные области доступа для физических лиц и бизнеса и вызов функций. Yandex AI Studio предоставляет API к моделям и связанным сервисам. Если нужен выбор среди посредников, используйте отдельное сравнение российских API-роутеров: агентная архитектура шире этой задачи.
Локальный вариант обычно строят вокруг движка запуска модели. Ollama предоставляет локальный API и частичную совместимость с OpenAI API; vLLM — OpenAI-совместимый сервер для ряда конечных точек. Совместимый интерфейс не гарантирует одинаковую поддержку вызова функций (function calling), структурированных ответов (structured output), потоковой выдачи (streaming) и обработки ошибок. Проверяйте каждую нужную возможность интеграционным тестом.
Как проверять API до интеграции
1. Доступ и жизненный цикл ключей
- Есть ли отдельные service accounts, роли и области доступа?
- Как отозвать ключ, ограничить его права и сменить без простоя?
- Можно ли разделить development, test и production?
- Куда отправляются запросы после входной точки провайдера?
У GigaChat токен доступа получается через OAuth и действует ограниченное время; каждый запрос к API требует обязательного заголовка RqUID с уникальным идентификатором в формате uuid4. С 17 июля 2026 года целевой адрес для новых подключений — https://api.giga.chat: прежний gigachat.devices.sberbank.ru остаётся доступным только для уже подключённых клиентов и в дальнейшем будет выведен из эксплуатации, поэтому новые интеграции начинайте с актуального адреса. У других сервисов могут использоваться API-ключи или IAM-токены. В приложении храните секрет в менеджере секретов, а не в коде, промпте или журнале.
2. Реальная совместимость
Проверьте не только формат `/chat/completions`, но и поведение:
- вызов функций и нескольких инструментов;
- структурированный JSON и валидацию схемы;
- потоковую выдачу;
- лимиты контекста и размера ответа;
- коды ошибок, `Retry-After`, тайм-ауты и повторные запросы;
- версионирование моделей и срок уведомления о снятии версии.
Сделайте небольшой адаптер модели внутри своей системы. Тогда замена endpoint или формата ответа останется локальным изменением.
OpenAI-совместимый интерфейс сегодня есть у всех рассмотренных классов решений. Yandex AI Studio предоставляет официальные OpenAI-compatible API для моделей, агентов, файлов и поиска; Ollama и vLLM реализуют совместимость локально. Это упрощает резервный маршрут: основной и запасной провайдеры могут работать через один клиентский интерфейс. Оговорка про совместимость остаётся в силе: единый формат не гарантирует одинаковую поддержку вызова функций, структурированных ответов и потоковой выдачи, поэтому каждый маршрут проверяйте интеграционным тестом.
3. Наблюдаемость и контроль расходов
Для каждого запуска храните безопасный технический след: идентификатор сценария, выбранную модель, число шагов, задержку, расход, ошибки инструментов и решение человека. Не записывайте в обычный лог исходные персональные данные и секреты.
Поставьте три независимых ограничения: число агентных шагов, стоимость одного запуска и суточный бюджет. Агент должен завершать работу с понятным статусом, когда достигнут любой лимит.
Оплата: считать нужно весь маршрут
Цена токенов модели — только одна строка. В управляемом агенте счёт может включать:
- входные и выходные токены;
- вычислительные ресурсы оркестратора;
- поиск, RAG и хранение индекса;
- объектное хранилище, журналирование и исходящий трафик;
- распознавание и синтез речи;
- внешние платные API, которые вызывает агент.
Официальная документация Cloud.ru отдельно учитывает ресурсы агента и зависимые сервисы. В SpeechKit синтез речи тарифицируется блоками по 250 символов, а распознавание — 15-секундными единицами с посекундным учётом начиная с 16-й секунды; цены публикуются в рублях, тенге и долларах, условия по НДС различаются. У GigaChat опубликованы тарифы для физических лиц и бизнеса, но фактический бюджет всё равно определяется профилем запросов.
Для пилота собирайте стоимость на один завершённый бизнес-кейс. Месячный прогноз считайте по формуле:
стоимость кейса = модель + оркестратор + данные/поиск + инструменты + эксплуатация
месячный бюджет = стоимость кейса × объём + резерв на повторы и пикиПример с условными цифрами, который показывает порядок расчёта (это иллюстрация, а не тариф конкретного провайдера). Пусть миллион входных токенов стоит 100 ₽, миллион выходных — 300 ₽. Агент поддержки тратит на один кейс 6 шагов: 30 000 входных и 3 000 выходных токенов, один поисковый запрос по базе знаний и одно ручное подтверждение. Модель на кейс: 30 000 × 100 ₽ / 1 млн + 3 000 × 300 ₽ / 1 млн ≈ 3,9 ₽. Добавьте поиск, оркестратор и журналы: пусть ещё столько же, итого около 8 ₽ за кейс. При 1 000 кейсов в месяц и 15% повторных запусков месячный бюджет составит около 9 200 ₽ плюс резерв на пики. Подставьте в эту схему свои тарифы и нагрузочный профиль.
Не переносите цену из демонстрации на production без нагрузочного профиля: длинный контекст, повторные шаги и голос способны изменить экономику на порядок.
Доступность и vendor risk
Vendor risk — риск зависимости от поставщика. Его надо оценивать до того, как агент получит критичный бизнес-процесс.
| Риск | Что запросить или проверить | Как снизить |
| Изменение API или модели | политика версий, changelog, срок уведомления | собственный адаптер и контрактные тесты |
| Недоступность сервиса | SLA, история инцидентов, регион размещения | очередь задач, тайм-аут, резервный маршрут |
| Рост цены или новый состав счёта | единицы тарификации и детализация usage | лимиты, алерты, тестовый бюджет, регулярный пересчёт |
| Закрытый формат данных | экспорт промптов, индексов, журналов и конфигурации | хранить каноническую конфигурацию у себя |
| Зависимость от чужой модели | список фактических upstream-провайдеров и правила замены | тестовый набор и минимум два проверенных маршрута |
| Потеря контроля над данными | договор, список субподрядчиков, сроки хранения и удаления | классификация данных, минимизация, локальный контур для чувствительных наборов |
Маркетинговая фраза «данные не используются для обучения» не отвечает на вопросы о логах, резервных копиях, сотрудниках с доступом, субподрядчиках и сроке удаления. Нужны договор и техническая схема маршрута.
Приватность и персональные данные
Перед подключением агента разделите данные минимум на четыре уровня: публичные, внутренние, конфиденциальные и персональные. Для каждого уровня задайте допустимых провайдеров, инструменты, срок хранения и владельца решения.
Для процессов с персональными данными проверьте с юристом требования Федерального закона № 152-ФЗ и актуальных подзаконных актов. В инженерном плане особенно важны:
- локализация при первоначальном сборе персональных данных граждан России;
- отдельная оценка трансграничной передачи и требуемых уведомлений;
- правовое основание, цель и минимальный состав данных;
- договорные роли оператора и обработчика;
- порядок удаления, выгрузки и ответа на инцидент.
Масштаб ответственности конкретный. С 30 мая 2025 года за утечку персональных данных действует прогрессивная шкала штрафов: до 15–20 млн ₽ в зависимости от числа пострадавших и категории данных. За повторную утечку назначают оборотный штраф от 1% до 3% годовой выручки (минимум 20 млн, максимум 500 млн ₽), а неуведомление Роскомнадзора об инциденте штрафуется отдельно. Поэтому классификация данных и выключатель внешнего маршрута защищают от самого дорогого сценария.
Не отправляйте чувствительные данные посреднику, который не раскрывает юридическое лицо, маршрут обработки, условия хранения и фактических поставщиков моделей. Не используйте серые способы оплаты или обход ограничений: они добавляют риск блокировки, потери доступа и отсутствия договорной защиты.
Локальная модель сокращает число внешних передач, но сама по себе не делает систему безопасной. Остаются контроль доступа, уязвимости зависимостей, защита API, журналы, резервные копии и права инструментов.
Базовая безопасная архитектура
Рабочая схема для большинства компаний выглядит так:
- Бизнес-сервис хранит состояние процесса и определяет допустимые переходы.
- Оркестратор передаёт модели только нужный контекст и ограниченный набор действий.
- Адаптер модели скрывает различия API и позволяет переключить проверенный маршрут.
- Инструменты работают с минимальными правами; чтение отделено от записи.
- Любая значимая запись, платёж, отправка сообщения или публикация проходит человеческое подтверждение.
- Секреты находятся в менеджере секретов, а пользовательский текст считается недоверенным вводом.
- Журнал фиксирует решение и технический результат без лишних чувствительных данных.
- Лимиты шагов, времени и денег останавливают зацикливание.
- Есть выключатель, резервная модель и детерминированный ручной процесс.
Начинайте с инструментов только для чтения (read-only). Право записи выдавайте отдельно для одного действия и только после того, как журнал и восстановление доказали работоспособность.
Пример переносимого описания маршрута:
scenario: support_draft
data_class: internal
model_route: primary-managed
fallback_route: approved-secondary
tools:
- name: knowledge_search
mode: read-only
limits:
max_steps: 8
max_runtime_seconds: 90
max_cost_per_run: "<company-limit>"
write_gate: human_approval
logging: metadata_onlyТри практических сценария
Исследование по открытым источникам
Для малого бизнеса достаточно управляемой платформы или собственного простого оркестратора с поиском, моделью и хранилищем результатов, доступным только на чтение. Главные проверки — происхождение источников, ссылки в ответе, лимит стоимости и запрет на автоматическую публикацию.
Работа с внутренней базой знаний
Для компании с закрытыми документами нужен договорно подтверждённый маршрут: российское облако с подходящими условиями, выделенный контур или локальный inference. RAG-индекс следует отделить от исходных документов, настроить права на уровне пользователя и проверить, что агент не возвращает фрагменты из чужого раздела.
Голосовой агент
Здесь добавляются распознавание и синтез речи, телефония, запись разговоров и требования к согласию. Считайте задержку всей цепочки, а не одной модели. Бюджет речи, модели и звонка ведите отдельно; запись и расшифровка должны следовать утверждённой политике хранения.
Пилот за десять шагов
- Выберите один процесс с понятным владельцем и обратимым результатом.
- Соберите 20–50 реальных обезличенных примеров, включая ошибки и редкие случаи.
- Зафиксируйте критерии успеха: точность, время, долю ручных исправлений и максимальную стоимость.
- Нарисуйте маршрут данных и классифицируйте каждое поле.
- Получите от поставщика документацию, договорные условия и состав тарификации.
- Реализуйте адаптер модели и только инструменты чтения.
- Добавьте лимиты, журнал, выключатель и ручное подтверждение результата.
- Прогоните одинаковый набор через основной и резервный маршруты.
- Проведите ограниченный проверочный запуск (canary) на реальных задачах под наблюдением владельца процесса.
- Решение о production принимайте по измерениям и плану выхода, а не по качеству демонстрации.
Минимальная таблица приёмки:
| Проверка | Наблюдаемый результат |
| Качество | достигнут заранее заданный порог на закрытом наборе |
| Безопасность | запрещённые данные не уходят во внешний маршрут; запись требует подтверждения |
| Надёжность | тайм-аут, отказ модели и ошибка инструмента завершаются контролируемо |
| Экономика | видна стоимость каждого кейса и срабатывает бюджетный лимит |
| Переносимость | резервный маршрут проходит тот же контрактный набор |
| Операции | владелец умеет остановить процесс и восстановить ручной режим |
Что не стоит делать
- Не давать агенту широкие права «на время теста».
- Не смешивать production-секреты с пользовательским вводом и промптами.
- Не выбирать поставщика только по списку моделей или цене миллиона токенов.
- Не считать OpenAI-совместимый endpoint полной взаимозаменяемостью.
- Не доверять посреднику без понятного юридического лица и маршрута данных.
- Не строить критичный процесс без выключателя, журнала и ручного резерва.
- Не обходить ограничения сервиса, оплаты или доступа сомнительными схемами.
Источники
- Yandex Cloud: Yandex AI Studio, особенности API и OpenAI-совместимость, квоты и лимиты, тарифы SpeechKit.
- Cloud.ru: AI Agents, состав сервисов, ограничения, тарификация, условия использования AI Agents.
- Сбер: GigaChat API, тарифы GigaChat API, MCP в GigaChat API.
- Локальный inference: совместимость Ollama с OpenAI API, OpenAI-совместимый сервер vLLM.
- Правовая основа: Федеральный закон № 152-ФЗ «О персональных данных» и обзор поправок в КоАП о штрафах с 30 мая 2025 года. Применимость требований к конкретному процессу требует отдельной юридической оценки.
- Вторичный практический контекст: обзор StudyAI на Habr и материал Netpeak об агентном поиске. Они не использовались вместо документации поставщиков.
Следующий шаг
Если модельный слой должен работать через российского посредника, продолжите с руководством «Российские API-роутеры иностранных ИИ-моделей: сравнение шести сервисов».
Связанные материалы
- Статья: «Codex становится платформой: почему следующий ИИ-помощник будет не в отдельном окне, а внутри вашего бизнеса»
- Блог: «Хватит выбирать „лучшую модель“»
- База знаний: «Как поднять свою LLM и подключить к Codex»
Если вы проектируете агентный стек для компании, полезно заранее сверить маршрут данных, права инструментов и план выхода из зависимости от поставщика.
Если хотите разобрать свою задачу — напишите мне Если хотите разобрать свою задачу — напишите мне.
Можно прийти с идеей, черновым контекстом или уже живой задачей. Помогу быстро понять, где реальный следующий шаг, а где лишний шум.
Обычно хватает 2–3 сообщений, чтобы понять, могу ли я здесь реально помочь и в каком формате лучше двигаться дальше.
Дальше по теме
Рынок SaaS переполнен, но продуктовая волна создаёт спрос на дистрибуцию, запуск и аналитику. Разбираю, где сейчас выгоднее строить.