База знаний
ИИ-агенты в России в 2026 году: сервисы, API и реальные ограничения
Карта агентного стека для России в 2026 году: сервисы, API, оплата, приватность, локальный запуск, риски поставщика и безопасный пилот.
СейчасЧто входит в агентный стек
- Что входит в агентный стек
- Какие классы решений доступны
- Примеры платформенных и локальных компонентов
- Как проверять API до интеграции
- Доступ и жизненный цикл ключей
- Реальная совместимость
- Квоты и технические пределы
- Наблюдаемость и расходы
- Оплата: считать нужно весь маршрут
- Доступность и зависимость от поставщика
- Приватность и персональные данные
- Базовая безопасная архитектура
- Полезные сценарии
- Исследование открытых источников
- Работа с внутренней базой знаний
- Голосовой агент
- Пилот за десять шагов
- Что не стоит делать
- Проверка результата
- Источники
- Следующий шаг
- Связанные материалы
ИИ-агент — это система, которая получает цель, выбирает следующий шаг, вызывает инструменты и проверяет результат. Модель отвечает только за часть цикла. Рабочий стек также включает оркестратор, доступ к данным, управление правами, наблюдаемость и механизм остановки.
Для российского пользователя выбор осложняют доступность сервисов, способы оплаты, требования к персональным данным и зависимость от поставщиков. Поэтому начинать стоит с архитектуры и проверяемого пилота, а не с рейтинга моделей.
Что входит в агентный стек
| Слой | За что отвечает | Что проверить |
| Интерфейс и бизнес-процесс | Где начинается задача и где человек принимает результат | роли, журнал действий, ручное подтверждение |
| Оркестратор агента | План, состояние, повторы, остановка и маршрутизация | тайм-ауты, лимиты шагов, идемпотентность, откат |
| Модель | Анализ текста, выбор действия, генерация ответа | качество на своём наборе задач, цена, контекст, стабильность API |
| Инструменты и данные | Поиск, CRM, документы, базы, голос и внешние API | минимальные права, происхождение данных, защита от вредных инструкций |
| Эксплуатационный контур | Секреты, логи, бюджет, мониторинг и инциденты | хранение журналов, оповещения, резервный маршрут, выключатель |
Такое разделение позволяет заменить модель или провайдера без переделки всего процесса. Если один продукт объединяет несколько слоёв, всё равно зафиксируйте их границы в собственной схеме.
Какие классы решений доступны
Ниже приведена карта классов решений. Она не заменяет рейтинг поставщиков. Наличие конкретной функции подтверждайте для выбранного тарифа и договора.
| Класс | Когда подходит | Что даёт | Главный риск |
| Готовый облачный сервис (SaaS) | быстрый эксперимент на несекретных данных | интерфейс и сценарии без собственной инфраструктуры | непрозрачный маршрут данных и слабый контроль экспорта |
| Управляемая агентная платформа | корпоративный пилот с API, журналами и облачной инфраструктурой | оркестрация, модели, поиск, инструменты и эксплуатационные сервисы | привязка к компонентам облака и составной счёт |
| Прямой API модели или API-роутер | собственный оркестратор уже есть | программный доступ к одной или нескольким моделям | не решает управление правами, состоянием и безопасностью инструментов |
| Локальный контур запуска модели | чувствительные данные, предсказуемая среда или особые требования к задержке | контроль размещения модели и журналов | оборудование, обновления, безопасность и качество становятся вашей обязанностью |
Ориентир для выбора:
- если внешний маршрут для конфиденциальных или персональных данных не согласован, рассматривайте локальный либо выделенный контур с подходящим договором;
- для эксперимента на открытых данных подойдёт готовый облачный сервис;
- для корпоративного пилота без собственной инфраструктуры — управляемая платформа;
- при наличии своего оркестратора — прямой API или API-роутер.
Примеры платформенных и локальных компонентов
Официальное руководство Cloud.ru AI Agents описывает два варианта создания: простой агент на образе по умолчанию и агент из собственного Docker-образа. В агент можно подключить несколько серверов MCP (Model Context Protocol, протокол подключения внешних инструментов и контекста), включать и выключать инструменты, добавлять связанных агентов и задавать системный промпт. Руководство также описывает настройки максимального числа вызовов на задачу, повторов при ошибках, сжатия истории, кэша диалога, масштабирования, аутентификации и журналирования запросов.
Для прямого подключения используйте документированный GigaChat API. Для локального запуска Ollama предоставляет частичную совместимость с OpenAI API. Совпадающий интерфейс упрощает адаптер, но не гарантирует одинаковое поведение инструментов, структурированных ответов, потоковой выдачи и обработки ошибок.
Как проверять API до интеграции
Доступ и жизненный цикл ключей
Проверьте:
- есть ли отдельные сервисные аккаунты, роли и области доступа;
- как отозвать ключ и сменить его без простоя;
- можно ли разделить контуры разработки, тестирования и эксплуатации;
- куда запрос уходит после входной точки провайдера;
- сколько живёт токен и как приложение должно его обновлять.
С 17 июля 2026 года целевой URL для подключения к GigaChat API — https://api.giga.chat. Документация называет его адресом для физических и юридических лиц. В примере получения OAuth-токена используется отдельный адрес https://ngw.devices.sberbank.ru:9443/api/v2/oauth.
Минимальный пример запроса с безопасными placeholders:
curl -L -X POST 'https://ngw.devices.sberbank.ru:9443/api/v2/oauth' -H 'Content-Type: application/x-www-form-urlencoded' -H 'Accept: application/json' -H 'RqUID: <uuid4>' -H 'Authorization: Basic <authorization-key>' --data-urlencode 'scope=GIGACHAT_API_PERS'Для запроса обязательны уникальный RqUID в формате uuid4 и ключ авторизации в заголовке Authorization. Возможные области доступа:
GIGACHAT_API_PERS— для физических лиц;GIGACHAT_API_B2B— для ИП и юридических лиц по платным пакетам;GIGACHAT_API_CORP— для ИП и юридических лиц по схеме оплаты по фактическому потреблению.
Полученный токен действует 30 минут. В запросах к API его передают как Bearer-токен в заголовке Authorization. Прежний адрес https://gigachat.devices.sberbank.ru/ остаётся доступным ранее подключённым клиентам, но в дальнейшем будет выведен из эксплуатации.
Храните секреты в менеджере секретов. Не помещайте их в код, промпты и обычные журналы.
Реальная совместимость
Проверяйте поведение, а не только наличие маршрута /chat/completions:
- вызов одного и нескольких инструментов;
- структурированный JSON и валидацию схемы;
- потоковую выдачу;
- лимиты контекста и ответа;
- коды ошибок, тайм-ауты и повторные запросы;
- версионирование моделей и порядок их снятия.
Ollama документирует OpenAI-совместимые маршруты /v1/chat/completions, /v1/completions, /v1/models, /v1/models/{model}, /v1/embeddings и /v1/responses. Для /v1/chat/completions заявлены потоковая выдача, JSON mode, обработка изображений и инструменты. Документация указывает, что /v1/responses добавлен в Ollama v0.13.3 и поддерживает только запросы без серверного состояния: previous_response_id и conversation не поддерживаются.
Перед использованием модели её нужно загрузить локально, например:
ollama pull llama3.2Сделайте небольшой адаптер модели внутри своей системы. Тогда изменение адреса или формата ответа останется локальной правкой. Каждый основной и резервный маршрут должен проходить один контрактный набор тестов.
Квоты и технические пределы
Квота — организационное ограничение, которое иногда можно увеличить через поддержку. Технический лимит определяется архитектурой сервиса и изменить его нельзя. Квота также не гарантирует доступность ресурсов.
Страница Yandex Cloud помечена датой обновления 9 сентября 2026 года. Приведённые ниже значения относятся к разделу Yandex Cloud AI Studio; таблица показывает значения по умолчанию, соответствующие пробному периоду.
| Параметр | Значение | Категория |
| MCP-серверы на облако | 30 | квота |
| Инструменты на один MCP-сервер | 150 | квота |
| Максимальное число текстовых агентов | 1 000 | технический лимит |
| Одновременные запуски Code Interpreter | 3 | квота |
| Максимальный размер одного файла | 128 МБ | технический лимит |
| Файлы за одну загрузку | 100 | технический лимит |
| Тайм-аут синхронного запроса | 20 минут | технический лимит |
| Тайм-аут фонового запроса с начала выполнения | 2 часа | технический лимит |
Перед нагрузочным тестом перечитайте таблицу и проверьте, к какому облаку и режиму работы относятся значения. Квоты могут измениться через поддержку, а технические лимиты менять нельзя.
Наблюдаемость и расходы
Для каждого запуска храните безопасный технический след: идентификатор сценария, выбранную модель, число шагов, задержку, расход, ошибки инструментов и решение человека. Не записывайте в обычный лог исходные персональные данные и секреты.
Поставьте независимые ограничения на число шагов, стоимость одного запуска и суточный бюджет. При достижении любого ограничения агент должен завершаться с понятным статусом.
Оплата: считать нужно весь маршрут
Цена токенов модели является одной из статей расходов. В управляемом агенте счёт также может включать:
- ресурсы оркестратора;
- поиск с дополнением контекста (RAG) и хранение индекса;
- объектное хранилище и журналы;
- исходящий трафик;
- распознавание и синтез речи;
- внешние API, вызываемые агентом.
Считайте стоимость завершённого бизнес-кейса:
стоимость кейса = модель + оркестратор + данные/поиск + инструменты + эксплуатация
месячный бюджет = стоимость кейса × объём + резерв на повторы и пикиПример с условными числами: миллион входных токенов стоит 100 ₽, миллион выходных — 300 ₽. Один кейс тратит 30 000 входных и 3 000 выходных токенов. Модель обойдётся примерно в 3,9 ₽. Если поиск, оркестратор и журналы добавляют ещё около 4 ₽, итог составит примерно 8 ₽. Для 1 000 кейсов и 15% повторных запусков получится около 9 200 ₽ плюс резерв. Это иллюстрация метода. Она не описывает тариф конкретного поставщика.
Длинный контекст, повторные шаги и голос могут заметно изменить экономику. Нагрузочный профиль для рабочего контура собирайте отдельно.
Доступность и зависимость от поставщика
| Риск | Что проверить | Как снизить |
| Изменение API или модели | политику версий, журнал изменений, срок уведомления | собственный адаптер и контрактные тесты |
| Недоступность сервиса | соглашение об уровне сервиса (SLA), историю инцидентов, регион размещения | очередь задач, тайм-аут, резервный маршрут |
| Рост цены | единицы тарификации и детализацию потребления | лимиты, оповещения и регулярный пересчёт |
| Закрытый формат | экспорт промптов, индексов, журналов и конфигурации | каноническую конфигурацию хранить у себя |
| Смена фактической модели | фактических поставщиков моделей и правила замены | закрытый тестовый набор и два проверенных маршрута |
| Потеря контроля над данными | договор, субподрядчиков, сроки хранения и удаления | классификация, минимизация и отдельный контур для чувствительных данных |
Фраза «данные не используются для обучения» не описывает правила хранения логов и резервных копий, доступ сотрудников, субподрядчиков и удаление. Запрашивайте договор и техническую схему маршрута.
Приватность и персональные данные
Разделите данные минимум на четыре уровня: публичные, внутренние, конфиденциальные и персональные. Для каждого уровня задайте допустимых провайдеров, инструменты, срок хранения и владельца решения.
Если процесс связан с персональными данными, отдельно проверьте с юристом применимость Федерального закона № 152-ФЗ и актуальных подзаконных актов. Инженерный чек-лист для такой проверки включает:
- требования к локализации при первоначальном сборе данных граждан России;
- оценку трансграничной передачи и необходимых уведомлений;
- правовое основание, цель и минимальный состав данных;
- договорные роли участников обработки;
- порядок удаления, выгрузки и реакции на инцидент.
Не отправляйте чувствительные данные посреднику, который не раскрывает юридическое лицо, маршрут обработки, условия хранения и фактических поставщиков моделей. Серые способы оплаты и обход ограничений добавляют риск блокировки и лишают договорной защиты.
Локальная модель может уменьшить число внешних передач, но не отменяет контроль доступа, защиту API, обновление зависимостей, журналы и резервные копии.
http://localhost:11434/v1/, а параметр api_key обязателен для клиента, но игнорируется. Это не механизм аутентификации. Не публикуйте такой интерфейс в сеть без отдельной аутентификации, шифрования и защищённого шлюза.Базовая безопасная архитектура
- Бизнес-сервис хранит состояние процесса и разрешённые переходы.
- Оркестратор передаёт модели только нужный контекст и ограниченный набор действий.
- Адаптер модели скрывает различия API и позволяет переключить проверенный маршрут.
- Инструменты работают с минимальными правами; чтение отделено от записи.
- Значимая запись, платёж, отправка сообщения или публикация требуют человеческого подтверждения.
- Секреты находятся в менеджере секретов, пользовательский текст считается недоверенным вводом.
- Журнал фиксирует решение и технический результат без лишних чувствительных данных.
- Лимиты шагов, времени и денег останавливают зацикливание.
- Предусмотрите выключатель, резервную модель и ручной процесс.
Начинайте с инструментов только для чтения. Право записи выдавайте отдельно для одного действия после проверки журнала и восстановления.
scenario: support_draft
data_class: internal # классификация данных сценария
model_route: primary-managed
fallback_route: approved-secondary
tools:
- name: knowledge_search
mode: read-only # инструмент не изменяет данные
limits:
max_steps: 8
max_runtime_seconds: 90
max_cost_per_run: '<company-limit>' # лимит из политики компании
write_gate: human_approval
logging: metadata_onlyПолезные сценарии
Исследование открытых источников
Задача: подготовить справку по публичному вопросу. Исходные данные — вопрос пользователя и разрешённые источники. Агент выполняет поиск, сохраняет ссылки и готовит черновик. Проверяемый результат — ответ с происхождением цитат и ссылками. Сценарий не подходит для автоматической публикации без отдельной проверки.
Работа с внутренней базой знаний
Задача: ответить сотруднику по закрытым документам. Исходные данные — документы и права доступа пользователя. Агент ищет только в разрешённом индексе и формирует ответ с указанием использованных фрагментов. Проверяемый результат — агент не возвращает материалы из чужого раздела. До настройки прав такой сценарий нельзя считать безопасным.
Голосовой агент
Задача: обработать разговор с клиентом. Исходные данные — аудиопоток, настройки телефонии и согласие пользователя на запись, если оно требуется политикой процесса. Агент использует распознавание и синтез речи, а система сохраняет только разрешённые результаты. Проверяемый результат — измерены задержка всей цепочки, стоимость и срок хранения записи. Без утверждённой политики записи и расшифровки сценарий не готов к рабочему контуру.
Пилот за десять шагов
- Выберите один процесс с понятным владельцем и обратимым результатом.
- Соберите 20–50 реальных обезличенных примеров, включая ошибки и редкие случаи.
- Зафиксируйте пороги качества, времени, ручных исправлений и стоимости.
- Нарисуйте маршрут данных и классифицируйте каждое поле.
- Получите документацию, договорные условия и состав тарификации.
- Реализуйте адаптер модели и инструменты чтения.
- Добавьте лимиты, журнал, выключатель и ручное подтверждение.
- Прогоните один набор через основной и резервный маршруты.
- Проведите ограниченный проверочный запуск под наблюдением владельца процесса.
- Принимайте решение о рабочем контуре по измерениям и плану выхода.
| Проверка | Наблюдаемый результат |
| Качество | достигнут заданный порог на закрытом наборе |
| Безопасность | запрещённые данные не уходят во внешний маршрут; запись требует подтверждения |
| Надёжность | тайм-аут и ошибки завершаются контролируемо |
| Экономика | видна стоимость кейса и срабатывает бюджетный лимит |
| Переносимость | резервный маршрут проходит тот же контрактный набор |
| Операции | владелец умеет остановить процесс и вернуть ручной режим |
Что не стоит делать
- Давать агенту широкие права «на время теста».
- Смешивать production-секреты с пользовательским вводом и промптами.
- Выбирать поставщика только по списку моделей или цене токенов.
- Считать OpenAI-совместимый endpoint полной взаимозаменяемостью.
- Доверять посреднику без понятного юридического лица и маршрута данных.
- Строить критичный процесс без выключателя, журнала и ручного резерва.
- Обходить ограничения оплаты и доступа сомнительными схемами.
Проверка результата
Пилот можно считать технически готовым, если основной и резервный маршруты проходят один закрытый набор задач, запрещённые действия блокируются, запись требует подтверждения, лимиты останавливают цикл, а журнал позволяет восстановить последовательность событий и стоимость кейса.
Если руководство используется без самостоятельного запуска описанных сервисов, сначала повторите интеграционные и нагрузочные тесты в своём контуре. Документация подтверждает интерфейсы и заявленные ограничения, но не результат конкретного бизнес-процесса.
Источники
- Cloud.ru: создание AI-агента.
- Сбер: GigaChat API.
- Yandex Cloud: квоты и лимиты.
- Ollama: совместимость с OpenAI API.
Следующий шаг
Если модельный слой должен работать через российского посредника, продолжите с руководством «Российские API-роутеры иностранных ИИ-моделей: сравнение шести сервисов».
Связанные материалы
- Статья: «Codex становится платформой: почему следующий ИИ-помощник будет не в отдельном окне, а внутри вашего бизнеса»
- Блог: «Хватит выбирать „лучшую модель“»
- База знаний: «Как поднять свою LLM и подключить к Codex»
Если вы проектируете агентный стек для компании, заранее проверьте маршрут данных, права инструментов и план выхода из зависимости от поставщика.
Если захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov
Если хотите разобрать свою задачу — напишите мне Если хотите разобрать свою задачу — напишите мне.
Можно прийти с идеей, черновым контекстом или уже живой задачей. Помогу быстро понять, где реальный следующий шаг, а где лишний шум.
Обычно хватает 2–3 сообщений, чтобы понять, могу ли я здесь реально помочь и в каком формате лучше двигаться дальше.
Дальше по теме
Рынок SaaS переполнен, но продуктовая волна создаёт спрос на дистрибуцию, запуск и аналитику. Разбираю, где сейчас выгоднее строить.