pimenov.ai

База знаний

ИИ-агенты в России в 2026 году: сервисы, API и реальные ограничения

Карта агентного стека для России в 2026 году: сервисы, API, оплата, приватность, локальный запуск, риски поставщика и безопасный пилот.

Опубликовано Обновлено

ИИ-агент — это система, которая получает цель, выбирает следующий шаг, вызывает инструменты и проверяет результат. Модель отвечает только за часть цикла. Рабочий стек также включает оркестратор, доступ к данным, управление правами, наблюдаемость и механизм остановки.

Для российского пользователя выбор осложняют доступность сервисов, способы оплаты, требования к персональным данным и зависимость от поставщиков. Поэтому начинать стоит с архитектуры и проверяемого пилота, а не с рейтинга моделей.

📌
Материал проверен по доступной официальной документации на 10 сентября 2026 года. Тарифы, лимиты и условия обработки данных меняются; перед закупкой сверяйте текущую документацию и договор. Раздел о персональных данных — инженерный чек-лист, а не юридическая консультация.

Что входит в агентный стек

СлойЗа что отвечаетЧто проверить
Интерфейс и бизнес-процессГде начинается задача и где человек принимает результатроли, журнал действий, ручное подтверждение
Оркестратор агентаПлан, состояние, повторы, остановка и маршрутизациятайм-ауты, лимиты шагов, идемпотентность, откат
МодельАнализ текста, выбор действия, генерация ответакачество на своём наборе задач, цена, контекст, стабильность API
Инструменты и данныеПоиск, CRM, документы, базы, голос и внешние APIминимальные права, происхождение данных, защита от вредных инструкций
Эксплуатационный контурСекреты, логи, бюджет, мониторинг и инцидентыхранение журналов, оповещения, резервный маршрут, выключатель
Пять слоёв агентного стека: человек, оркестратор, модель, инструменты и эксплуатационный контур.
Пять слоёв агентного стека: человек, оркестратор, модель, инструменты и эксплуатационный контур.

Такое разделение позволяет заменить модель или провайдера без переделки всего процесса. Если один продукт объединяет несколько слоёв, всё равно зафиксируйте их границы в собственной схеме.

Какие классы решений доступны

Ниже приведена карта классов решений. Она не заменяет рейтинг поставщиков. Наличие конкретной функции подтверждайте для выбранного тарифа и договора.

КлассКогда подходитЧто даётГлавный риск
Готовый облачный сервис (SaaS)быстрый эксперимент на несекретных данныхинтерфейс и сценарии без собственной инфраструктурынепрозрачный маршрут данных и слабый контроль экспорта
Управляемая агентная платформакорпоративный пилот с API, журналами и облачной инфраструктуройоркестрация, модели, поиск, инструменты и эксплуатационные сервисыпривязка к компонентам облака и составной счёт
Прямой API модели или API-роутерсобственный оркестратор уже естьпрограммный доступ к одной или нескольким моделямне решает управление правами, состоянием и безопасностью инструментов
Локальный контур запуска моделичувствительные данные, предсказуемая среда или особые требования к задержкеконтроль размещения модели и журналовоборудование, обновления, безопасность и качество становятся вашей обязанностью

Ориентир для выбора:

  • если внешний маршрут для конфиденциальных или персональных данных не согласован, рассматривайте локальный либо выделенный контур с подходящим договором;
  • для эксперимента на открытых данных подойдёт готовый облачный сервис;
  • для корпоративного пилота без собственной инфраструктуры — управляемая платформа;
  • при наличии своего оркестратора — прямой API или API-роутер.

Примеры платформенных и локальных компонентов

Официальное руководство Cloud.ru AI Agents описывает два варианта создания: простой агент на образе по умолчанию и агент из собственного Docker-образа. В агент можно подключить несколько серверов MCP (Model Context Protocol, протокол подключения внешних инструментов и контекста), включать и выключать инструменты, добавлять связанных агентов и задавать системный промпт. Руководство также описывает настройки максимального числа вызовов на задачу, повторов при ошибках, сжатия истории, кэша диалога, масштабирования, аутентификации и журналирования запросов.

Для прямого подключения используйте документированный GigaChat API. Для локального запуска Ollama предоставляет частичную совместимость с OpenAI API. Совпадающий интерфейс упрощает адаптер, но не гарантирует одинаковое поведение инструментов, структурированных ответов, потоковой выдачи и обработки ошибок.

Как проверять API до интеграции

Доступ и жизненный цикл ключей

Проверьте:

  • есть ли отдельные сервисные аккаунты, роли и области доступа;
  • как отозвать ключ и сменить его без простоя;
  • можно ли разделить контуры разработки, тестирования и эксплуатации;
  • куда запрос уходит после входной точки провайдера;
  • сколько живёт токен и как приложение должно его обновлять.

С 17 июля 2026 года целевой URL для подключения к GigaChat API — https://api.giga.chat. Документация называет его адресом для физических и юридических лиц. В примере получения OAuth-токена используется отдельный адрес https://ngw.devices.sberbank.ru:9443/api/v2/oauth.

Минимальный пример запроса с безопасными placeholders:

curl -L -X POST 'https://ngw.devices.sberbank.ru:9443/api/v2/oauth' -H 'Content-Type: application/x-www-form-urlencoded' -H 'Accept: application/json' -H 'RqUID: <uuid4>' -H 'Authorization: Basic <authorization-key>' --data-urlencode 'scope=GIGACHAT_API_PERS'

Для запроса обязательны уникальный RqUID в формате uuid4 и ключ авторизации в заголовке Authorization. Возможные области доступа:

  • GIGACHAT_API_PERS — для физических лиц;
  • GIGACHAT_API_B2B — для ИП и юридических лиц по платным пакетам;
  • GIGACHAT_API_CORP — для ИП и юридических лиц по схеме оплаты по фактическому потреблению.

Полученный токен действует 30 минут. В запросах к API его передают как Bearer-токен в заголовке Authorization. Прежний адрес https://gigachat.devices.sberbank.ru/ остаётся доступным ранее подключённым клиентам, но в дальнейшем будет выведен из эксплуатации.

Храните секреты в менеджере секретов. Не помещайте их в код, промпты и обычные журналы.

Реальная совместимость

Проверяйте поведение, а не только наличие маршрута /chat/completions:

  • вызов одного и нескольких инструментов;
  • структурированный JSON и валидацию схемы;
  • потоковую выдачу;
  • лимиты контекста и ответа;
  • коды ошибок, тайм-ауты и повторные запросы;
  • версионирование моделей и порядок их снятия.

Ollama документирует OpenAI-совместимые маршруты /v1/chat/completions, /v1/completions, /v1/models, /v1/models/{model}, /v1/embeddings и /v1/responses. Для /v1/chat/completions заявлены потоковая выдача, JSON mode, обработка изображений и инструменты. Документация указывает, что /v1/responses добавлен в Ollama v0.13.3 и поддерживает только запросы без серверного состояния: previous_response_id и conversation не поддерживаются.

Перед использованием модели её нужно загрузить локально, например:

ollama pull llama3.2

Сделайте небольшой адаптер модели внутри своей системы. Тогда изменение адреса или формата ответа останется локальной правкой. Каждый основной и резервный маршрут должен проходить один контрактный набор тестов.

Квоты и технические пределы

Квота — организационное ограничение, которое иногда можно увеличить через поддержку. Технический лимит определяется архитектурой сервиса и изменить его нельзя. Квота также не гарантирует доступность ресурсов.

Страница Yandex Cloud помечена датой обновления 9 сентября 2026 года. Приведённые ниже значения относятся к разделу Yandex Cloud AI Studio; таблица показывает значения по умолчанию, соответствующие пробному периоду.

ПараметрЗначениеКатегория
MCP-серверы на облако30квота
Инструменты на один MCP-сервер150квота
Максимальное число текстовых агентов1 000технический лимит
Одновременные запуски Code Interpreter3квота
Максимальный размер одного файла128 МБтехнический лимит
Файлы за одну загрузку100технический лимит
Тайм-аут синхронного запроса20 минуттехнический лимит
Тайм-аут фонового запроса с начала выполнения2 часатехнический лимит

Перед нагрузочным тестом перечитайте таблицу и проверьте, к какому облаку и режиму работы относятся значения. Квоты могут измениться через поддержку, а технические лимиты менять нельзя.

Наблюдаемость и расходы

Для каждого запуска храните безопасный технический след: идентификатор сценария, выбранную модель, число шагов, задержку, расход, ошибки инструментов и решение человека. Не записывайте в обычный лог исходные персональные данные и секреты.

Поставьте независимые ограничения на число шагов, стоимость одного запуска и суточный бюджет. При достижении любого ограничения агент должен завершаться с понятным статусом.

Оплата: считать нужно весь маршрут

Цена токенов модели является одной из статей расходов. В управляемом агенте счёт также может включать:

  • ресурсы оркестратора;
  • поиск с дополнением контекста (RAG) и хранение индекса;
  • объектное хранилище и журналы;
  • исходящий трафик;
  • распознавание и синтез речи;
  • внешние API, вызываемые агентом.

Считайте стоимость завершённого бизнес-кейса:

стоимость кейса = модель + оркестратор + данные/поиск + инструменты + эксплуатация
месячный бюджет = стоимость кейса × объём + резерв на повторы и пики

Пример с условными числами: миллион входных токенов стоит 100 ₽, миллион выходных — 300 ₽. Один кейс тратит 30 000 входных и 3 000 выходных токенов. Модель обойдётся примерно в 3,9 ₽. Если поиск, оркестратор и журналы добавляют ещё около 4 ₽, итог составит примерно 8 ₽. Для 1 000 кейсов и 15% повторных запусков получится около 9 200 ₽ плюс резерв. Это иллюстрация метода. Она не описывает тариф конкретного поставщика.

Длинный контекст, повторные шаги и голос могут заметно изменить экономику. Нагрузочный профиль для рабочего контура собирайте отдельно.

Доступность и зависимость от поставщика

РискЧто проверитьКак снизить
Изменение API или моделиполитику версий, журнал изменений, срок уведомлениясобственный адаптер и контрактные тесты
Недоступность сервисасоглашение об уровне сервиса (SLA), историю инцидентов, регион размещенияочередь задач, тайм-аут, резервный маршрут
Рост ценыединицы тарификации и детализацию потреблениялимиты, оповещения и регулярный пересчёт
Закрытый форматэкспорт промптов, индексов, журналов и конфигурацииканоническую конфигурацию хранить у себя
Смена фактической моделифактических поставщиков моделей и правила заменызакрытый тестовый набор и два проверенных маршрута
Потеря контроля над даннымидоговор, субподрядчиков, сроки хранения и удаленияклассификация, минимизация и отдельный контур для чувствительных данных

Фраза «данные не используются для обучения» не описывает правила хранения логов и резервных копий, доступ сотрудников, субподрядчиков и удаление. Запрашивайте договор и техническую схему маршрута.

Приватность и персональные данные

Разделите данные минимум на четыре уровня: публичные, внутренние, конфиденциальные и персональные. Для каждого уровня задайте допустимых провайдеров, инструменты, срок хранения и владельца решения.

Если процесс связан с персональными данными, отдельно проверьте с юристом применимость Федерального закона № 152-ФЗ и актуальных подзаконных актов. Инженерный чек-лист для такой проверки включает:

  • требования к локализации при первоначальном сборе данных граждан России;
  • оценку трансграничной передачи и необходимых уведомлений;
  • правовое основание, цель и минимальный состав данных;
  • договорные роли участников обработки;
  • порядок удаления, выгрузки и реакции на инцидент.

Не отправляйте чувствительные данные посреднику, который не раскрывает юридическое лицо, маршрут обработки, условия хранения и фактических поставщиков моделей. Серые способы оплаты и обход ограничений добавляют риск блокировки и лишают договорной защиты.

Локальная модель может уменьшить число внешних передач, но не отменяет контроль доступа, защиту API, обновление зависимостей, журналы и резервные копии.

⚠️
Внимание: в примерах OpenAI-совместимого клиента Ollama используется локальный адрес http://localhost:11434/v1/, а параметр api_key обязателен для клиента, но игнорируется. Это не механизм аутентификации. Не публикуйте такой интерфейс в сеть без отдельной аутентификации, шифрования и защищённого шлюза.

Базовая безопасная архитектура

  1. Бизнес-сервис хранит состояние процесса и разрешённые переходы.
  2. Оркестратор передаёт модели только нужный контекст и ограниченный набор действий.
  3. Адаптер модели скрывает различия API и позволяет переключить проверенный маршрут.
  4. Инструменты работают с минимальными правами; чтение отделено от записи.
  5. Значимая запись, платёж, отправка сообщения или публикация требуют человеческого подтверждения.
  6. Секреты находятся в менеджере секретов, пользовательский текст считается недоверенным вводом.
  7. Журнал фиксирует решение и технический результат без лишних чувствительных данных.
  8. Лимиты шагов, времени и денег останавливают зацикливание.
  9. Предусмотрите выключатель, резервную модель и ручной процесс.

Начинайте с инструментов только для чтения. Право записи выдавайте отдельно для одного действия после проверки журнала и восстановления.

scenario: support_draft
data_class: internal # классификация данных сценария
model_route: primary-managed
fallback_route: approved-secondary
tools:
  - name: knowledge_search
    mode: read-only # инструмент не изменяет данные
limits:
  max_steps: 8
  max_runtime_seconds: 90
  max_cost_per_run: '<company-limit>' # лимит из политики компании
write_gate: human_approval
logging: metadata_only

Полезные сценарии

Исследование открытых источников

Задача: подготовить справку по публичному вопросу. Исходные данные — вопрос пользователя и разрешённые источники. Агент выполняет поиск, сохраняет ссылки и готовит черновик. Проверяемый результат — ответ с происхождением цитат и ссылками. Сценарий не подходит для автоматической публикации без отдельной проверки.

Работа с внутренней базой знаний

Задача: ответить сотруднику по закрытым документам. Исходные данные — документы и права доступа пользователя. Агент ищет только в разрешённом индексе и формирует ответ с указанием использованных фрагментов. Проверяемый результат — агент не возвращает материалы из чужого раздела. До настройки прав такой сценарий нельзя считать безопасным.

Голосовой агент

Задача: обработать разговор с клиентом. Исходные данные — аудиопоток, настройки телефонии и согласие пользователя на запись, если оно требуется политикой процесса. Агент использует распознавание и синтез речи, а система сохраняет только разрешённые результаты. Проверяемый результат — измерены задержка всей цепочки, стоимость и срок хранения записи. Без утверждённой политики записи и расшифровки сценарий не готов к рабочему контуру.

Пилот за десять шагов

  1. Выберите один процесс с понятным владельцем и обратимым результатом.
  2. Соберите 20–50 реальных обезличенных примеров, включая ошибки и редкие случаи.
  3. Зафиксируйте пороги качества, времени, ручных исправлений и стоимости.
  4. Нарисуйте маршрут данных и классифицируйте каждое поле.
  5. Получите документацию, договорные условия и состав тарификации.
  6. Реализуйте адаптер модели и инструменты чтения.
  7. Добавьте лимиты, журнал, выключатель и ручное подтверждение.
  8. Прогоните один набор через основной и резервный маршруты.
  9. Проведите ограниченный проверочный запуск под наблюдением владельца процесса.
  10. Принимайте решение о рабочем контуре по измерениям и плану выхода.
ПроверкаНаблюдаемый результат
Качестводостигнут заданный порог на закрытом наборе
Безопасностьзапрещённые данные не уходят во внешний маршрут; запись требует подтверждения
Надёжностьтайм-аут и ошибки завершаются контролируемо
Экономикавидна стоимость кейса и срабатывает бюджетный лимит
Переносимостьрезервный маршрут проходит тот же контрактный набор
Операциивладелец умеет остановить процесс и вернуть ручной режим

Что не стоит делать

  • Давать агенту широкие права «на время теста».
  • Смешивать production-секреты с пользовательским вводом и промптами.
  • Выбирать поставщика только по списку моделей или цене токенов.
  • Считать OpenAI-совместимый endpoint полной взаимозаменяемостью.
  • Доверять посреднику без понятного юридического лица и маршрута данных.
  • Строить критичный процесс без выключателя, журнала и ручного резерва.
  • Обходить ограничения оплаты и доступа сомнительными схемами.

Проверка результата

Пилот можно считать технически готовым, если основной и резервный маршруты проходят один закрытый набор задач, запрещённые действия блокируются, запись требует подтверждения, лимиты останавливают цикл, а журнал позволяет восстановить последовательность событий и стоимость кейса.

Если руководство используется без самостоятельного запуска описанных сервисов, сначала повторите интеграционные и нагрузочные тесты в своём контуре. Документация подтверждает интерфейсы и заявленные ограничения, но не результат конкретного бизнес-процесса.

Источники


Следующий шаг

Если модельный слой должен работать через российского посредника, продолжите с руководством «Российские API-роутеры иностранных ИИ-моделей: сравнение шести сервисов».

Связанные материалы

Если вы проектируете агентный стек для компании, заранее проверьте маршрут данных, права инструментов и план выхода из зависимости от поставщика.

Если захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov