Yandex SpeechKit — синтез и распознавание речи от Яндекса
Облачный сервис Яндекса для синтеза (TTS) и распознавания речи: API v1 и v3, русские голоса, SSML и ударения, тарифы и наш кейс озвучки сайта.
База знаний / Тег
Подборка материалов по одной теме — чтобы быстро пройти в нужный контекст без лишнего скролла по всему разделу.
Материалы по теме
Облачный сервис Яндекса для синтеза (TTS) и распознавания речи: API v1 и v3, русские голоса, SSML и ударения, тарифы и наш кейс озвучки сайта.
Unlimited-OCR от Baidu — открытая модель для парсинга длинных документов и PDF: возможности, запуск через Transformers, vLLM и SGLang, лимиты и сценарии.
OpenMed — открытый набор медицинских ИИ-моделей для клинического NER и обезличивания данных. Работают локально на устройстве или сервере, без облака.
Cloudflare Agents SDK — фреймворк для stateful AI-агентов поверх Durable Objects: каждый агент — отдельный «микросервер» с SQLite, WebSocket, планировщиком и hibernation. Разбираем, как устроено, когда брать, как собирается с OpenAI Agents SDK и MCP.
Directus превращает любую SQL-базу в общий бэкенд для людей и ИИ-агентов: единый админ-интерфейс, мгновенные REST и GraphQL API, политики доступа, нативный MCP-сервер и простое развёртывание на собственном VPS.
Простое объяснение очередей и фоновых задач: почему тяжёлую обработку, уведомления, генерацию и синхронизацию лучше выполнять отдельно.
Понятный материал о ролях, доступах и ограничениях для людей, сервисов и ИИ-агентов в рабочих системах.
Простое объяснение API как языка общения между сайтом, CRM, Telegram, Notion, CMS, агентами и другими сервисами.
Понятное объяснение разницы между CMS, базой данных и сайтом на примере контента, админки, хранения и публичной витрины.
Понятное объяснение webhook: событие произошло в одном сервисе, и другой сервис сразу получает сигнал, что нужно действовать.
Вводный материал для обычного читателя: что такое backend и что происходит после нажатия кнопки на сайте или в приложении.
Полный справочник по Redis: архитектура, структуры данных, Pub/Sub, Streams, кластеризация, тарифы и практические сценарии для AI-агентов и веб-приложений.
Как устроена безопасность MCP: реальные атаки (tool poisoning, prompt injection, rug pull, tool shadowing) и практические меры: OAuth-авторизация, изоляция, least privilege, сканирование, пиннинг версий, аудит tool calls.
Open-source библиотека готовых моделей речи от Silero Team: синтез (TTS), распознавание (STT) и детекция голоса (VAD). Особенно сильна на русском: 5 живых голосов, автоматические ударения, омографы, SSML и три частоты дискретизации. Подключается одной строкой через pip или torch.hub.
Открытая embedding-модель от Google на базе Gemma 3: 308M параметров, 100+ языков, контекст 2048 токенов, 768-мерные векторы с MRL-усечением до 128. Работает на 200 МБ RAM, считает эмбеддинг на CPU за десятки миллисекунд. Когда брать вместо BGE-M3, как поднять локально и во что упереться.
Open-source backend-as-a-service: PostgreSQL, авторизация, хранилище, Realtime и Edge Functions в одной коробке. Можно использовать облако или поднять локально через Docker.
Open-source embedding-модель от BAAI для поиска, RAG и семантического сравнения текстов. Контекст 8192 токена, 100+ языков, MIT-лицензия, работает на CPU. Разбор возможностей, сравнение с альтернативами и эталонная сборка сервера на FastAPI.
Полный разбор Strapi 5: что это, как устроена архитектура, какие API доступны из коробки, как деплоить, сколько стоит и когда Strapi — правильный выбор, а когда лучше посмотреть в сторону облачных CMS.
Следующий шаг
Теговая страница даёт тематическую выборку, а кейсы показывают, как похожие идеи доходят до рабочего контура и живого результата.