Найти материал

Поиск по опубликованным материалам, разборам и форматам работы. После согласия на аналитику запросы помогают улучшать поиск. ⌘K / Ctrl+K — поиск · ↑↓ — выбор · Enter — открыть

Поиск по полным текстам на отдельной странице →

Все темы

Модели

Понять возможности и ограничения ИИ-моделей, выбрать и сравнить их, исследовать обучение и вычисления.

С чего начать

Материалы, с которых можно начать знакомство с темой.

Начать с руководства

Как найти приложение в Hugging Face Spaces, попробовать расшифровку аудио, удаление фона и пересказ текста, проверить результат и разобраться с лимитами.

Начать с руководства

Hugging Face для начинающих: где искать ИИ-модели, как попробовать приложения в браузере, читать карточки и выбрать способ применения в своей работе.

Начать с руководства

Практическое руководство по Jev: настройка API, Choice, Score и Noul, маршрутизация задач, пороги уверенности и безопасное внедрение.

Все материалы по теме

Сначала новые публикации. Статьи, руководства и записи блога — в одном списке.

125 материалов

Блог

Grok 4.3 в xAI API: 1M контекста, лидер по tool calling и цена ниже флагманов

xAI выпустила Grok 4.3 в публичный API: 1 миллион токенов контекста, первые места в бенчмарках по агентным tool calls и instruction following и заметно дешевле большинства конкурентов. Разбираю, что это даёт на практике.

Руководство

Промпт-инжиниринг для GPT-5.5 — outcome-first подход, личность и валидация

Официальное руководство OpenAI по промптингу GPT-5.5: outcome-first промпты, настройка личности модели, бюджеты поиска, валидация результатов и рекомендуемая структура системных промптов.

Руководство

Silero Models — open-source модели речи на русском (TTS, STT, VAD)

Open-source библиотека готовых моделей речи от Silero Team: синтез (TTS), распознавание (STT) и детекция голоса (VAD). Особенно сильна на русском: 5 живых голосов, автоматические ударения, омографы, SSML и три частоты дискретизации. Подключается одной строкой через pip или torch.hub.

Статья

Minimax M2.7 на Mac Studio: 120 000 токенов контекста и живой код — рассказ Миши

Миша Психмикс из Фабрики Контента поставил Minimax M2.7 на Mac Studio, включил сжатие V-кэша — и получил 120k контекста и 25–50 токенов в секунду. Его рассказ от первого лица: что изменилось, как ведёт себя модель в OpenClaw и почему локальные модели снова стали рабочими.

Блог

ChatGPT Images 2.0 — OpenAI наконец сделал текст на картинках читаемым

OpenAI выпустил ChatGPT Images 2.0 на базе GPT-Image-2 — с почти идеальным рендерингом текста, реалистичными UI-скриншотами и заметным скачком в фотореализме. Разбираюсь, что изменилось и почему это важно.

Руководство

EmbeddingGemma (Gemma 3) — компактная embedding-модель от Google для on-device RAG

Открытая embedding-модель от Google на базе Gemma 3: 308M параметров, 100+ языков, контекст 2048 токенов, 768-мерные векторы с MRL-усечением до 128. Работает на 200 МБ RAM, считает эмбеддинг на CPU за десятки миллисекунд. Когда брать вместо BGE-M3, как поднять локально и во что упереться.

Руководство

BAAI/bge-m3 — мультиязычная embedding-модель для self-hosted RAG

Open-source embedding-модель от BAAI для поиска, RAG и семантического сравнения текстов. Контекст 8192 токена, 100+ языков, MIT-лицензия, работает на CPU. Разбор возможностей, сравнение с альтернативами и эталонная сборка сервера на FastAPI.

Блог

MiniMax M2.7 вышла в опенсорс — модель, которая тренировала сама себя, уже в Ollama

MiniMax открыла исходный код M2.7 — модели, которая участвовала в собственном обучении. С результатами на уровне GPT-5.3-Codex и ценой в 20 раз ниже Claude Opus, она уже доступна через Ollama.

Статья

Два агента лучше одного: как связать OpenClaw и Hermes Agent в единую систему

Почему OpenClaw и Hermes Agent не конкуренты, а дополняют друг друга. Практические схемы совместной работы: оркестрация + самообучение, контент-конвейер, ресёрч, код-ревью — с конкретными примерами.

Руководство

Qwen 3.8 (Alibaba) — актуальная экосистема открытых моделей: мультимодальность, агенты, локальный запуск

Справочник по экосистеме Qwen от Alibaba Cloud: линейка моделей, мультимодальность, tool use, лицензии, сравнение с Llama и Mistral, где попробовать.

Блог

Qwen3.5-Omni от Alibaba — модель, которая видит, слышит и говорит. И это не демо

Alibaba выпустила Qwen3.5-Omni — нативно мультимодальную модель на 397 миллиардов параметров, которая обрабатывает текст, изображения, аудио и видео, отвечает голосом в реальном времени и умеет вызывать внешние инструменты.

Блог

Google запустил Gemini 3.1 Flash Live — и это первый серьёзный шаг к голосовым ИИ-агентам в реальном времени

Gemini 3.1 Flash Live — модель для создания голосовых ИИ-агентов с минимальной задержкой. Разбираюсь, что это значит для разработчиков и почему это важно.

Блог

Autoresearch от Karpathy: мини-репозиторий, чтобы «научить» агента улучшать обучение LLM

Короткая заметка о том, как устроен autoresearch: вы правите «программу» агента в .md, агент правит тренировочный .py, а все эксперименты сравнимы, потому что каждый прогон длится фиксированные 5 минут.

Блог

Почему будущее ИИ — это «консенсус моделей», а не один супер-бот

Идея простая: несколько агентов от разных провайдеров решают одну задачу параллельно, а оркестратор показывает, в чём они сошлись и где расходятся. Это заметно повышает качество и доверие к результату.

Хотите применить прочитанное к своей задаче?

Разберём вашу задачу и определим ближайший шаг.