Найти материал

Поиск по опубликованным материалам, разборам и форматам работы. После согласия на аналитику запросы помогают улучшать поиск. ⌘K / Ctrl+K — поиск · ↑↓ — выбор · Enter — открыть

Поиск по полным текстам на отдельной странице →

Блог: Модели

Короткие наблюдения, находки и рабочие заметки — от новых инструментов до собственного опыта.

88 записей · показаны 73–84

ChatGPT Images 2.0 — OpenAI наконец сделал текст на картинках читаемым

OpenAI выпустил ChatGPT Images 2.0 на базе GPT-Image-2 — с почти идеальным рендерингом текста, реалистичными UI-скриншотами и заметным скачком в фотореализме. Разбираюсь, что изменилось и почему это важно.

MiniMax M2.7 вышла в опенсорс — модель, которая тренировала сама себя, уже в Ollama

MiniMax открыла исходный код M2.7 — модели, которая участвовала в собственном обучении. С результатами на уровне GPT-5.3-Codex и ценой в 20 раз ниже Claude Opus, она уже доступна через Ollama.

Qwen3.5-Omni от Alibaba — модель, которая видит, слышит и говорит. И это не демо

Alibaba выпустила Qwen3.5-Omni — нативно мультимодальную модель на 397 миллиардов параметров, которая обрабатывает текст, изображения, аудио и видео, отвечает голосом в реальном времени и умеет вызывать внешние инструменты.

Google запустил Gemini 3.1 Flash Live — и это первый серьёзный шаг к голосовым ИИ-агентам в реальном времени

Gemini 3.1 Flash Live — модель для создания голосовых ИИ-агентов с минимальной задержкой. Разбираюсь, что это значит для разработчиков и почему это важно.

Autoresearch от Karpathy: мини-репозиторий, чтобы «научить» агента улучшать обучение LLM

Короткая заметка о том, как устроен autoresearch: вы правите «программу» агента в .md, агент правит тренировочный .py, а все эксперименты сравнимы, потому что каждый прогон длится фиксированные 5 минут.

Страница 7 из 8