GPT-Live-1 появился в API: живой разговор для ваших приложений
OpenAI открыла GPT-Live-1 в API. Голосовой агент может слушать во время ответа и работать с выбранными разработчиком моделями. Короткое видео.
OpenAI объявила о доступности GPT-Live-1 через API. Теперь разработчики могут встроить в своё приложение голосовой диалог, в котором агент слушает человека даже во время собственного ответа. Можно уточнить мысль по ходу разговора, не дожидаясь конца реплики.
Ещё одна деталь из анонса: голосовой агент работает с моделями и средой исполнения, которые выбирает разработчик. Это даёт возможность добавить разговорный интерфейс к собственной логике приложения.
Для меня здесь особенно интересна возможность собирать личных голосовых помощников на базе простых устройств под свои задачи. Я вижу это так: небольшое устройство с микрофоном и динамиком, связь по Wi-Fi или через Bluetooth с телефоном, а работа с мощной голосовой моделью — через приложение и API. Самому устройству не нужно выполнять вычисления модели. Хочется, чтобы такого помощника можно было настроить под себя и обращаться к нему голосом, когда он нужен.
Практический смысл хорошо виден на примере помощника службы поддержки: человек может поправить условие прямо во время объяснения. Насколько удобно это работает в конкретном продукте, нужно проверять на его сценариях. Ниже короткая демонстрация OpenAI.
Следующий шаг
GPT-Live: голос, который слушает и говорит одновременно
Связанные материалы
Статья: Не диктовка, а диалог: новый голосовой режим Codex
Блог: Голосовой ChatGPT теперь может подключать Astra
База знаний: OpenAI — линейка моделей GPT, Realtime и Images
Если вы продумываете голосового помощника для команды или клиентов, начать можно с одного рабочего сценария.
Если захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov
Если хотите разобрать свою задачу — напишите мне Если хотите разобрать свою задачу — напишите мне.
Можно прийти с идеей, черновым контекстом или уже живой задачей. Помогу быстро понять, где реальный следующий шаг, а где лишний шум.
Обычно хватает 2–3 сообщений, чтобы понять, могу ли я здесь реально помочь и в каком формате лучше двигаться дальше.
Дальше по теме
Закрыли весь аудиослой pimenov.ai: 365 аудиоматериалов, 21 час 25 минут звука и около 933 ₽ за всю генерацию через Яндекс SpeechKit.