pimenov.ai

Первое большое интервью Тибо Соттио из OpenAI: саммари и полный перевод

Мэттью Берман записал первое большое видеоинтервью с Тибо Соттио, руководителем Codex в OpenAI. Саммари главного и полный перевод разговора.

ИИCodexИИ-агенты

Накануне Мэттью Берман опубликовал первое большое видеоинтервью с Тибо Соттио, руководителем Codex в OpenAI. Для многих в X Тибо до сих пор оставался «человеком, который нажимает кнопку сброса лимитов»: его посты собирали сотни тысяч просмотров, а вокруг сбросов выросли трекеры, каналы уведомлений и мемы.

Я недавно разбирал эту историю и пришёл к выводу, что сбросы — хорошо поставленный маркетинг: повторяющийся ритуал, который снимает напряжение и возвращает людей в продукт. Интервью Бермана показывает обратную сторону картины. Из разговора видно, что за кнопкой стоит продуктовая философия: компенсация за сбои, прямой контакт с пользователями и ставка на то, что технология должна дешеветь и становиться доступнее.

Разговор получился длинным: от DeepMind и невыпущенного чат-продукта Google до слияния ChatGPT и Codex, сверхбыстрого режима ultra fast и паузы в обучении фронтирных моделей. Формат материала такой: сначала саммари главного, затем полный перевод интервью.

О чём говорит Тибо: главное из интервью

  1. Путь в OpenAI. Тибо работал в DeepMind над инфраструктурой для исследований. Внутренний чат-продукт на языковой модели появился там примерно за год до ChatGPT, но Google не решилась его выпустить. В OpenAI его привели миссия, плотность таланта и культура, где исследования и продукт проектируются вместе, а новые идеи быстро доводятся до релиза.
  2. Слияние ChatGPT и Codex. По его словам, будущие модели сами «требуют» объединения: под капотом это одна технология и один харнес. Цель — персональный AGI, который подстраивает интерфейс под конкретного человека: «вы и ваша мама будете пользоваться одним и тем же продуктом».
  3. Откуда взялись сбросы лимитов. Это началось не как маркетинг, а как компенсация за сбои: если команда что-то ломала, пользователям возвращали квоту. Решение не согласуется с маркетингом и финансами: «я могу нажать кнопку, когда почувствую, что это правильно». Физическая кнопка, кстати, существует.
  4. Цены падают благодаря самим моделям. OpenAI заранее заложила вычислительные мощности, а теперь использует фронтирные модели, чтобы перепроектировать собственный инференс-стек. Результат: Luna подешевела на 80%, а скорость ответов за три месяца выросла примерно на 60%. Тибо называет это формой рекурсивного самоулучшения: модели оптимизируют инфраструктуру, на которой сами работают.
  5. Ultra fast и будущее скорости. Режим с генерацией до 14 раз быстрее обычного внутри компании выдают не всем: основную мощность резервируют для клиентов, а внутри он нужен при инцидентах и критичных задачах. Через год-два такие скорости, по его оценке, станут почти стандартом.
  6. Моделям тесен ноутбук. Следующему поколению моделей нужно больше ресурсов, чем даёт один компьютер: облачные агенты, параллельная работа, голос. «Через два-три месяца Codex покажется примитивным» — это цитата из недавнего поста Тибо, которую Берман попросил раскрыть.
  7. Пауза фронтирного RL-обучения. Решение принимала команда безопасности, чтобы укрепить систему перед перезапуском. Тибо подчёркивает: OpenAI будет делать такие паузы всегда, когда это необходимо.
  8. Совет тем, кто боится ИИ. Его ответ простой: технология со временем дешевеет, доступ к ней расширяется, а начать можно с того, чтобы посмотреть, как ИИ уже помогает другим: от работы с текстами до подготовки к визиту к врачу.
Notion image

Полный перевод интервью

От DeepMind к OpenAI

Мэттью Берман: Очень рад. Тибо, большое спасибо, что пришёл.

Тибо Соттио: Конечно, рад быть здесь.

Мэттью Берман: Я очень хотел с тобой поговорить. Начну с твоего времени в Google. Ты был в команде DeepMind, и ещё до ChatGPT у Google был продукт под названием LM Chat. Ты писал, что Google слишком нервничала, чтобы его выпустить, а DeepMind не давали выводить продукты, которые могли бы пошатнуть основной бизнес. Я часто об этом думаю. Что ты сам чувствовал тогда, работая над этими продуктами задолго до того, как ChatGPT изменил мир?

Тибо Соттио: Это было очень интересное время. DeepMind — невероятно креативное место. Я в основном занимался своей специальностью: инфраструктурой и продуктами, которые ускоряют исследования. Была группа, которая работала над языковыми моделями и их масштабированием, и они получили уже довольно хорошие результаты. Естественным образом возникла мысль: а что если превратить это во что-то, с чем можно разговаривать и использовать для разных задач? Так появилась идея чат-продукта. Он был внутренним, но амбиции были: сделать его публичным инструментом.

Мэттью Берман: Какой это был год?

Тибо Соттио: Примерно за год до ChatGPT.

Мэттью Берман: Понятно.

Тибо Соттио: Мы тогда строили и много другого, о чём я говорить не буду. Но место было очень креативное. При этом DeepMind не был заточен под выпуск продуктов. OpenAI в этом смысле совершенно другое место: исследования и продукт работают очень тесно. Мы вместе придумываем идеи, вместо проектируем. У нас сильная установка выпускать продукты и делать их доступными людям, и я это очень люблю. Именно это меня сюда и привело: миссия, люди, плотность таланта. В OpenAI много всего замечательного.

Мэттью Берман: Когда ты работал над LM Chat, ты понимал, что это нечто особенное или станет особенным?

Тибо Соттио: Ощущалось как особенное. Это был первый момент, когда ты понимал: модель выдаёт связный текст и что-то полезное. Поначалу это было скорее забавно, чем полезно, а потом постепенно становилось всё полезнее.

Культура, которая умеет выпускать продукты

Мэттью Берман: Ты говоришь, что часто об этом думаешь, и я понимаю почему: во многом Google сама себе мешала. Какие уроки ты вынес из того времени и взял с собой в OpenAI?

Тибо Соттио: Именно поэтому я об этом и думаю. Я смотрю на это через призму культуры моей команды и культуры OpenAI в целом: что сохранить и как не надо делать. У OpenAI очень «снизу вверх» устроенная, наделяющая полномочиями культура. Люди могут прийти с любой идеей, собраться и очень быстро что-то выпустить. Энергии «стоп» для новых продуктовых идей здесь очень мало, и это будоражит. Всё это про влияние на мир в позитивном смысле, и сохранить такую культуру для меня очень важно.

Тибо Соттио: Второе — не превратить всё это в хаос. Нельзя допустить нагромождение функций без общего направления и цельности. Поэтому это уравновешивается тягой к простоте и гордостью за качество продукта. Приложение ChatGPT для iOS — одно из лучших приложений на рынке, и мы хотим это сохранить. Мы много инвестируем в такие вещи, как удовольствие от использования, производительность, эффективность, простота. Эти принципы действуют на всех, и при этом каждый может пробовать новое и быстро выпускать.

Мэттью Берман: Что бы ты посоветовал основателю, который хочет выстроить такую культуру? Какие конкретные практики внутри OpenAI можно перенять?

Тибо Соттио: Нужна убеждённость и умение находить пользователей и очень быстро учиться на их обратной связи. Плюс готовность самому себя «подрывать». Для основателя это менее актуально, а вот для компаний уровня OpenAI — очень. У нас постоянно появляются новые исследования и идеи, и важно уметь определить момент, когда в них нужно вложиться, даже если для этого приходится перебрасывать ресурсы с основного направления. Это очень важно и очень трудно одновременно. Но уметь это делать необходимо.

Мэттью Берман: Это ровно то, чего Google, по твоему описанию, сделать не смогла.

Тибо Соттио: Справедливости ради: у них был план, и всё это было частью большого плана. Но лично для меня это было не то место.

Мэттью Берман: Становится ли сложнее сохранять культуру быстрых релизов и готовность себя дисраптить по мере взросления компании? Особенно когда у тебя есть «дойная корова», которая печатает деньги, а рядом какая-то новая штука, которая может оказаться классной и инновационной.

Тибо Соттио: Мы очень нацелены вперёд. Будущее ИИ и то, как оно принесёт пользу человечеству, не ждёт и не считается с тем, что ты уже построил, и с тем, что будет через месяц или три. Важно вкладываться и смотреть на всё открытыми глазами, а потом решать, как встать так, чтобы поймать волну. Даже в OpenAI мы обучаем модели, а потом открываем их возможности. Бенчмарки не рассказывают всего. С моделями нужно довольно много играться, чтобы понять: оказывается, из этого можно извлечь пользу вот так, или оказывается, она умеет вот это. И тут ты понимаешь, что это меняет представление о продукте.

Тибо Соттио: Свежий пример: мы выпустили новый голос ChatGPT, и с ним очень приятно разговаривать, он очень естественный. Теперь он умеет пользоваться инструментами, и это меняет дело. Я стал гораздо больше времени просто разговаривать с ним. Второе, что я делаю постоянно, — диктовка: её качество настолько хорошее, что это гораздо эффективнее, чем печатать промпт. Утром я сижу с телефоном и просто наговариваю: сделай для меня вот это и вот это. И оно идёт и делает, у него есть доступ ко всем моим инструментам. До появления хороших голосовых моделей это было невозможно. И это мгновенно меняет то, как ты думаешь о продукте.

Харнес, память и конец эпохи ноутбука

Мэттью Берман: Продолжим про новые модели и новые харнесы. Начну с ещё одного твоего поста, потому что у тебя они огонь. «Через два-три месяца Codex покажется примитивным. Нас ждёт очередная крупная эволюция. Следующему поколению моделей нужно больше, чем твой ноутбук». Начнём с харнеса: какие его части ещё созрели для инноваций по мере того, как модель становится лучше?

Тибо Соттио: Очень многие. Я уже говорил про голос. Ещё пример: если ты продвинутый пользователь Codex или любого другого coding-агента, ты уже привык к некоторой неуклюжести. Тебе приходится управлять файлами скиллов — таким способом «обучать» агента. И многие поняли, что со временем это тяжело поддерживать. Память вроде бы есть, но она не всё запоминает. Если у тебя есть субагенты, приходится за ними следить и строить маленькую сеть. Иллюзия регулярно разбивается на разных участках взаимодействия. А на самом деле хочется просто нечто, что глубоко понимает тебя, твои цели, твои будни и то, чем занимается твоя команда. Что реагирует, проявляет инициативу и просто помогает тебе изо дня в день, не разрушая иллюзию идеального напарника. Мы к этому и идём. Ещё вещь, которую понимаешь с очень мощными моделями: твой ноутбук сам по себе становится ограничением. Он проектировался для людей: рассчитан примерно на тот объём работы, который ты способен выдать, на скорость твоих мыслей и печати, на количество приложений, которые тебе нужно держать открытыми. Всё это человеческие ограничения. У модели их нет. Она, например, вполне справится с сотней одновременно открытых приложений. Поэтому с точки зрения доступа к ресурсам совершенно ясно: моделям будущего понадобится больше, чем ресурсы твоего ноутбука.

Мэттью Берман: Полагаю, ты про облачных агентов. И ещё момент: когда появляются режимы вроде ultra fast — заявленная цифра, кажется, в 14 раз быстрее обычного «быстрого» — меняется сама природа узкого места. Процессор фактически становится пропускной способностью, буквально вызовы инструментов...

Тибо Соттио: Да, вызов инструмента по сети, любые накладные расходы в стеке становятся ограничивающим фактором. Но это можно компенсировать параллелизмом: одновременно исследовать одну гипотезу, писать тесты, компилировать, проверять новую идею. Ты просто перемещаешь узкое место, потому что успеваешь больше. И модель при этом умеет очень быстро и эффективно по этому проходить.

Мэттью Берман: При нынешних скоростях я запускаю по десять-пятнадцать агентов параллельно, и это серьёзная когнитивная нагрузка: постоянно переключаться, потому что после запуска задачи ждёшь тридцать-сорок пять минут. С ultra fast этот рабочий процесс сильно меняется, и я вряд ли смогу держать десять-пятнадцать агентов. Может, это и к лучшему: три-четыре одновременно. Как, по-твоему, будет меняться работа разработчика-одиночки?

Тибо Соттио: Управление вниманием и бережное к нему отношение — то, о чём мы очень заботимся. Мы строим для людей, мы хотим сделать технологию максимально наделяющей человека силой. Для этого нужно строить вокруг твоей способности к многозадачности, вокруг того, как ты хочешь распоряжаться своим вниманием: показать это сейчас или лучше через полчаса. Когда ультравысокие скорости соединяются, например, с голосом, вдруг оказывается, что эта штука работает с твоей скоростью или быстрее. Ты остаёшься в потоке: придумываешь, смотришь прототипы, собираешь маленькие отчёты в реальном времени. И это просто хорошо ощущается. Вдруг ты понимаешь: то, чем я занимался раньше, эта многозадачность с десятью агентами, — я туда возвращаться не хочу. Мы хотим сделать опыт очень естественным, чтобы он ощущался сделанным под тебя и чтобы не ты подстраивался под технологию, а она под тебя.

Мэттью Берман: За последние месяцы обсуждали много техник агентного программирования. Циклы были популярны и остаются, теперь я слышу про графы. Это всё способы помочь разработчику-одиночке управлять вниманием или «быть дружелюбным к своему вниманию», как ты сказал? Мне нравится эта формулировка.

Тибо Соттио: Я делю это на две категории задач. Первая — построить лучший персональный AGI, персонального агента, который находится с тобой в одном потоке: проявляет инициативу, поднимает важные новые идеи, когда находит их, очень эффективно делает ровно то, что тебе нужно. Неважно, техническая это задача, исследование или совет. Он справится со всем и будет очень точно под тебя заточен. Это глубоко укоренено в понимании тебя как человека и уникального индивида. Мы очень сильно на это давим. Вторая категория — полноценная автоматизация, когда ты строишь интеллектуальные системы, которые берут на себя очень сложный процесс, требующий интеллекта. Например, просмотр production-логов и автоматическая оптимизация производительности. Поиск регрессий и их автоматическое исправление. В кибербезопасности мы видим то же самое: сканер нашёл уязвимость — можно ли автоматически закрыть её патчем и свести окно, в котором уязвимость открыта, почти к нулю?

Мэттью Берман: И всё это без человека в цикле?

Тибо Соттио: Без человека в цикле или с минимальным участием: тебе нужно только подтвердить действие с высоким риском. Это в основном автоматизированная система, и твой прямой контроль ей не так уж нужен.

Слияние ChatGPT и Codex

Мэттью Берман: Сменю тему. ChatGPT и Codex последние месяцы идут к слиянию. Как это проходит? Как ощущается изнутри? Что говорят клиенты?

Тибо Соттио: Это принесло огромную пользу. Первой реакцией было: зачем их объединять, правда что ли надо? А дело в том, что будущие наши модели хотят, чтобы мы были единым целым. Мы просто делаем это, потому что это простое и правильное решение: мы строим очень персонального, очень способного агента, который помогает во множестве дел. Под капотом это одна и та же технология, тот же харнес, тот же взгляд: высокая мультимодальность, голос в первую очередь, высокая эффективность. И неважно, пишешь ты код или нет: агент способен на всё и делает это наилучшим образом. Интерфейс должен подстраиваться под твои нужды. Не должно быть так, что ты сначала решаешь: «я программист, мне нужен интерфейс программиста» или «я не технарь, мне нужен нетехнический интерфейс». Люди — это спектр. Ярлыки вроде «инженер-программист» или «дизайнер» — человеческие конструкции, которые мы придумали, чтобы справляться со сложностью мира. А люди индивидуальны, каждый где-то на этом спектре. Поэтому мы строим идеальный интерфейс, который подстраивается под каждого, технарь ты или нет. Вот почему мы это сделали.

Мэттью Берман: Значит, в конце будет единый интерфейс? Без выпадающего списка продуктов? Странно представить, что моя мама будет пользоваться тем же самым интерфейсом, что и я. Понятно, что он подстроится: мне, возможно, нужно больше информации для сложной работы. Каким ты видишь конечное состояние?

Тибо Соттио: Именно так. Это одна и та же вещь. Ты и твоя мама будете пользоваться одним и тем же. Это будет ваш персональный AGI. У вас будут очень разные задачи и очень разная польза от него. Вы подключите его к разным инструментам своей жизни, принесёте разные идеи и разные потребности, а он будет и дальше подстраиваться, чтобы приносить максимум пользы именно тебе. И так же — с твоими друзьями и со всеми остальными.

Мэттью Берман: Вернёмся к сказанному: ты пару раз употребил слово «иллюзия». Что такое эта идеальная иллюзия в конечном состоянии? Если представить нас через несколько лет, как выглядит взаимодействие человека и ИИ?

Тибо Соттио: Для меня это нечто очень глубоко приспособленное к людям. Именно поэтому большие языковые модели и стали успешными: естественный язык — человеческая концепция. Мы привыкли разговаривать друг с другом. Если ты завтра напишешь мне письмо, я смогу его прочитать: мы уже неплохо знаем друг друга, я смогу различить немного эмоции, немного нюанса между строк. Всё это очень по-человечески. Технология, которую мы строим, укоренена в человечности и в том, как люди общаются и делают дела. Не должно быть ситуаций, когда «ты меня не так понял, потому что не различил нюанс в моей интонации или неправильно понял текст». Мы стараемся этого избежать и хотим, чтобы не ты приспосабливался, а технология была естественным продолжением того, как люди уже действуют в мире.

Мэттью Берман: В человеческом общении очень много невербального: как я двигаю руками, мимика. Как много из этого, по-твоему, в будущем будет считывать ИИ — например, через зрение? Важно ли это вообще? Ты описываешь мир текста, а те, кто вырос в интернете, привыкли общаться текстом и добавлять в него тонкости. Важно ли, чтобы ИИ читал выражение лица и жесты?

Тибо Соттио: Думаю, да. Будущее того, что мы строим, очень «окружающее» и естественное. Завтра я приду в офис, напишу что-то на маркерной доске, и у меня возникнет идея — агент должен уметь «присутствовать» там же и понимать. Или я скажу ему: «а что если вот так?» — и мы просто естественно поговорим голосом. С тех пор как мы выпустили новый голос ChatGPT, он по-настоящему выстрелил: количество пользователей, которые общаются с ChatGPT только голосом, сейчас очень быстро растёт. И урок в том, что каждый раз, когда ты делаешь шаг к более естественному, люди выбирают путь наименьшего сопротивления. Печатать в маленьком окошке может быть естественно для некоторых из нас, но не для всех. Стоит сделать что-то чуть проще и чуть лучше — и люди переходят на это.

Конкуренция с Anthropic

Мэттью Берман: Сначала поздравляю: видел твой утренний пост, Codex достиг 20 миллионов пользователей. Я видел график: долго было вот так, а потом вертикально вверх. Поздравляю! Хочу поговорить про конкуренцию с Anthropic: многие считают, что OpenAI и Anthropic — два главных соперника в индустрии. Был период, когда Anthropic буквально выкачивала весь кислород из комнаты. Они доминировали, а потом что-то изменилось. Как ты читаешь рынок сегодня?

Тибо Соттио: Сейчас мы сосредоточены на том, чтобы строить самые способные модели, делать их максимально эффективными и с гордостью строить продукты для всех. OpenAI делает это очень хорошо: заботится о мире и о том, как передать эту очень мощную технологию в руки как можно большего числа людей. Именно это мы сделали и со слиянием Codex и ChatGPT: у нас есть технология, мы можем сделать её безопаснее и проще для всех — для продакт-менеджера, дизайнера, людей из продаж, маркетинга, коммуникаций. И очень быстро распространить её через ChatGPT, где уже огромная аудитория. Это и драйвит тот рост, о котором ты говоришь. А на конкурентов я стараюсь не смотреть. Я смотрю на то, что мы можем делать уникально хорошо, на наши ценности и на то, как максимально ускориться в этом направлении.

Мэттью Берман: Позволь чуть докопаться. Я знаю, ты не думаешь об Anthropic постоянно, но другие думают: какому продукту верить, какому отдать свои две тысячи двести долларов? Если сравнить позиционирование, тон и то, как OpenAI общается с разработчиками и широкой аудиторией, с тем, как это делает Anthropic, — как ты видишь это сравнение?

Тибо Соттио: Мне снова важно вот что: сообщество и строительство для мира, когда ты ведёшь за собой всех. Это чувствуется в том, какие мы. Мы очень открыты. Мы берём много идей из сообщества, и это, честно, очень весело, потому что мы получаем от этого огромную энергию. Мы строим эту технологию не для себя и не только чтобы ускорить одну OpenAI. Миссия очень важна, и именно оттуда наша энергия. Ощущается это очень приземлённо и весело, а хорошие вещи происходят как следствие.

Откуда взялась кнопка сброса

Мэттью Берман: Поговорим о хороших вещах. Хочу спросить про сбросы, Тибо. Все следят за каждым твоим постом именно из-за этого. Если снова посмотреть на кривую роста Codex: может, глупый вопрос, но насколько сбросы — это вклад в маркетинг и рост, а насколько просто добрая воля к сообществу разработчиков?

Тибо Соттио: Может, это звучит нелогично, но OpenAI — место, где можно просто делать вещи. Поначалу было просто правильным компенсировать, когда мы что-то ломали в процессе итераций или что-то неправильно настроили и работало хуже, чем хотелось. Мы говорили: «Спасибо, что пробуете продукт. Мы очень стараемся, это ранние дни. Вот вам дополнительное использование, потому что мы случайно сломали его на полчаса. Мы понимаем, это важно для вас, вы на него полагаетесь. Спасибо, что вы наш пользователь». Так это началось, и я до сих пор отношусь к этому так же. Если мы что-то ломаем или опыт неоптимален и мы не до конца понимаем почему, — мы компенсируем. Мы сбрасываем лимиты. Потом это превратилось в целую историю, появилась настоящая кнопка сброса. Но за этим нет большого аппарата согласований: это не делается вместе с маркетингом или финансами. Я просто могу нажать кнопку, когда захочу, когда чувствую, что это правильно. У нас есть принципы: мы стараемся строить нечто потрясающее, а когда это не так — мы это компенсируем.

Мэттью Берман: Я всё же думаю, что это принесло огромную доброжелательность сообщества и, возможно, внесло свой небольшой вклад в рост.

Тибо Соттио: Забота о пользователях и культура многое решают. Можно на словах говорить, что тебе не всё равно, а можно по-настоящему заботиться: «сломали — простите, вот как мы это компенсируем».

Мэттью Берман: Напоминает политику возвратов Amazon: если что-то не устроило, просто отправь обратно. Ты строишь такую же культуру и такое же восприятие OpenAI: если мы ошиблись — используйте эти токены ещё раз, вот вам свежая порция. Я это очень ценю.

Тибо Соттио: Есть и хорошие моменты, когда мы просто хотим отпраздновать и отметить событие. Нет ничего более значимого, чем можно поделиться. Мы постоянно выпускаем новые функции и выкатываем их максимально широко, а тут есть чем поделиться со всем сообществом: «Вот, попробуйте новую штуку. Вы ещё не пробовали Ultra — вот вам дополнительное использование, попробуйте».

Мэттью Берман: И я слышал, что теперь существует настоящая физическая кнопка?

Тибо Соттио: Да, есть. Я покажу тебе её после. Она очень классная.

Эффективность, цены и рекурсивное самоулучшение

Мэттью Берман: Но такие сбросы возможны, только если вы серьёзно планировали вычислительные мощности: нужно иметь достаточно compute, чтобы всё это раздавать. Хочу перейти к самоулучшению. Несколько недель назад вы опубликовали статью, где говорилось, что Sol оптимизировал эффективность Luna. Вы снизили цену Luna на 80%, было снижение цены и на Terra. Насколько это алгоритмический выигрыш, а насколько — просто отличное планирование мощностей и хорошая маржа?

Тибо Соттио: Мы планировали мощности очень заранее. Если вспомнить два года назад, OpenAI спрашивали, зачем такие огромные инвестиции в compute.

Мэттью Берман: Одна из тех безумно удачных ставок.

Тибо Соттио: Да, и сейчас мы очень рады, что она у нас есть. Очень большая доля мощностей уходит на исследования — это инвестиции в будущее и во всё лучшие модели. И вот что удивительно: когда мы двигаем фронтир возможностей самых продвинутых моделей, мы можем использовать эти модели, чтобы очень быстро понять, как перестроить и переинжинирить наш стек и получить очень значительный выигрыш в эффективности или производительности. Мы улучшили не только себестоимость — об этом мы ещё опубликуем — но и скорость. Даже без ultra fast всё заметно ускорилось: если построить график, сейчас вы получаете примерно на 60% больше скорости, чем три месяца назад. Мы проходим по всему стеку и стараемся спроектировать и заинжинирить его оптимально под наши нагрузки. Именно самые мощные модели позволяют нам делать это очень маленькой командой. Когда мы получаем значительный выигрыш в эффективности и себестоимости, наше обязательство — удерживать фронтир по производительности и цене и не просто класть разницу в карман, а делиться ею с клиентами и пользователями. Именно это мы сделали с Luna.

Мэттью Берман: Как внутри выглядят споры о распределении мощностей между исследованиями новых моделей, оптимизацией существующих и инференсом?

Тибо Соттио: Обычно мы смотрим на всё от первых принципов. Есть аллокация на исследования, есть на продукт, а внутри продукта уже идут разные компромиссы. Но этот случай почти не был компромиссом: выигрыш в эффективности уже был, и мы фактически смогли в том же вычислительном конверте обслужить очень значительный рост пропускной способности.

Мэттью Берман: Когда я читал ваш пост за несколько месяцев до снижения цен — про то, как одна модель обучает следующую или помогает её оптимизировать, — а потом увидел выигрыш, которого Sol добился, наблюдая за работой Luna, мне это показалось ранними иннингами рекурсивного самоулучшения. Это оно и есть?

Тибо Соттио: Рекурсивное самоулучшение сейчас огромная тема, и чаще всего её применяют к исследованиям: модели, разрабатывающие другие модели. Но у нас огромный успех в другом: мы используем модели для разработки инфраструктуры, которая лежит на критическом пути использования этих же моделей. Это тоже форма рекурсивного самоулучшения. Это одна большая система: инференс-стек, железо, CUDA-ядра, которые мы используем; разработка новых продуктов и более эффективных способов взаимодействия с моделями. Ты упомянул облачных агентов: если мы по-настоящему раскуём облачных агентов, ты вдруг станешь гораздо продуктивнее. Это форма рекурсивного самоулучшения? В каком-то смысле я считаю, что да, хотя она гораздо больше про инфраструктуру и про умение направить её обратно на саму себя. Конечно, мы это делаем. Было бы глупо этого не делать.

Пауза фронтирного обучения

Мэттью Берман: Раз уж мы заговорили о рекурсивном самоулучшении: Сэм Альтман говорил о паузе в обучении абсолютного фронтира RL. Расскажи об этом решении. Мы уже кратко обсуждали инцидент с Hugging Face, но что стояло за этим решением? Как шли обсуждения?

Тибо Соттио: Это очень исследовательская история. OpenAI всегда умела вкладывать ресурсы туда, где они важнее всего. По мере роста возможностей моделей очевидно, что выравнивание и безопасность становятся всё важнее, и огромные инвестиции в это направление для нас естественны. Мы видим сейчас мощный рост этих вложений. Пауза была нужна, чтобы команды и люди смогли по-настоящему разобраться и укрепить все части системы и затем перезапустить обучение уже с полным контролем. Думаю, OpenAI всегда будет так поступать, когда это необходимо. Я ни разу не видел, чтобы мы внутри не могли принять такое решение быстро и эффективно.

Мэттью Берман: Была ли заранее заданная цель, после которой можно снимать паузу, или это было «поймём, когда увидим»?

Тибо Соттио: Это зона команды безопасности. Для них это в большой степени дискуссия и исследование по ходу дела. Но в итоге они пришли к довольно чёткому набору принципов: когда они достигнуты, мы в хорошей позиции.

Ultra fast внутри OpenAI

Мэттью Берман: Вернёмся к ultra fast. Люди недооценивают, что открывает такая скорость. Какие сценарии использования вы используете внутри, которые были невозможны до таких токенов в секунду?

Тибо Соттио: Чаще всего это ситуации с высокими ставками. Например, когда у нас инцидент, руководитель инцидента и команда реагирования получают доступ к ultra fast, потому что каждая секунда на счету. Ещё есть забавное: команды, которые работают над чем-то критичным — или считают, что работают над чем-то критичным, — всегда просят ultra fast. Питомцы под это не подпадают, кстати. Это не гиперкритично, но я обожаю своего питомца. Он всегда у меня на экране. Ходишь по офису — у людей питомцы на экранах, они подключаются к видеозвонкам. Это очень мило и каждый раз меня радует. Но питомец не критичен, хотя мы за ним хорошо ухаживаем. А вот если кто-то работает над новой идеей и говорит: «Кажется, это может быть чем-то особенным, надо попробовать, но в понедельник нужно решить, включаем ли мы это в DevDay», — конечно, бери ultra fast. У людей разные предпочтения: кто-то однопоточный, кто-то любит многозадачность. Тем, кто любит многозадачность, ultra fast даёт меньше. А есть люди, которые не любят постоянно менять контекст.

Мэттью Берман: А ты где на этом спектре?

Тибо Соттио: У меня СДВГ, я переключаю контекст постоянно.

Мэттью Берман: Смешно: у меня тоже СДВГ, но я как раз не хочу постоянно переключаться, мне это тяжело. Я хочу сосредоточиться на двух-трёх вещах, поэтому и обрадовался ultra fast. Забавно, что у тебя наоборот.

Тибо Соттио: Я процветаю в переключениях и в куче маленьких решений. Но иногда хочется остаться в одном фокусе, и тогда ultra fast прекрасен: он держит тебя прямо в потоке. Важно понимать: ultra fast работает потрясающе, когда мало вызовов инструментов или нужно сгенерировать много контента. Прототип сайта или видеоигры, где надо просто написать много кода, он сделает в десять раз быстрее. Но если много вызовов инструментов, накладные расходы сидят в сети или где-то ещё в траектории агента, и ты почувствуешь ускорение в три-четыре раза, а не полные четырнадцать.

Мэттью Берман: Насколько я знаю, сотрудники OpenAI получают безлимитные токены. Будь у меня безлимит, я бы всегда ставил max thinking на последнюю модель и всегда включал ultra fast: когда цена не имеет значения, выкручивай всё на максимум. У вас внутри так и есть?

Тибо Соттио: Мы не даём ultra fast всем. Значительную часть мощностей мы резервируем для внешних пользователей и клиентов. У сотрудников OpenAI есть возможность поглотить всё: все production-GPU, весь ultra fast. Мы бы всё это использовали, но не делаем этого. Мы себя ограничиваем: смотрим, сколько разумно нам использовать, чтобы понимать продукт, продолжать его улучшать и получать пользу от рекурсивного самоулучшения. Но подавляющее большинство зарезервировано для клиентов.

Мэттью Берман: Хорошо. А какие чувствительные к задержке сценарии за пределами OpenAI тебя больше всего воодушевляют?

Тибо Соттио: Меня очень воодушевляют нетекстовые взаимодействия. Работа на общем холсте: создавать вещи, генерировать идеи и варианты изображений, выбрать один, «выбери своё приключение», быстрый макет прототипа, который ты направляешь в реальном времени голосом или текстом и сразу видишь результат. Это очень творческий процесс, и такие скорости его позволяют. Инженеру иногда приходится откинуться и сказать себе: мне нужно спроектировать всю систему, продумать компромиссы и требования. А может, можно просто создать её за минуту и посмотреть, как она работает на деле? И быть больше в потоке. Думаю, эти скорости это дают.

Что станет со скоростями и ценами

Мэттью Берман: Предполагаю, ultra fast будет стоить заметно дороже обычной скорости. Как думаешь, ультравысокие скорости станут стандартом или всегда останутся премиальной опцией?

Тибо Соттио: Как обычно бывает с технологиями, со временем они станут доступнее и шире. Скорости, с которыми агенты делают работу, продолжат расти: мы видим огромные улучшения месяц за месяцем. Это не только скорость инференса, но и токен-эффективность моделей: Sol заметно экономичнее Terra, следующая модель будет экономичнее Sol — как ты понимаешь. Мы постоянно давим на это, и инференс-железо тоже становится быстрее. Думаю, через год-два эти скорости станут если не стандартом, то очень близко к нему. Но всегда будет и уровень выше: больше железа, другие компромиссы, дороже, зато с чем-то дополнительным.

Совет тем, кто боится ИИ

Мэттью Берман: Тибо, последний вопрос, которым я обычно заканчиваю, — для широкой аудитории. Многие нервничают из-за ИИ: автоматизация работы, влияние на экологию, просто ощущение чего-то чужого. Что бы ты сказал таким людям в поддержку?

Тибо Соттио: Мы действительно строим для мира. С ChatGPT мы очень инвестируем в эффективность, и это напрямую связано с широким доступом и пользой: чем дешевле обслуживание, тем больше ты можешь сделать и тем больше получаешь в повседневной жизни. Эффективность уже очень выросла. Посмотрите на Luna: модель намного меньше, невероятно эффективная, а полгода назад она была бы на фронтире. И посмотрите на её цену — это просто феноменально.

Мэттью Берман: Вы недавно сделали это с Reply: теперь она отдаётся бесплатно.

Тибо Соттио: Да, в бесплатном режиме. Доступ к невероятному интеллекту станет повсеместным, и это возможно, только если мы месяц за месяцем, год за годом давим на эффективность. То, что сегодня фронтир, через полгода будет стоить намного дешевле. Поэтому мой ответ такой: технология умеет со временем становиться очень эффективной. Мы сосредоточены на широком доступе и оптимизируем непосредственно ту пользу, которую ты из этого получаешь.

Мэттью Берман: А тем, кто боится даже попробовать ИИ в первый раз? Что ты им говоришь и как рисуешь будущее, в котором ИИ помогает миру?

Тибо Соттио: Далеко ходить не надо. ChatGPT помогает людям очень личными и глубокими способами. Многие используют его для помощи с текстами, но также для личных советов и даже медицинских вопросов. Мы запустили направления здоровья и финансов, я пользуюсь ими регулярно и получаю поддержку, которую иначе получить было бы трудно: например, я прихожу к врачу более информированным. Не нужно далеко ходить, чтобы увидеть пользу. Поговори с другими, вдохновись тем, как они это используют, — отличный способ начать думать, как это может пригодиться тебе.

Мэттью Берман: Тибо, большое спасибо. Было очень ценно.


Следующий шаг

Как OpenAI превратила сбросы лимитов Codex в петлю роста

Связанные материалы

Если вы строите продукт и думаете, как выстроить такую же прямую связь между командой и пользователями, этот разговор полезно обсудить вместе с продуктовой командой и поддержкой.

Если захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov