OpenAI: автоматизированный стажёр-исследователь — считать агенто-дни

· 5 минут чтения · Любовь Черемисина · OpenAI AI-агенты · СегодняВажноПрактика · Аудио

6 сентября 2026 OpenAI сообщила, что достигла уровня автоматизированного стажёра-исследователя: под контролем человека система закрывает чёткую задачу, на которую у специалиста ушло бы несколько дней. Следующая цель — автоматизированный исследователь к марту 2028. Единица ёмкости — агенто-дни на одного человека.

Научная гравюра на кремовой бумаге: один человек у пульта и четыре параллельные линии агентов со счётчиком агенто-дней — метафора ёмкости исследования, а не одной модели

Коротко

  • Что объявили: 6 сентября 2026 OpenAI сообщила, что по своим замерам достигла цели осени прошлого года — уровня автоматизированного стажёра-исследователя (в их терминах — research intern).
  • Что это значит: система под руководством человека выполняет чётко поставленную исследовательскую задачу, на которую у специалиста ушло бы несколько дней.
  • Главное ограничение: это не «модель сама ведёт науку». Люди задают приоритеты, отбирают идеи и решают, масштабировать, остановить или выпустить систему. Больше половины успешных задач на 4–8 часов всё ещё требуют хотя бы одного вмешательства человека.
  • Главное последствие: единица ёмкости смещается с «сколько людей с подпиской» к агенто-дням на одного человека (дни работы агента) — сколько дней работы агента реально принято на один человеко-день.

Что изменилось

В тексте об ускорении исследований внутри OpenAI компания показывает не новый чат и не новую кнопку, а снимок внутренней практики исследовательской организации к середине августа 2026 и прогресс к заявленным вехам.

Две вехи по их формулировке:

ВехаСрокСмысл
Автоматизированный стажёр-исследовательсентябрь 2026 (цель достигнута по замерам OpenAI)Под контролем человека закрыть чёткую задачу на несколько дней специалиста
Автоматизированный исследовательмарт 2028 (следующая цель)Более сильный уровень автоматизации исследования при сохранении человеческого контроля

Внутренние цифры середины августа (как у OpenAI; методы — в приложении к публикации):

ПоказательЗначение
Медиана трат на запросы к моделибольше $600 в день по ценам программного интерфейса (API)
90-й перцентильбольше $7000 в день на токены
Агенто-дни на 1 человеко-день3,1 (в пересчёте на стандартный 8-часовой день)
Параллельностьрастёт доля сценариев с 4 и более агентами одновременно
Эксперименты на активного экспериментаторамаксимум с января 2025; пик — август 2026
Успешные задачи на 4–8 часовбольше половины всё ещё с ≥1 вмешательством человека

OpenAI отдельно пишет: рост числа экспериментов коррелирует с внедрением Codex и ростом доступных вычислительных мощностей; причинность не доказана. Это важно не сглаживать.

По сравнению с началом 2026 медианный исследователь уже не «чуть трогает агентов», а встраивает их в ежедневную работу. До июня суммарное время агентов по организации ещё не превышало суммарный человеческий труд — к середине августа картина перевернулась.

Почему это важно

Для меня здесь не лозунг «агенты заменят исследователей», а смена единицы ёмкости.

Раньше в бизнесе часто считали внедрение так: сколько лицензий, сколько людей открыли чат, сколько запросов в неделю. OpenAI показывает другой контур: сколько дней работы агента команда реально прогоняет на одного человека — и сколько из этого доходит до принятого результата при участии человека.

Это уже не только «приняли ли инструмент». Это инженерия ёмкости: как устроены параллельные сессии, где человек вмешивается, сколько стоит день запросов к модели (inference), какие задачи вообще готовы к делегированию.

Новая экономика запросов к модели здесь прямая: медиана выше $600 в день и хвост выше $7000 — это не «дорогой чат», а бюджет на параллельную работу агентов. Без метрики «принятые агенто-дни / 1 человеко-день» такой чек легко принять за шум или за «перерасход».

Связка с экономикой агентов у OpenAI та же логика: платить не за ощущение «модель умная», а за измеримый контур результата. Здесь единица — агенто-день под человеческим контролем.

Что это означает для бизнеса

  1. Маркетинг и исследования. Если у вас «неделя исследования рынка» — вопрос не только «кто пишет бриф», а сколько параллельных агентных прогонов вы принимаете на одного аналитика и где человек обязан вмешаться.
  2. Трафик и контент. Можно гонять несколько агентов на сбор фактов, черновики и проверки — но без порога «принято / отклонено» вы купите токены, а не ёмкость.
  3. Руководитель внедрения. Показатель «пользователи с чатом» устаревает быстрее, чем кажется. Ближе к практике OpenAI: агенто-дни, параллельность, доля задач с вмешательством, стоимость дня по ценам API.
  4. Риск. Больше половины успешных задач на 4–8 часов всё ещё требуют ручного толчка. Масштабировать «без человека в контуре» на длинных задачах — рано.

Таблица для своей команды (без выдуманных цифр — заполняете своими):

СлойВопросЧто записать за неделю
ЁмкостьСколько агенто-дней на 1 человеко-день?Сумма принятых прогонов / дни людей
ДеньгиСколько уходит на запросы к модели в день?Чек по API или тарифу команды
КачествоГде человек обязателен?Доля задач с ≥1 вмешательством
ПараллельСколько агентов одновременно без хаоса?Пик параллельных сессий на человека

Что протестировать

Предлагаю неделю параллельных агентов — одну рабочую неделю с тремя дорожками: исследование / трафик / исследование (повтор на втором брифе). Не «поиграться с чатом», а замерить ёмкость.

  1. Задача. На каждой дорожке — один чёткий бриф на 4–8 часов специалиста (как у OpenAI: задача должна быть хорошо определена).
  2. Сценарий. Один человек ведёт несколько агентов параллельно (цель — дойти хотя бы до устойчивых 2–4 сессий, не до хаоса). Человек вмешивается только по заранее записанным правилам.
  3. Метрика. Принятые агенто-дни на один человеко-день: сколько дней работы агента вы приняли (результат можно использовать), делённое на один человеко-день владельца.
  4. Граница. Если после одного вмешательства агент теряет исходный бриф — задача ещё не уровня стажёра-исследователя для вашего контура. Если чек за запросы к модели растёт, а доля принятых результатов нет — вы купили токены, не ёмкость.

Ориентир из публикации OpenAI держать рядом, не копировать: у них 3,1 агенто-дня на человеко-день по организации и часто 4+ агента в пике. У вас цифра будет другой — важна динамика своей недели.

Мой вывод

OpenAI зафиксировала уровень, который бизнесу полезно перевести на свой язык: агент под контролем человека закрывает чёткую многодневную задачу, а ёмкость считается в агенто-днях на человека, не в числе подписок.

Я бы не спорила с вехой «к марту 2028 — автоматизированный исследователь» как с пресс-релизом. Я бы на этой неделе проверила свою неделю параллельных агентов и записала три числа: принятые агенто-дни на человеко-день, долю вмешательств и дневной чек на запросы к модели.

Пока больше половины длинных успешных задач требуют человека — конкурентное преимущество не в «убрать людей», а в том, как вы проектируете параллельную ёмкость и где оставляете обязательное «да» от специалиста.

Источники

← Все новости AI и MCP