OpenAI: автоматизированный стажёр-исследователь — считать агенто-дни
6 сентября 2026 OpenAI сообщила, что достигла уровня автоматизированного стажёра-исследователя: под контролем человека система закрывает чёткую задачу, на которую у специалиста ушло бы несколько дней. Следующая цель — автоматизированный исследователь к марту 2028. Единица ёмкости — агенто-дни на одного человека.
Коротко
- Что объявили: 6 сентября 2026 OpenAI сообщила, что по своим замерам достигла цели осени прошлого года — уровня автоматизированного стажёра-исследователя (в их терминах — research intern).
- Что это значит: система под руководством человека выполняет чётко поставленную исследовательскую задачу, на которую у специалиста ушло бы несколько дней.
- Главное ограничение: это не «модель сама ведёт науку». Люди задают приоритеты, отбирают идеи и решают, масштабировать, остановить или выпустить систему. Больше половины успешных задач на 4–8 часов всё ещё требуют хотя бы одного вмешательства человека.
- Главное последствие: единица ёмкости смещается с «сколько людей с подпиской» к агенто-дням на одного человека (дни работы агента) — сколько дней работы агента реально принято на один человеко-день.
Что изменилось
В тексте об ускорении исследований внутри OpenAI компания показывает не новый чат и не новую кнопку, а снимок внутренней практики исследовательской организации к середине августа 2026 и прогресс к заявленным вехам.
Две вехи по их формулировке:
| Веха | Срок | Смысл |
|---|---|---|
| Автоматизированный стажёр-исследователь | сентябрь 2026 (цель достигнута по замерам OpenAI) | Под контролем человека закрыть чёткую задачу на несколько дней специалиста |
| Автоматизированный исследователь | март 2028 (следующая цель) | Более сильный уровень автоматизации исследования при сохранении человеческого контроля |
Внутренние цифры середины августа (как у OpenAI; методы — в приложении к публикации):
| Показатель | Значение |
|---|---|
| Медиана трат на запросы к модели | больше $600 в день по ценам программного интерфейса (API) |
| 90-й перцентиль | больше $7000 в день на токены |
| Агенто-дни на 1 человеко-день | 3,1 (в пересчёте на стандартный 8-часовой день) |
| Параллельность | растёт доля сценариев с 4 и более агентами одновременно |
| Эксперименты на активного экспериментатора | максимум с января 2025; пик — август 2026 |
| Успешные задачи на 4–8 часов | больше половины всё ещё с ≥1 вмешательством человека |
OpenAI отдельно пишет: рост числа экспериментов коррелирует с внедрением Codex и ростом доступных вычислительных мощностей; причинность не доказана. Это важно не сглаживать.
По сравнению с началом 2026 медианный исследователь уже не «чуть трогает агентов», а встраивает их в ежедневную работу. До июня суммарное время агентов по организации ещё не превышало суммарный человеческий труд — к середине августа картина перевернулась.
Почему это важно
Для меня здесь не лозунг «агенты заменят исследователей», а смена единицы ёмкости.
Раньше в бизнесе часто считали внедрение так: сколько лицензий, сколько людей открыли чат, сколько запросов в неделю. OpenAI показывает другой контур: сколько дней работы агента команда реально прогоняет на одного человека — и сколько из этого доходит до принятого результата при участии человека.
Это уже не только «приняли ли инструмент». Это инженерия ёмкости: как устроены параллельные сессии, где человек вмешивается, сколько стоит день запросов к модели (inference), какие задачи вообще готовы к делегированию.
Новая экономика запросов к модели здесь прямая: медиана выше $600 в день и хвост выше $7000 — это не «дорогой чат», а бюджет на параллельную работу агентов. Без метрики «принятые агенто-дни / 1 человеко-день» такой чек легко принять за шум или за «перерасход».
Связка с экономикой агентов у OpenAI та же логика: платить не за ощущение «модель умная», а за измеримый контур результата. Здесь единица — агенто-день под человеческим контролем.
Что это означает для бизнеса
- Маркетинг и исследования. Если у вас «неделя исследования рынка» — вопрос не только «кто пишет бриф», а сколько параллельных агентных прогонов вы принимаете на одного аналитика и где человек обязан вмешаться.
- Трафик и контент. Можно гонять несколько агентов на сбор фактов, черновики и проверки — но без порога «принято / отклонено» вы купите токены, а не ёмкость.
- Руководитель внедрения. Показатель «пользователи с чатом» устаревает быстрее, чем кажется. Ближе к практике OpenAI: агенто-дни, параллельность, доля задач с вмешательством, стоимость дня по ценам API.
- Риск. Больше половины успешных задач на 4–8 часов всё ещё требуют ручного толчка. Масштабировать «без человека в контуре» на длинных задачах — рано.
Таблица для своей команды (без выдуманных цифр — заполняете своими):
| Слой | Вопрос | Что записать за неделю |
|---|---|---|
| Ёмкость | Сколько агенто-дней на 1 человеко-день? | Сумма принятых прогонов / дни людей |
| Деньги | Сколько уходит на запросы к модели в день? | Чек по API или тарифу команды |
| Качество | Где человек обязателен? | Доля задач с ≥1 вмешательством |
| Параллель | Сколько агентов одновременно без хаоса? | Пик параллельных сессий на человека |
Что протестировать
Предлагаю неделю параллельных агентов — одну рабочую неделю с тремя дорожками: исследование / трафик / исследование (повтор на втором брифе). Не «поиграться с чатом», а замерить ёмкость.
- Задача. На каждой дорожке — один чёткий бриф на 4–8 часов специалиста (как у OpenAI: задача должна быть хорошо определена).
- Сценарий. Один человек ведёт несколько агентов параллельно (цель — дойти хотя бы до устойчивых 2–4 сессий, не до хаоса). Человек вмешивается только по заранее записанным правилам.
- Метрика. Принятые агенто-дни на один человеко-день: сколько дней работы агента вы приняли (результат можно использовать), делённое на один человеко-день владельца.
- Граница. Если после одного вмешательства агент теряет исходный бриф — задача ещё не уровня стажёра-исследователя для вашего контура. Если чек за запросы к модели растёт, а доля принятых результатов нет — вы купили токены, не ёмкость.
Ориентир из публикации OpenAI держать рядом, не копировать: у них 3,1 агенто-дня на человеко-день по организации и часто 4+ агента в пике. У вас цифра будет другой — важна динамика своей недели.
Мой вывод
OpenAI зафиксировала уровень, который бизнесу полезно перевести на свой язык: агент под контролем человека закрывает чёткую многодневную задачу, а ёмкость считается в агенто-днях на человека, не в числе подписок.
Я бы не спорила с вехой «к марту 2028 — автоматизированный исследователь» как с пресс-релизом. Я бы на этой неделе проверила свою неделю параллельных агентов и записала три числа: принятые агенто-дни на человеко-день, долю вмешательств и дневной чек на запросы к модели.
Пока больше половины длинных успешных задач требуют человека — конкурентное преимущество не в «убрать людей», а в том, как вы проектируете параллельную ёмкость и где оставляете обязательное «да» от специалиста.
Источники
- Research acceleration: The view inside OpenAI — OpenAI, 2026-09-06