OpenAI закрепила экономику агентов: результат, а не токены
31 июля 2026 OpenAI опубликовала стратегию Building abundant intelligence и формализовала подход к экономике рабочих процессов с AI: оценивать не номинальную цену вызова модели, а полную стоимость успешного результата — с повторными попытками, временем, ошибками и человеческой проверкой. Для вас это сигнал: объект оптимизации смещается с «дешёвых токенов» на принятый отчёт из Метрики, Roistat и CRM.
Коротко
- Что опубликовали: стратегию Building abundant intelligence — как OpenAI видит «изобильный» AI и по какой формуле считать его стоимость для бизнеса.
- Новый принцип: оценивать не цену одного вызова модели, а полную стоимость успешного результата — с повторными прогонами, временем, ошибками и ручной проверкой.
- Масштаб по данным OpenAI: более миллиарда активных пользователей, более двух миллионов компаний; агентная работа через Codex — 99,8% недельного объёма выходных токенов внутри компании.
- Пример системы, а не модели: на ARC-AGI-3 результат GPT‑5.6 Sol вырос с 13,3% до 38,3% при шестикратном сокращении выходных токенов — без смены модели, за счёт управления контекстом и сохранённых рассуждений.
- Главное последствие: оптимизировать нужно весь сценарий — маршрутизацию, контекст, вызовы инструментов и долю ручных правок.
Что изменилось
31 июля 2026 OpenAI в Building abundant intelligence описала, как компания связывает исследования, продукты и инфраструктуру в одну экономику рабочих процессов с AI. Это не релиз функции, а закрепление правил игры: побеждает не самая дешёвая модель в прайсе, а связка «модель + настройки + инструменты + контроль», которая чаще доводит задачу до принятого результата.
Ключевые тезисы первоисточника:
- Единица учёта — готовая работа. OpenAI прямо смещает фокус с номинальной цены токенов на стоимость успешно завершённого сценария: сколько стоит отчёт, который можно отправить руководителю, а не сколько стоит один запрос к API.
- Обратная связь от продуктов питает исследования. ChatGPT, ChatGPT Work, Codex и программный интерфейс (API) показывают, где клиенты получают ценность и где ломаются длинные цепочки — и это влияет на приоритеты разработки.
- Масштаб использования. По заявлению OpenAI, её продукты охватывают более миллиарда активных пользователей и более двух миллионов компаний. Через полгода после регистрации люди отправляют примерно на 50% больше сообщений в день и используют ChatGPT примерно в два раза большем числе типов задач.
- Codex как внутренний эталон агентной работы. Внутри OpenAI агентная работа через Codex формирует 99,8% недельного объёма выходных токенов; среди команд, которые перевели инструмент в основной режим, OpenAI называет, в частности, финансы.
Отдельный разбор ARC-AGI-3 от 31 июля показывает, как системные настройки меняют экономику без смены весов модели. С официальной конфигурацией бенчмарка GPT‑5.6 Sol набрал 13,3% на публичном наборе ARC-AGI-3. После включения сохранённых рассуждений и сжатия контекста — 38,3% при шестикратном сокращении выходных токенов. Модель та же; изменились настройки API, управление контекстом и сохранение промежуточных рассуждений между шагами.
Почему это важно
Главный объект оптимизации смещается с модели на систему вокруг неё. OpenAI фактически говорит то, что пилоты уже показывали на практике: таблица «цена миллиона токенов» перестаёт быть главной метрикой закупки.
Что входит в «полную стоимость результата»:
- маршрутизация задач между уровнями моделей — Sol, Terra, Luna в GPT‑5.6 или аналоги у других провайдеров;
- сохранение промежуточного результата — чтобы агент не пересчитывал одно и то же с нуля;
- сокращение повторного анализа — меньше лишних прогонов из‑за потери контекста;
- качество контекста — что именно попало в окно: сырые логи или уже свёрнутые выводы;
- число вызовов инструментов — в том числе через MCP;
- необходимость человеческой проверки — сколько минут аналитик тратит на правки.
Отсюда практическое правило: дешёвая модель может оказаться дороже, если регулярно требует повторного запуска или ломает структуру отчёта.
Дорогая модель экономичнее, если завершает процесс с первого раза и реже ошибается в вызовах к Метрике, Roistat или CRM.
Это продолжение линии, которую OpenAI уже намекала в анонсе GPT‑5.6 и снижении цен Luna/Terra: инфраструктура и маршрутизация должны сделать «изобильный» AI не только умнее, но и считаемым в рублях за принятый результат.
Что это означает для бизнеса
- Смета пилота переписывается. В бриф закладывайте не «$X за миллион токенов», а стоимость одного принятого артефакта: еженедельного отчёта по каналам, карточки лида с верной атрибуцией, сверки рекламных расходов.
- Инженерия сценариев становится частью маркетингового стека. Кто хранит промежуточные выводы, кто решает, когда эскалировать с Luna на Sol, кто считает MCP-вызовы — это уже не «IT-настройка», а управление себестоимостью AI-аналитики.
- Сравнение провайдеров меняется. Две платформы с похожим прайсом на флагман могут расходиться в три раза по итоговой стоимости отчёта — из‑за качества работы с инструментами, сохранения контекста и числа переделок.
- Снижение цены Luna/Terra от 30 июля усиливает этот тезис. Дешёвые уровни имеют смысл только в связке с правилами маршрутизации; иначе экономия на токенах съедается повторными прогонами и ручной чисткой.
Что протестировать
- Один регулярный сценарий — одна формула. Возьмите ежедневный или еженедельный процесс «Яндекс Метрика + Roistat + CRM → сводка → выводы для руководителя». Посчитайте стоимость одного принятого отчёта: вызовы моделей по уровням; MCP- и API-вызовы к источникам; повторные прогоны после ошибок; минуты проверки аналитиком.
- Две схемы маршрутизации. Прогоните один и тот же сценарий двумя способами: схема A — одна универсальная модель на все шаги; схема B — сильная модель планирует, экономичная выполняет рутину, сильная проверяет итог. Сравните не «красоту текста», а долю ручных правок и время до файла, который отправили без переписки.
- Пять метрик на 2–3 недели. Зафиксируйте: итоговая стоимость принятого отчёта; число ошибочных вызовов инструментов; доля прогонов, которые пришлось перезапустить; время до готового файла; сколько рекомендаций реально взяли в работу.
Как это связано с MCP
OpenAI в стратегии не называет MCP напрямую, но логика полной стоимости результата автоматически включает каждый внешний вызов. В маркетинговых AI-сценариях это как раз MCP-коннекторы к Метрике, Roistat, amoCRM и другим системам.
Практические следствия:
- лишний MCP-вызов — такая же статья расходов, как лишний прогон модели;
- кэш и сохранение промежуточных выгрузок снижают и токены, и нагрузку на API источников;
- единый доступ к данным через MCP Panel позволяет менять модель под задачу, не перестраивая интеграции — маршрутизация остаётся на уровне сценария, а не «каждый раз новый скрипт».
Если вы уже считаете только токены OpenAI или Anthropic — добавьте строку «стоимость вызовов инструментов и MCP» и «минуты проверки». Иначе сравнение схем A и B будет заведомо неверным.
Главный вывод
OpenAI оформила в стратегию то, что зрело на рынке весь 2026 год: экономика AI — это экономика принятого результата, а не прайс-листа моделей.
Для маркетинга и аналитики это означает простое решение: выберите один повторяющийся процесс, посчитайте полную себестоимость отчёта и только потом оптимизируйте модели и маршруты. Пример с ARC-AGI-3 — напоминание, что иногда +25 процентных пунктов качества и −6× токенов даёт не «более умная модель», а правильно собранный сценарий.
Не ждите, что флагман «починит» кривые UTM и рассинхрон справочников. Он ускорит правильный процесс — и так же быстро размножит неправильный. Начните с одной формулы «стоимость принятого отчёта» — и уже на следующей неделе будет видно, где вы платите за токены, а где за переделки.
Источники
- Building abundant intelligence — OpenAI, 2026-07-31
- How enabling two settings tripled our scores on the ARC-AGI-3 benchmark — OpenAI, 2026-07-31