Microsoft Web Skill Factory: навык без модели после проверки

· 7 минут чтения · Любовь Черемисина · AI-агенты MCP · СегодняПродвинутый

21 июля 2026 исследовательская группа Microsoft AI Frontiers добавила в проект Webwright модуль Web Skill Factory: он превращает успешно решённую веб-агентом задачу в проверенный код-навык (Skill), который затем выполняется без обращения к модели. Работа вышла не в последние сутки, но сегодня снова активно обсуждается в профильном сообществе — материал разбираем как самый заметный ранее не описанный нами инфоповод после дедупликации свежих новостей. На ограниченном наборе задач WebArena с моделью GPT-5.4 переиспользование библиотеки навыков подняло точность на новых задачах с 55% до 70% и сократило среднее число шагов с 17,1 до 14,7.

На кремовой бумаге свиток пошаговых инструкций проходит через латунный печатный пресс с красным рычагом и превращается в шестерёнку, которую сверяют с прежними на полке под контрольными манометрами — метафора превращения навыка-инструкции в проверенный код без модели

Коротко

  • Что предложили: исследователи Microsoft AI Frontiers добавили в проект Webwright модуль Web Skill Factory — конвейер, который превращает скрипт, оставшийся после успешного решения веб-задачи агентом, в проверенный параметризованный код-навык.
  • Когда: запись о модуле — в README от 21 июля 2026; подробности оценки — в pull request от 23 июля. Сегодня работа снова активно расходится в профильном сообществе — это не релиз последних суток.
  • Главная цифра: на ограниченном наборе задач WebArena с моделью GPT-5.4 переиспользование библиотеки навыков подняло точность на новых задачах с 55% до 70%, а среднее число шагов сократилось с 17,1 до 14,7.
  • Главное ограничение: тест — 10 шаблонов задач, 3 тестовых сайта, 100 решений; переносить точные цифры на маркетинговые процессы нельзя, важен архитектурный принцип.
  • Главное последствие: после проверки навык выполняется примерно за 40 секунд без обращения к модели — рутинная часть работы перестаёт требовать рассуждений AI при каждом запуске.

Что изменилось

Большинство современных навыков (Skills) для AI-агентов устроены одинаково: файл с инструкцией, который модель читает заново при каждом запуске, заново рассуждает и заново вызывает инструменты. Web Skill Factory меняет этот жизненный цикл для веб-агентов.

Каждое решение задачи в Webwright уже оставляет после себя рабочий Python-скрипт. Web Skill Factory встраивает поверх этого пять шагов без изменения основного цикла агента:

  1. Хранение. Библиотека навыков лежит на диске — код и метаданные для каждого навыка.
  2. Поиск. Перед новой задачей библиотека проверяется отдельным инструментом — агент получает подсказку, ещё не начав решать задачу заново.
  3. Решение. Система определяет вердикт: использовать готовый навык, адаптировать его под задачу или пропустить и решать с нуля.
  4. Проверка на входе. Двойной барьер не пускает ошибочное решение в библиотеку: сначала фильтр допуска (сверка с эталонным ответом или самопроверкой), затем сам навык обязан воспроизвести свой прошлый ответ отдельно, без модели — иначе он не попадает в каталог.
  5. Рост. Новые успешные решения расширяют навык на месте, а регрессионный повторный прогон (regression replay) проверяет, что старые сценарии не сломались.

По данным pull request с оценкой, на тестовом наборе WebArena (10 шаблонов retrieve-задач на трёх сайтах — административной панели магазина, GitLab и картах) каждая задача решалась дважды: с библиотекой навыков и «с нуля».

Набор задачС библиотекой навыковС нуляРазница
Новые задачи (20 задач, не встречались при обучении библиотеки)70% точности, 14,7 шага55% точности, 17,1 шага+15 п.п. точности, −2,4 шага
Знакомые задачи (30 задач, на которых строилась библиотека)86% точности, 13,7 шага76% точности, 15,9 шага+10 п.п. точности, −2,2 шага

Фильтр допуска работает: из 30 решений, использованных для обучения библиотеки, 7 оказались неверными и не попали в каталог. После проверки готовый навык выполняется самостоятельно примерно за 40 секунд и не обращается к модели.

Почему это важно

Сегодняшний способ строить Skills — это, по сути, накопление текстовых инструкций. Библиотека растёт количественно: больше файлов, больше карточек в каталоге, — но каждый запуск любого навыка по-прежнему стоит полного цикла рассуждений модели.

Web Skill Factory предлагает другую логику: не расширять число инструкций, а превращать доказанно работающую часть процесса в код, который вообще не нуждается в модели. Жизненный цикл выглядит так:

  1. Модель впервые решает задачу.
  2. Решение подтверждено как успешное.
  3. Устойчивая последовательность действий анализируется и компилируется в параметризованный код.
  4. Код проходит регрессионные тесты на прежних сценариях.
  5. В следующий раз задача выполняется детерминированным кодом, а не рассуждением модели заново.

Это отличает подход от других недавних инициатив вокруг Skills. Agent Plugins 1.0 и промышленный контур Google Agent Skills стандартизируют упаковку и проверку навыков-инструкций — как их доставить и оценить. Web Skill Factory меняет саму природу исполнения: часть библиотеки перестаёт быть текстом, который модель читает, и становится программой, которая просто запускается.

Что это означает для маркетинга

Показатели теста получены на узком наборе веб-задач и напрямую на маркетинговые процессы не переносятся. Но принцип — разделение навыков на два класса — работает и без веб-браузера:

Класс навыкаКогда нуженПример
Reasoning Skill (рассуждающий)Есть неопределённость, нужен анализ и выбор гипотезы«Почему упала конверсия и какую гипотезу тестировать?»
Execution Skill (исполняющий)Процесс стабилен и уже проверен много разСобрать отчёт аналитики, свести с CRM, посчитать стоимость привлечения клиента (CAC), сохранить результат

Для второй колонки нет причины каждую неделю заново заставлять модель «придумывать», как вытащить показатели, нормализовать даты и объединить источники — если этот путь уже проверен на десятке прошлых запусков. Разумная схема: модель определяет, какой анализ нужен → закреплённый в коде навык забирает данные, считает и формирует доказательную базу → модель интерпретирует результат и принимает решение. Рассуждение остаётся там, где есть выбор; рутина уходит в код.

Три практических сценария:

  1. Аудит повторяемости. Возьмите workflow, который агент выполнял одинаково 5–10 раз подряд с одним и тем же успешным результатом — это кандидат на перевод в исполняемый навык.
  2. Разделение ответственности. Зафиксируйте для каждого маркетингового навыка, какая часть — рассуждение (гипотеза, интерпретация), а какая — рутинная последовательность действий с данными.
  3. Регрессия вместо доверия на слово. Прежде чем полагаться на закреплённый в коде шаг, прогоните его на нескольких прошлых кейсах и сравните результат с версией, где решение принимала модель.

Что это значит для ваших данных

Тот же принцип применим к MCP-коннекторам и каталогу Skills в MCP Panel: если еженедельный отчёт из Метрики, свод с CRM и расчёт стоимости привлечения клиента уже несколько раз прошли проверку человеком с одинаковым результатом, эту цепочку разумно закрепить как исполняемый шаг — а не пересказывать модели заново при каждом запуске.

Модель в таком сценарии остаётся там, где есть выбор: какую гипотезу проверить, как интерпретировать отклонение показателя, что делать с аномалией в данных. Рутинный сбор и расчёт выполняет закреплённый шаг — быстрее и без изменения результата от запуска к запуску.

Что протестировать

  1. Задача: выберите один регулярный аналитический процесс (например, еженедельный отчёт по воронке), который агент уже решал одинаковым способом несколько раз подряд.
  2. Сценарий: запустите его ещё 3–5 раз с рассуждением модели и зафиксируйте, какая последовательность шагов повторяется без изменений.
  3. Граница: заранее определите условие, при котором процесс возвращается к модели — новый источник данных, нетипичное значение, изменение формата отчёта.
  4. Метрики: сравните время и стоимость запуска с рассуждением модели и без него, а также долю случаев, когда закреплённый шаг дал тот же результат, что и модель.

Главный вывод

Это самая сильная архитектурная идея, которую я увидела за последние недели вокруг Skills. Сейчас индустрия в основном соревнуется в количестве навыков-инструкций. Web Skill Factory предлагает встречное движение: не увеличивать число файлов, а последовательно переводить доказанно работающую рутину из вероятностного рассуждения модели в детерминированный код — с обязательной проверкой и регрессионными тестами на каждом шаге роста.

Экономика при этом меняется на противоположную. Обычно логика такая: чем больше автоматизации, тем больше расход ресурсов модели. Здесь работает другая: чем дольше система используется, тем большую часть проверенной рутины она переносит в дешёвое воспроизводимое исполнение, а модель остаётся для нового и неоднозначного.

Стоит проверить гипотезу: появится ли в ближайшее время отдельный слой — условно «компилятор навыков», который после нескольких подтверждённых человеком повторов сам предлагает закрепить процесс в коде и прогоняет для него регрессионные тесты. Пока это архитектурное направление, а не готовый продукт, но именно оно, на мой взгляд, определит следующий этап зрелости Skills после нынешнего роста их количества.

Источники

← Все новости AI и MCP