Microsoft Web Skill Factory: навык без модели после проверки
21 июля 2026 исследовательская группа Microsoft AI Frontiers добавила в проект Webwright модуль Web Skill Factory: он превращает успешно решённую веб-агентом задачу в проверенный код-навык (Skill), который затем выполняется без обращения к модели. Работа вышла не в последние сутки, но сегодня снова активно обсуждается в профильном сообществе — материал разбираем как самый заметный ранее не описанный нами инфоповод после дедупликации свежих новостей. На ограниченном наборе задач WebArena с моделью GPT-5.4 переиспользование библиотеки навыков подняло точность на новых задачах с 55% до 70% и сократило среднее число шагов с 17,1 до 14,7.
Коротко
- Что предложили: исследователи Microsoft AI Frontiers добавили в проект Webwright модуль Web Skill Factory — конвейер, который превращает скрипт, оставшийся после успешного решения веб-задачи агентом, в проверенный параметризованный код-навык.
- Когда: запись о модуле — в README от 21 июля 2026; подробности оценки — в pull request от 23 июля. Сегодня работа снова активно расходится в профильном сообществе — это не релиз последних суток.
- Главная цифра: на ограниченном наборе задач WebArena с моделью GPT-5.4 переиспользование библиотеки навыков подняло точность на новых задачах с 55% до 70%, а среднее число шагов сократилось с 17,1 до 14,7.
- Главное ограничение: тест — 10 шаблонов задач, 3 тестовых сайта, 100 решений; переносить точные цифры на маркетинговые процессы нельзя, важен архитектурный принцип.
- Главное последствие: после проверки навык выполняется примерно за 40 секунд без обращения к модели — рутинная часть работы перестаёт требовать рассуждений AI при каждом запуске.
Что изменилось
Большинство современных навыков (Skills) для AI-агентов устроены одинаково: файл с инструкцией, который модель читает заново при каждом запуске, заново рассуждает и заново вызывает инструменты. Web Skill Factory меняет этот жизненный цикл для веб-агентов.
Каждое решение задачи в Webwright уже оставляет после себя рабочий Python-скрипт. Web Skill Factory встраивает поверх этого пять шагов без изменения основного цикла агента:
- Хранение. Библиотека навыков лежит на диске — код и метаданные для каждого навыка.
- Поиск. Перед новой задачей библиотека проверяется отдельным инструментом — агент получает подсказку, ещё не начав решать задачу заново.
- Решение. Система определяет вердикт: использовать готовый навык, адаптировать его под задачу или пропустить и решать с нуля.
- Проверка на входе. Двойной барьер не пускает ошибочное решение в библиотеку: сначала фильтр допуска (сверка с эталонным ответом или самопроверкой), затем сам навык обязан воспроизвести свой прошлый ответ отдельно, без модели — иначе он не попадает в каталог.
- Рост. Новые успешные решения расширяют навык на месте, а регрессионный повторный прогон (regression replay) проверяет, что старые сценарии не сломались.
По данным pull request с оценкой, на тестовом наборе WebArena (10 шаблонов retrieve-задач на трёх сайтах — административной панели магазина, GitLab и картах) каждая задача решалась дважды: с библиотекой навыков и «с нуля».
| Набор задач | С библиотекой навыков | С нуля | Разница |
|---|---|---|---|
| Новые задачи (20 задач, не встречались при обучении библиотеки) | 70% точности, 14,7 шага | 55% точности, 17,1 шага | +15 п.п. точности, −2,4 шага |
| Знакомые задачи (30 задач, на которых строилась библиотека) | 86% точности, 13,7 шага | 76% точности, 15,9 шага | +10 п.п. точности, −2,2 шага |
Фильтр допуска работает: из 30 решений, использованных для обучения библиотеки, 7 оказались неверными и не попали в каталог. После проверки готовый навык выполняется самостоятельно примерно за 40 секунд и не обращается к модели.
Почему это важно
Сегодняшний способ строить Skills — это, по сути, накопление текстовых инструкций. Библиотека растёт количественно: больше файлов, больше карточек в каталоге, — но каждый запуск любого навыка по-прежнему стоит полного цикла рассуждений модели.
Web Skill Factory предлагает другую логику: не расширять число инструкций, а превращать доказанно работающую часть процесса в код, который вообще не нуждается в модели. Жизненный цикл выглядит так:
- Модель впервые решает задачу.
- Решение подтверждено как успешное.
- Устойчивая последовательность действий анализируется и компилируется в параметризованный код.
- Код проходит регрессионные тесты на прежних сценариях.
- В следующий раз задача выполняется детерминированным кодом, а не рассуждением модели заново.
Это отличает подход от других недавних инициатив вокруг Skills. Agent Plugins 1.0 и промышленный контур Google Agent Skills стандартизируют упаковку и проверку навыков-инструкций — как их доставить и оценить. Web Skill Factory меняет саму природу исполнения: часть библиотеки перестаёт быть текстом, который модель читает, и становится программой, которая просто запускается.
Что это означает для маркетинга
Показатели теста получены на узком наборе веб-задач и напрямую на маркетинговые процессы не переносятся. Но принцип — разделение навыков на два класса — работает и без веб-браузера:
| Класс навыка | Когда нужен | Пример |
|---|---|---|
| Reasoning Skill (рассуждающий) | Есть неопределённость, нужен анализ и выбор гипотезы | «Почему упала конверсия и какую гипотезу тестировать?» |
| Execution Skill (исполняющий) | Процесс стабилен и уже проверен много раз | Собрать отчёт аналитики, свести с CRM, посчитать стоимость привлечения клиента (CAC), сохранить результат |
Для второй колонки нет причины каждую неделю заново заставлять модель «придумывать», как вытащить показатели, нормализовать даты и объединить источники — если этот путь уже проверен на десятке прошлых запусков. Разумная схема: модель определяет, какой анализ нужен → закреплённый в коде навык забирает данные, считает и формирует доказательную базу → модель интерпретирует результат и принимает решение. Рассуждение остаётся там, где есть выбор; рутина уходит в код.
Три практических сценария:
- Аудит повторяемости. Возьмите workflow, который агент выполнял одинаково 5–10 раз подряд с одним и тем же успешным результатом — это кандидат на перевод в исполняемый навык.
- Разделение ответственности. Зафиксируйте для каждого маркетингового навыка, какая часть — рассуждение (гипотеза, интерпретация), а какая — рутинная последовательность действий с данными.
- Регрессия вместо доверия на слово. Прежде чем полагаться на закреплённый в коде шаг, прогоните его на нескольких прошлых кейсах и сравните результат с версией, где решение принимала модель.
Что это значит для ваших данных
Тот же принцип применим к MCP-коннекторам и каталогу Skills в MCP Panel: если еженедельный отчёт из Метрики, свод с CRM и расчёт стоимости привлечения клиента уже несколько раз прошли проверку человеком с одинаковым результатом, эту цепочку разумно закрепить как исполняемый шаг — а не пересказывать модели заново при каждом запуске.
Модель в таком сценарии остаётся там, где есть выбор: какую гипотезу проверить, как интерпретировать отклонение показателя, что делать с аномалией в данных. Рутинный сбор и расчёт выполняет закреплённый шаг — быстрее и без изменения результата от запуска к запуску.
Что протестировать
- Задача: выберите один регулярный аналитический процесс (например, еженедельный отчёт по воронке), который агент уже решал одинаковым способом несколько раз подряд.
- Сценарий: запустите его ещё 3–5 раз с рассуждением модели и зафиксируйте, какая последовательность шагов повторяется без изменений.
- Граница: заранее определите условие, при котором процесс возвращается к модели — новый источник данных, нетипичное значение, изменение формата отчёта.
- Метрики: сравните время и стоимость запуска с рассуждением модели и без него, а также долю случаев, когда закреплённый шаг дал тот же результат, что и модель.
Главный вывод
Это самая сильная архитектурная идея, которую я увидела за последние недели вокруг Skills. Сейчас индустрия в основном соревнуется в количестве навыков-инструкций. Web Skill Factory предлагает встречное движение: не увеличивать число файлов, а последовательно переводить доказанно работающую рутину из вероятностного рассуждения модели в детерминированный код — с обязательной проверкой и регрессионными тестами на каждом шаге роста.
Экономика при этом меняется на противоположную. Обычно логика такая: чем больше автоматизации, тем больше расход ресурсов модели. Здесь работает другая: чем дольше система используется, тем большую часть проверенной рутины она переносит в дешёвое воспроизводимое исполнение, а модель остаётся для нового и неоднозначного.
Стоит проверить гипотезу: появится ли в ближайшее время отдельный слой — условно «компилятор навыков», который после нескольких подтверждённых человеком повторов сам предлагает закрепить процесс в коде и прогоняет для него регрессионные тесты. Пока это архитектурное направление, а не готовый продукт, но именно оно, на мой взгляд, определит следующий этап зрелости Skills после нынешнего роста их количества.
Источники
- Web Skill Factory (раздел README + модуль webwright.skill_factory) — Microsoft (GitHub, репозиторий Webwright), 2026-07-21
- Web Skill Factory: evolving reusable, verified, code-native skills for web agents (pull request #54, оценка на WebArena) — Microsoft (GitHub, репозиторий Webwright), 2026-07-23