Порядок действий в Skill даёт 65,7% пользы — знания только 4,5%
14 августа 2026 на arXiv вышла работа Demystifying Agent Skills: в большинстве полезных случаев Skill помогает стабильным порядком действий (65,7%), а прямое добавление знаний — лишь в 4,5%. Для бизнеса это значит проектировать Skill как методику «что проверить и когда остановиться», а не как свалку фактов, и не растить плоский каталог, пока агент не умеет надёжно выбрать нужный навык.
Коротко
- Главный вывод: Skill помогает порядком действий (65,7%), не знаниями (4,5%).
- Что случилось: препринт Demystifying Agent Skills — 14 августа 2026.
- Что меняется: Skill = методика «что проверить и когда остановиться», не энциклопедия; метрика каталога — выбор нужного навыка, не количество карточек.
- Сегодня: 10 запросов команды — помогает ли Skill шагами или только фактами.
Что произошло
Авторы препринта разобрали не «улучшают ли Skills успех в среднем», а когда они помогают и почему ломаются при росте библиотеки.
Два числа, которые я держу в голове:
- 65,7% пользы Skill — процедурное якорение: стабильный порядок действий — что проверить раньше, что сравнить потом, какую ошибку исключить, когда остановиться.
- 4,5% — прямое добавление знаний в Skill.
Отдельно — узел маршрутизации. При пуле из 5 Skills точность фактического выбора «правильного» навыка — примерно 29,6%; при пуле из 100 — около 3,3%.
Skill в их определении — короткая инструкция как сделать работу (файл навыка), а не слой знаний о продукте, рынке и клиентах.
Почему это важно
Слабая архитектура, которую я часто вижу:
``` файл навыка = всё, что мы знаем + сегментация + задачи клиента + клиенты + рынок + продукт ```
Более сильная:
| Слой знаний | Слой Skill |
|---|---|
| факты, данные, продукт, рынок | какие шаги выполнить |
| «что мы знаем» | что проверить, какие ошибки исключить |
| когда остановиться, как выглядит хороший результат |
Не пихать в один Skill сегментацию, задачи клиента, рынок и продукт. Skill отвечает на вопрос «как правильно выполнить работу»; знания — на вопрос «что мы знаем».
Второй сигнал жёстче: хвастовство «у нас 300 Skills» может быть антипреимуществом, если агент не умеет надёжно выбрать нужный. Плоский каталог из сотен карточек без маршрутизации — не богатство, а шум выбора.
Что сделать сегодня
- Возьмите 10 реальных запросов команды — маркетинг, аналитика, стратегия, контент.
- Для каждого заранее зафиксируйте: какой Skill должен быть выбран.
- Сверьте с логом фактического выбора агента: попал ли в «правильный» Skill? Помог ли порядок шагов, а не новая фактология?
- Перед добавлением новых карточек — сузьте пул: задача → домен (5–10 Skills) → конкретный навык, а не поиск среди всего каталога.
| Шаг | Действие | Критерий готовности |
|---|---|---|
| 1 | 10 запросов команды | Список без дублей по смыслу |
| 2 | Ожидаемый Skill на каждый | Зафиксировано до прогона |
| 3 | Сверка с логом выбора | Видно: шаги или факты |
| 4 | Сузить пул до новых карточек | Задача → домен → Skill |
Доказательства
- 65,7% пользы Skill — процедурное якорение; 4,5% — прямое добавление знаний. Источник: препринт arXiv:2608.14036, 14.08.2026.
- Точность выбора «правильного» Skill: ~29,6% при пуле 5 Skills → ~3,3% при пуле 100. Тот же препринт.
- Волна разборов 23 августа — контекст в обзоре Neura Market; цифры там вторичны, не первоисточник.
Парные сравнения, оценка маршрутизации и доверительные интервалы — только в блоке «Для специалистов» ниже.
Мой вывод
Skill — прежде всего методика работы, а не энциклопедия. Следующая важная метрика каталога — не «сколько Skills существует», а с какой вероятностью агент выбирает нужный Skill для реальной задачи. Пока этой метрики нет, масштабирование библиотеки легко превращается в антипреимущество: порядок действий даёт 65,7% пользы, знания в Skill — 4,5%.
Для специалистов
Методика препринта. Авторы нормализовали 8 135 записей запусков, вручную разметили 240 траекторий (238 валидных уникальных меток), свели наблюдения в таксономию из трёх верхних категорий и двенадцати режимов использования Skill. Сравнивали одно и то же опытное знание как память рабочего процесса и как дистиллированный файл навыка.
Парные сравнения. Skill улучшает результат относительно памяти рабочего процесса примерно на 6,06 процентных пункта в парных сравнениях; доверительный интервал — у авторов. Это механистический слой, не для лида: цифры получены на терминальных бенчмарках и ограниченном наборе пар «агент + модель»; авторы сами ограничивают обобщение на все типы агентных задач.
Оценка маршрутизации. Практический тест, который я держу отдельно:
``` Оценка маршрутизации навыков 100 реальных запросов ↓ какой Skill должен выбрать агент? ↓ какой выбрал? ↓ почему? ```
Прогонять при каждом существенном расширении каталога. Точный выбор эталонного Skill не всегда обязателен для успеха задачи, но маршрутизация всё равно становится узким местом при росте библиотеки.
Двухэтапная схема вместо плоского каталога:
``` ЗАДАЧА → ДОМЕН (5–10 Skills) → конкретный НАВЫК ```
вместо `ЗАДАЧА → искать среди всего каталога`.
Источники
- Demystifying Agent Skills: Why They Work—Until They Don't — arXiv (Princeton / UC San Diego et al.), 2026-08-14
- AI agent skills study (overview) — Neura Market, 2026-08-23