Контент сайта становится активом с отдельной лицензией
1 июля Cloudflare опубликовала годовой отчёт об AI-краулерах: к июню 2026 года 52% их запросов связаны с обучением моделей — против 22% весной 2025 года; ещё более 36% приходится на смешанные боты, которые одновременно индексируют, отвечают в AI и забирают данные на обучение. Граница между «проиндексировать сайт» и «забрать знания» почти исчезла. Для вас это значит: открытый контент без правил доступа кормит чужие модели, почти не возвращая трафик.
Коротко
- Что опубликовали: годовой отчёт Cloudflare об «агентном интернете» — как изменился состав краулеров и экономика открытого веба.
- Главная цифра: 52% запросов AI-краулеров в июне 2026 — на обучение моделей (22% весной 2025); более 36% — смешанные боты (поиск + AI-ответы + обучение).
- Главное ограничение: чистый поисковый обход остаётся, но его доля падает; отдельно разрешить «только индекс» и «только обучение» часто нельзя.
- Главное последствие: контент сайта — отдельный актив: к нему нужна политика доступа, а не только SEO и robots.txt.
Что изменилось
Cloudflare опубликовала годовой отчёт об «агентном интернете» — продолжение линии, начатой год назад, когда для новых доменов на платформе по умолчанию блокировали краулеры обучения моделей, если владелец явно не разрешил иное. Отчёт опирается на агрегированные данные платформы и презентацию для инвесторов 2026 года.
Состав краулеров. По классификации Cloudflare по назначению:
- 52% запросов AI-краулеров в июне 2026 — обучение моделей. В весну 2025 эта доля была 22%.
- Более 36% — смешанные краулеры: один и тот же бот может и индексировать, и питать AI-ответы, и забирать данные на обучение.
- Чистый поисковый обход сохраняется, но его доля в общем потоке краулеров снижается — при том что для видимости в поиске он по-прежнему критичен.
Контекст платформы. Cloudflare фиксирует более широкий сдвиг: впервые более половины интернет-трафика — не человеческий; пользователи всё чаще получают сводный ответ из AI вместо перехода по ссылкам. Издатели готовятся к сценарию «нулевого Google» — когда реферальный трафик из поиска стремится к нулю, а контент всё равно потребляется в чужих AI-системах.
Рынок лицензий. Cloudflare описывает формирующийся рынок: более 50 соглашений издатель — AI-компания с 2023 года, коллективные модели лицензирования, инструменты атрибуции и блокировки на уровне сети. Это не универсальная компенсация потерянной рекламы и партнёрского трафика — но сигнал, что переговоры о доступе к контенту стали нормой, а не исключением.
Смешанные боты Google. Отдельный блок отчёта: Google, по оценке Cloudflare, использует смешанный краулер — сложнее разрешить участие в поиске, не открыв при этом контент для AI-экосистемы Google. Другие крупные AI-провайдеры чаще разделяют краулеры для обнаружения и для обучения.
Почему это важно для бизнеса
Десятилетиями модель была простой: вы открываете контент → поиск приводит людей → люди конвертируются. Сейчас контент могут потреблять без визита: ответ собирается из ваших страниц, бренд упоминается косвенно или теряется, а уникальная методология уходит в чужие базы знаний и обучение моделей без оплаты.
Полная блокировка всех AI-ботов — тоже проигрыш: вы рискуете исчезнуть из AI-поиска и генеративных рекомендаций, пока конкуренты остаются цитируемыми (индекс 5W показывает, что разные движки тянут разные источники).
Управление доступом становится частью маркетинговой и коммерческой стратегии наравне с GEO, контекстной рекламой и партнёрскими программами. Это пересекается с регуляторикой: в ЕС с 2 августа действуют обязательные правила маркировки AI-контента (ст. 50 AI Act) — прозрачность происхождения и контроль доступа идут в одном направлении.
Что меняется для маркетинга
- Инвентаризация по ценности, а не по адресам страниц. Не «закрыть весь сайт», а разделить: что должно находиться, что можно отдавать по лицензии, что нельзя отдавать ни при каких условиях.
- Машиночитаемость — осознанный выбор. Каталог, FAQ, публичная экспертиза и файл для AI-краулеров имеют смысл оставить структурированными — но исследования, методологии, прайсы для партнёров и уникальные базы стоит защищать.
- Метрики смещаются. Рядом с органическим трафиком — логи краулеров, соотношение «обход → визит», упоминания бренда в генеративных ответах (как в рекламе для агентов у Time).
- Доверие как валюта. Пользователи чаще пользуются AI-поиском, но доверяют меньше (Fractl, Q2 2026). Лицензируемый и проверяемый контент — аргумент и в переговорах с платформами, и в глазах аудитории.
Мой вывод
Cloudflare описывает не будущее, а уже сложившийся расклад: краулеры массово работают на обучение и смешанные сценарии, а не «просто на SEO». Для бизнеса с сильной экспертизой на сайте — методология, кейсы, исследования, калькуляторы — пассивное «лежит в открытом доступе» превращается в бесплатную поставку сырья чужим моделям.
Практичная позиция — не максимальная стена и не полная открытость, а три уровня доступа с разными правилами для каждого типа материала. Это та же логика, что с платным программным интерфейсом (API) или закрытым разделом для клиентов — только теперь контрагенты включают AI-компании и агрегаторы ответов.
Что проверить сейчас
- Трёхуровневая карта контента. Разметьте разделы сайта:
- открытые для обнаружения (каталог, FAQ, публичные статьи); - доступные AI только по лицензии или платному API (глубокая аналитика, отраслевые отчёты); - полностью закрытые (внутренние базы, персональные данные, коммерческие расчёты). Условие успеха: у каждого типа страниц — явное правило «разрешить / заблокировать / платный доступ» в файле robots.txt, на CDN или в межсетевом экране приложений.
- Лог AI-краулеров за 30 дней. Если домен за Cloudflare или другой сетью доставки контента — выгрузите, кто ходил, с какой частотой и на какие страницы. Сопоставьте с падением реферального трафика из поиска и AI-чатов. Успех — список десяти адресов, которые обходят боты, но почти не дают визитов.
- Пилот на одном ценном активе. Выберите один закрытый или полузакрытый материал (методология, исследование) и проверьте: что видит генеративный ответ по вашему бренду без этого файла и что меняется, если открыть только машиночитаемую выжимку с явной лицензией. Зафиксируйте — стоит ли переговоры о доступе или лучше держать закрытым.
Источники
- Content Independence Day, one year on — building the business model for the agentic Internet — Cloudflare, 2026-07-01
- Transparency obligations under Article 50 of the AI Act — FAQs — European Commission, 2026-07-24