Разработка

ИИ-краулеры: пускать на сайт или закрывать

ИИ-краулеры — боты, которые читают сайты для обучения моделей и для ответов ассистентов: GPTBot и OAI-SearchBot у OpenAI, ClaudeBot и Claude-SearchBot у Anthropic, PerplexityBot, Google-Extended, YandexAdditional и другие. Ключевая мысль, из-за которой решение перестало быть бинарным: одни боты собирают данные для обучения и ничего вам не возвращают, другие ходят по сайту в момент ответа пользователю и ставят ссылку на источник. Закрыть всех — значит выпасть из ИИ-ответов; открыть всех — значит согласиться на обучение на своём контенте. Разбираем, кто есть кто, что реально даёт robots.txt, почему контроль переезжает на сетевой уровень и как выбрать режим под свою модель бизнеса.

16 августа 2026 г.12 мин чтенияРедакция Юнкис

Коротко о главном

  • ИИ-краулеры делятся на обучающих, поисковых для ИИ-ответов и заходящих по просьбе пользователя — блокировать их «пакетом» почти всегда ошибка.
  • robots.txt — соглашение с добросовестными ботами: он управляет поведением, но не защищает от тех, кто не собирается его соблюдать.
  • Контроль переезжает на сетевой уровень: Cloudflare с 15 сентября 2026 года блокирует по умолчанию Training и Agent на страницах с рекламой у новых доменов.
  • Выбор режима зависит от модели бизнеса: сайту услуг выгодно быть в ИИ-ответах, платному контенту — закрывать всё, кроме витрины.
  • После любой правки правил проверяйте последствия: переходы с доменов ИИ-сервисов и присутствие сайта в ответах по ключевым вопросам.

1Три типа ботов, которых путают между собой

Первый тип — обучающие. Они собирают тексты, чтобы на них училась модель. Обратной связи для сайта нет: ссылку такой бот не поставит, посетителя не приведёт, эффект появится когда-нибудь внутри весов модели. К этому типу относятся, например, GPTBot у OpenAI, ClaudeBot у Anthropic, а также Google-Extended и Applebot-Extended — специальные правила, которыми Google и Apple разделяют обычную поисковую индексацию и использование контента для обучения.

Второй тип — поисковые для ИИ-ответов. Они индексируют страницы, чтобы ассистент мог сослаться на них в ответе: OAI-SearchBot, Claude-SearchBot, PerplexityBot. Здесь обмен честный: вы отдаёте контент, ассистент показывает ссылку и может привести человека. Третий тип — по требованию пользователя: ChatGPT-User, Claude-User, Perplexity-User. Они заходят на страницу в момент, когда конкретный человек попросил ассистента открыть ссылку или проверить сайт. Блокировать их — то же самое, что отказать в визите живому посетителю, просто пришедшему через другой интерфейс.

  • Обучающие: GPTBot, ClaudeBot, Google-Extended, Applebot-Extended — берут контент, ничего не возвращают.
  • Поисковые для ИИ-ответов: OAI-SearchBot, Claude-SearchBot, PerplexityBot — дают ссылку в ответе.
  • По запросу пользователя: ChatGPT-User, Claude-User, Perplexity-User — заходят по просьбе конкретного человека.
  • У Яндекса есть отдельный YandexAdditional для дополнительных сценариев обработки контента.
  • Блокировка «всех ИИ-ботов» одной строкой обычно означает и выпадение из ИИ-ответов.

2Что реально даёт robots.txt

robots.txt — это просьба, а не забор. Крупные и публичные краулеры её соблюдают: им дороже репутация, чем ваш контент. Но техническая возможность игнорировать файл есть у любого клиента, и часть менее известных сборщиков ей пользуется. Отсюда правило: robots.txt подходит, чтобы управлять поведением добросовестных ботов, и не подходит как средство защиты от тех, кто заведомо не собирается вас слушать.

Второй нюанс — гранулярность. Правила задаются на пары «user-agent + путь», поэтому осмысленная политика выглядит не как одна строка «запретить всё», а как список: этому боту можно всё кроме личного кабинета, этому — только публичные разделы, этот запрещён целиком. И третий момент, о котором забывают: закрыв раздел в robots.txt, вы закрываете его и от индексации в обычном поиске, если правило написано для поискового user-agent. Смешивать эти задачи в одном файле легко, а последствия видны не сразу.

  • robots.txt — соглашение с добросовестными ботами, не техническая защита.
  • Правила задаются по парам «user-agent + путь»: политика должна быть списком, а не одной строкой.
  • Служебные разделы (личный кабинет, корзина, поиск по сайту) закрывают всем ботам одинаково.
  • Ошибка в user-agent приводит к тому, что правило просто не применяется — проверяйте написание.
  • Файл публичный: он показывает структуру сайта всем желающим, включая тех, кого вы закрываете.

3Контроль переезжает на сетевой уровень

В 2026 году управление ИИ-трафиком заметно сместилось с уровня файла на уровень инфраструктуры. Показательный пример — Cloudflare: 1 июля 2026 года компания объявила о разделении ИИ-краулеров на три категории — Search (индексация для поиска), Agent (действия от имени пользователя) и Training (сбор данных для обучения). С 15 сентября 2026 года для новых доменов категории Training и Agent блокируются по умолчанию на страницах с рекламой, а Search остаётся разрешён. Настройки доступны всем клиентам, включая бесплатный тариф.

Параллельно развивается механика Pay Per Crawl: краулер получает ответ HTTP 402 «требуется оплата», а владелец сайта назначает цену доступа; часть служебных адресов вроде /robots.txt и /sitemap.xml остаётся бесплатной всегда. Оценивать эту конструкцию как способ заработка небольшому сайту рано, но сам сдвиг важен: отказ, который раньше был просьбой в текстовом файле, теперь исполняется на уровне сети. И для владельца сайта это означает необходимость принять решение явно — иначе его примут дефолты провайдера.

  • Cloudflare делит ИИ-ботов на Search, Agent и Training — выбор перестал быть бинарным.
  • С 15 сентября 2026 года Training и Agent блокируются по умолчанию на страницах с рекламой у новых доменов.
  • Pay Per Crawl: доступ по цене владельца, ответ HTTP 402 вместо контента.
  • Сетевой уровень исполняет запрет реально, в отличие от robots.txt.
  • Если сайт за CDN — проверьте настройки до того, как за вас решат дефолты.

4Как выбрать режим под свою бизнес-модель

Разумный выбор зависит от того, как контент приносит вам деньги. Если сайт — витрина услуг и источник заявок, логично открыть поисковых ИИ-ботов и ботов по запросу пользователя: цитирование в ответе работает как рекомендация, а переход из ассистента приводит человека, уже знающего, к кому он идёт. Обучающих ботов при этом можно закрыть — на приток клиентов они не влияют.

Если контент и есть продукт — платные исследования, база курсов, уникальные обзоры, — картина другая: открытой должна быть витрина и бесплатная часть, а закрытым всё, за что платят. Если сайт живёт на рекламных показах, стоит внимательно оценить обмен: ответ ассистента часто снимает необходимость переходить, и обучающий трафик тут особенно невыгоден. Отдельная категория — медицинские, юридические и финансовые проекты: там имеет смысл отдельно подумать, в каком виде ваши формулировки будут пересказаны без контекста.

  • Сайт услуг и лидогенерация: поисковые ИИ-боты — открыть, обучающие — по желанию закрыть.
  • Контент как продукт: открыта витрина и бесплатная часть, платное закрыто.
  • Рекламная монетизация: оцените обмен трезво — ответ без перехода не приносит показов.
  • Чувствительные ниши: отдельно продумайте, как ваши формулировки выглядят вне контекста.
  • Пересматривайте решение раз в полгода: список ботов и правила площадок меняются быстро.

5Как это выглядит на практике

Начните с инвентаризации: посмотрите в логах веб-сервера, какие user-agent к вам ходят, как часто и по каким разделам. Обычно выясняется две вещи — во-первых, ИИ-ботов больше, чем казалось, во-вторых, значительная часть запросов приходится на страницы, которые вы вообще не собирались отдавать: результаты внутреннего поиска, версии для печати, страницы фильтров. Это ещё и вопрос нагрузки, а не только политики.

Дальше опишите правила явно: отдельный блок на каждый значимый user-agent, служебные разделы закрыты всем, публичные открыты тем, кто возвращает ссылку. Если нужен реальный запрет, а не просьба, — дублируйте его на уровне CDN или веб-сервера. И заведите привычку проверять последствия: после изменения правил смотрите, не пропали ли переходы с доменов ИИ-сервисов и не исчез ли сайт из ответов по вашим ключевым вопросам. Ошибку в одной строке robots.txt легко не заметить месяцами.

  • Шаг 1: инвентаризация ботов по логам — кто, куда и как часто ходит.
  • Шаг 2: закрыть служебные и «мусорные» разделы всем ботам сразу.
  • Шаг 3: явные правила по каждому значимому ИИ-краулеру.
  • Шаг 4: реальный запрет — на уровне CDN или сервера, а не только в robots.txt.
  • Шаг 5: контроль последствий — переходы из ассистентов и присутствие в ответах.

6Частые ошибки

Первая и самая дорогая — закрыть всех ИИ-ботов одной строкой «на всякий случай». Вместе с обучающими под запрет попадают поисковые и те, что заходят по просьбе пользователя, — сайт исчезает из ИИ-ответов и перестаёт открываться, когда клиент просит ассистента проверить вашу страницу. Вторая ошибка — обратная: открыть всё, не подумав, и потом обнаружить, что база знаний, которую собирали годами, ушла в обучение целиком.

Третья ошибка техническая: правила пишут для несуществующих или неправильно написанных user-agent, и они молча не применяются. Четвёртая — считать robots.txt защитой и не ставить ничего на сетевом уровне там, где запрет действительно важен. И пятая, организационная: принять решение один раз и забыть. Список ботов, их назначение и дефолты провайдеров меняются несколько раз в год — политику доступа стоит пересматривать по календарю, вместе с другими регулярными проверками сайта.

  • Не блокируйте всех ИИ-ботов одной строкой — вместе с обучающими уйдут поисковые.
  • Не открывайте всё по умолчанию, если контент и есть ваш продукт.
  • Проверяйте точное написание user-agent: опечатка отключает правило целиком.
  • Реальный запрет ставится на сетевом уровне, robots.txt его не обеспечивает.
  • Пересматривайте политику раз в полгода — правила и дефолты меняются.

Частые вопросы

Как запретить нейросетям обучаться на моём сайте?+
В robots.txt добавьте правила для обучающих user-agent — GPTBot, ClaudeBot, Google-Extended, Applebot-Extended и других, — оставив открытыми поисковых ботов ИИ-ответов. Помните, что robots.txt соблюдается добросовестно, но технически не обязателен: если запрет принципиален, продублируйте его на уровне CDN или веб-сервера, где отказ действительно исполняется.
Потеряю ли я трафик, если закрою ИИ-краулеров?+
Зависит от того, кого именно вы закрыли. Блокировка обучающих ботов на трафик почти не влияет — они и так ничего не возвращают. А вот блокировка поисковых ботов ассистентов и ботов «по запросу пользователя» убирает сайт из ИИ-ответов и мешает ассистенту открыть вашу страницу, когда об этом просит живой клиент.
Обязаны ли ИИ-компании соблюдать robots.txt?+
Юридической обязанности нет, это отраслевое соглашение. Крупные публичные краулеры его соблюдают, потому что дорожат репутацией и договорённостями с площадками. Менее известные сборщики могут игнорировать файл. Поэтому для контента, который действительно нельзя отдавать, правильный уровень контроля — сетевой: фильтрация на CDN, ограничение по частоте запросов, авторизация.
Что изменится 15 сентября 2026 года у Cloudflare?+
С этой даты для новых доменов начинают действовать новые дефолты: краулеры категорий Training (сбор данных для обучения) и Agent (действия от имени пользователя) блокируются по умолчанию на страницах, где показывается реклама, а Search остаётся разрешён. Если ваш сайт за Cloudflare, зайдите в настройки ИИ-трафика и выберите режим осознанно, не полагаясь на значения по умолчанию.
ии-краулерыrobots.txtgptbotcloudflareтехническое seo

Настроим доступ ИИ-ботов под вашу модель бизнеса

Студия Юнкис разбирает логи, составляет явные правила по каждому краулеру и дублирует критичные запреты на сетевом уровне — так, чтобы сайт остался в ИИ-ответах, но не отдавал лишнего. Оставьте заявку — начнём с аудита того, кто к вам ходит сейчас.

Обсудить настройку