ИИ-краулеры: GPTBot, PerplexityBot и доступ к сайту
Нейросети попадают на ваш сайт через собственных ботов — LLM-краулеров. Если сайт их не пускает, никакой контент и никакая разметка не помогут: модель просто не увидит источник.
Что такое LLM-краулер и зачем он ходит на сайт
LLM-краулер — программа, которая обходит страницы и забирает текст для нужд языковой модели. У таких ботов две разные задачи. Первая — сбор данных для обучения модели: он влияет на то, что модель «знает» о вашей компании в принципе. Вторая — обращение к сайту прямо во время ответа пользователю, когда модель ищет свежие факты.
Разница принципиальна. Обучающий обход даёт долгий эффект и работает с задержкой. Обход во время ответа даёт эффект почти сразу: если ваша страница доступна и отвечает на вопрос, она может попасть в ответ сегодня. Как устроен этот механизм подбора источников, мы разбираем отдельно.
Какие боты приходят к российскому бизнесу
Набор ботов меняется, но основные группы стабильны:
- GPTBot и связанные с ним агенты OpenAI — обход для ChatGPT.
- PerplexityBot — краулер Perplexity, ориентированный на поиск источников для ответа со ссылками.
- ClaudeBot и другие боты разработчиков моделей.
- Google-Extended — управляет использованием контента сервисами Google на базе ИИ.
- Боты российских экосистем, обслуживающие Алису и GigaChat.
Все они представляются в заголовке User-Agent, поэтому их видно в логах сервера. Отдельная тонкость: часть ботов уважает robots.txt, часть смотрит только на технические ограничения хостинга и защиты от DDoS. Полностью гарантировать поведение чужого краулера нельзя — можно только не мешать ему.
Как проверить, пускаете ли вы ИИ-ботов
Первый шаг — открыть свой robots.txt и посмотреть, нет ли там запрещающих правил для перечисленных агентов. Иногда такие строки добавляют разработчики или подрядчики без обсуждения с бизнесом, и владелец сайта об этом не знает.
Второй — заглянуть в логи сервера и поискать упоминания GPTBot и PerplexityBot за последние недели. Если их нет вообще, стоит проверить настройки хостинга, CDN и антибот-защиты: часто именно они молча режут незнакомые user-agent.
Третий — убедиться, что важные страницы отдаются без обязательного JavaScript. Многие краулеры читают HTML и не выполняют скрипты, поэтому текст, который подгружается динамически, для них не существует. Полный список проверок собран в чек-листе готовности сайта к AI-поиску.
Что открывать, а что закрывать
Общая логика: открывать всё, что вы и так показываете клиентам, и закрывать только служебное. Открыты должны быть описания услуг, цены, ответы на вопросы, страницы контактов и экспертные материалы. Закрывать имеет смысл личные кабинеты, корзину, результаты внутреннего поиска и технические разделы.
Иногда бизнес хочет закрыть контент от ИИ полностью, чтобы «не отдавать его бесплатно». Это осознанный выбор, но он равносилен отказу от канала: нейросеть не сможет вас назвать, зато назовёт конкурента, который открыт. Для большинства сервисных компаний выгода от упоминания выше, чем риск копирования описаний услуг.
Отдельно стоит добавить файл llms.txt — короткую сводку о компании и карту важных материалов для языковых моделей. Он не заменяет robots.txt, а дополняет его, помогая модели быстрее понять, что вы за организация.
Если вы не уверены, что происходит с доступом на вашем сайте, это первое, что стоит проверить: техническая блокировка обесценивает любые дальнейшие работы.
Частые вопросы
Опасно ли пускать ИИ-краулеров на сайт?
Как узнать, заходил ли GPTBot на мой сайт?
Что будет, если закрыть все ИИ-боты?
Достаточно ли только robots.txt, чтобы вас читали?
Проверим, пускает ли ваш сайт ИИ-ботов
В бесплатном аудите смотрим robots.txt, доступность контента без JavaScript и следы ИИ-краулеров — и говорим, что мешает моделям вас читать.
→ Получить бесплатный аудит