Обновлено 31 августа 2026
Обновлено в июле 2026 · 35 юзер-агентов

Матрица веб-краулеров: кого пускать и кого блокировать

Сводный реестр ИИ-пауков, ассистентов реального времени и поисковых систем. Кликните по названию бота, чтобы скопировать его User-Agent, или воспользуйтесь генератором правил для WAF.

⚡ Экспресс-настройка WAF и Nginx
Скопируйте готовый синтаксис правил для блокировки вредных ботов в один клик

🤖 1. ИИ-пылесосы для сбора датасетов (AI Crawlers) 15

Краулер (User-Agent) Категория Что делает на сайте Вердикт Рекомендация по блокировке
ClaudeBot
Anthropic
ClaudeBot
AI Crawler Скачивает весь контент сайта целиком для обучения будущих поколений языковых моделей Claude. 🔴 Блокировать Блокировать, если контент — ваш продукт: в модель он уйдёт без ссылки и имени. Пускать осознанно, если ставка — чтобы Claude знал вас и ваши тексты.
GPTBot
OpenAI
GPTBot
AI Crawler Выкачивает тексты, статьи и базы знаний для обучения будущих версий моделей GPT. 🔴 Блокировать Блокировать, если контент — ваш продукт. Пускать осознанно, если ставка — узнаваемость в ответах ChatGPT.
Google-Extended
Google
нет собственного UA — токен robots.txt
AI Crawler Токен управления сбором данных под обучение Gemini. Собственного User-Agent не имеет — использует инфраструктуру Googlebot. На SEO не влияет. 🔴 Блокировать Отключается ТОЛЬКО через robots.txt (User-agent: Google-Extended, Disallow: /). Блокировка в WAF бесполезна.
Bytespider / TikTok Spider
ByteDance
Bytespider
AI Crawler Агрессивно парсит данные для китайских ИИ-алгоритмов и рекомендательной ленты TikTok. Игнорирует robots.txt и Crawl-delay. 🔴 Блокировать Блокировать по ASN (ByteDance) или сигнатуре.
CCBot
Common Crawl
CCBot
AI Crawler Собирает открытый веб в гигантский публичный датасет, который затем бесплатно используют все ИИ-компании мира. 🔴 Блокировать Блокировать в WAF или через правила сервера Nginx.
Amazonbot
Amazon
Amazonbot
AI Crawler Собирает информацию для ответов Alexa и обучения нейросетей семейства Amazon Titan. 🔴 Блокировать Блокировать в WAF Cloudflare или по юзер-агенту.
FacebookBot / Meta-ExternalAgent
Meta
FacebookBotmeta-externalagent
AI Crawler Массово сканирует сайты для обучения открытых и закрытых языковых моделей семейства Llama. 🔴 Блокировать Блокировать без сожаления в WAF.
Google-CloudVertexBot
Google Cloud
Google-CloudVertexBot
AI Crawler Используется корпоративными клиентами платформы Google Vertex AI для сбора пользовательских датасетов. 🔴 Блокировать Блокировать, если у вас нет прямых B2B-контрактов на базе Vertex.
Anchor Browser
Anchor
Anchor Browser
AI Crawler Агентный ИИ-браузер, сканирующий контент сайтов для своих внутренних нужд. 🔴 Блокировать Отправлять в бан (категория AI Crawler в Cloudflare).
Novellum AI Crawl
Novellum
Novellum AI Crawl
AI Crawler Сборщик датасетов для обучения алгоритмов компании Novellum. 🔴 Блокировать Блокировать в WAF Cloudflare.
Timpibot
Timpi
Timpibot
AI Crawler Децентрализованный поисковик/ИИ-краулер, собирающий контент пользователей. 🔴 Блокировать Блокировать в WAF.
Cloudflare Crawler
Cloudflare
Cloudflare Crawler
AI Crawler Внутренний сканер Cloudflare. Часто используется для кэширования и AI-моделей внутри экосистемы Cloudflare. 🟡 Проверять Оставлять, если используете Cloudflare-кэширование или их AI-сервисы.
ProRataInc
ProRata.ai
ProRataInc
AI Crawler Сканирует веб-контент для оценки авторских прав и компенсационных моделей генеративного ИИ. 🔴 Блокировать Блокировать на уровне файрвола.
PetalBot
Huawei
PetalBot
AI Crawler / Search Парсит контент для поисковых систем, мобильных сервисов и ИИ-движков компании Huawei. 🔴 Блокировать Блокировать, если не ориентируетесь на смартфоны без Google-сервисов.
Omgilibot
Webhose / SimilarWeb
omgili
AI Crawler Массовый скрапер дискуссий, новостей и форумов, данные из которого потом покупают ИИ-компании. 🔴 Блокировать Один из старейших агрессивных парсеров — блокировать обязательно.
ClaudeBot
Anthropic · AI Crawler
ClaudeBot
🔴 Блокировать
Скачивает весь контент сайта целиком для обучения будущих поколений языковых моделей Claude.
Рекомендация по настройке WAF:
Блокировать, если контент — ваш продукт: в модель он уйдёт без ссылки и имени. Пускать осознанно, если ставка — чтобы Claude знал вас и ваши тексты.
GPTBot
OpenAI · AI Crawler
GPTBot
🔴 Блокировать
Выкачивает тексты, статьи и базы знаний для обучения будущих версий моделей GPT.
Рекомендация по настройке WAF:
Блокировать, если контент — ваш продукт. Пускать осознанно, если ставка — узнаваемость в ответах ChatGPT.
Google-Extended
Google · AI Crawler
нет собственного UA — токен robots.txt
🔴 Блокировать
Токен управления сбором данных под обучение Gemini. Собственного User-Agent не имеет — использует инфраструктуру Googlebot. На SEO не влияет.
Рекомендация по настройке WAF:
Отключается ТОЛЬКО через robots.txt (User-agent: Google-Extended, Disallow: /). Блокировка в WAF бесполезна.
Bytespider / TikTok Spider
ByteDance · AI Crawler
Bytespider
🔴 Блокировать
Агрессивно парсит данные для китайских ИИ-алгоритмов и рекомендательной ленты TikTok. Игнорирует robots.txt и Crawl-delay.
Рекомендация по настройке WAF:
Блокировать по ASN (ByteDance) или сигнатуре.
CCBot
Common Crawl · AI Crawler
CCBot
🔴 Блокировать
Собирает открытый веб в гигантский публичный датасет, который затем бесплатно используют все ИИ-компании мира.
Рекомендация по настройке WAF:
Блокировать в WAF или через правила сервера Nginx.
Amazonbot
Amazon · AI Crawler
Amazonbot
🔴 Блокировать
Собирает информацию для ответов Alexa и обучения нейросетей семейства Amazon Titan.
Рекомендация по настройке WAF:
Блокировать в WAF Cloudflare или по юзер-агенту.
FacebookBot / Meta-ExternalAgent
Meta · AI Crawler
FacebookBotmeta-externalagent
🔴 Блокировать
Массово сканирует сайты для обучения открытых и закрытых языковых моделей семейства Llama.
Рекомендация по настройке WAF:
Блокировать без сожаления в WAF.
Google-CloudVertexBot
Google Cloud · AI Crawler
Google-CloudVertexBot
🔴 Блокировать
Используется корпоративными клиентами платформы Google Vertex AI для сбора пользовательских датасетов.
Рекомендация по настройке WAF:
Блокировать, если у вас нет прямых B2B-контрактов на базе Vertex.
Anchor Browser
Anchor · AI Crawler
Anchor Browser
🔴 Блокировать
Агентный ИИ-браузер, сканирующий контент сайтов для своих внутренних нужд.
Рекомендация по настройке WAF:
Отправлять в бан (категория AI Crawler в Cloudflare).
Novellum AI Crawl
Novellum · AI Crawler
Novellum AI Crawl
🔴 Блокировать
Сборщик датасетов для обучения алгоритмов компании Novellum.
Рекомендация по настройке WAF:
Блокировать в WAF Cloudflare.
Timpibot
Timpi · AI Crawler
Timpibot
🔴 Блокировать
Децентрализованный поисковик/ИИ-краулер, собирающий контент пользователей.
Рекомендация по настройке WAF:
Блокировать в WAF.
Cloudflare Crawler
Cloudflare · AI Crawler
Cloudflare Crawler
🟡 Проверять
Внутренний сканер Cloudflare. Часто используется для кэширования и AI-моделей внутри экосистемы Cloudflare.
Рекомендация по настройке WAF:
Оставлять, если используете Cloudflare-кэширование или их AI-сервисы.
ProRataInc
ProRata.ai · AI Crawler
ProRataInc
🔴 Блокировать
Сканирует веб-контент для оценки авторских прав и компенсационных моделей генеративного ИИ.
Рекомендация по настройке WAF:
Блокировать на уровне файрвола.
PetalBot
Huawei · AI Crawler / Search
PetalBot
🔴 Блокировать
Парсит контент для поисковых систем, мобильных сервисов и ИИ-движков компании Huawei.
Рекомендация по настройке WAF:
Блокировать, если не ориентируетесь на смартфоны без Google-сервисов.
Omgilibot
Webhose / SimilarWeb · AI Crawler
omgili
🔴 Блокировать
Массовый скрапер дискуссий, новостей и форумов, данные из которого потом покупают ИИ-компании.
Рекомендация по настройке WAF:
Один из старейших агрессивных парсеров — блокировать обязательно.

⚡ 2. ИИ-поисковики и автономные ассистенты (AI Search / Assistants) 9

Краулер (User-Agent) Категория Что делает на сайте Вердикт Рекомендация по блокировке
PerplexityBot / Perplexity-User
Perplexity AI
PerplexityBotPerplexity-User
AI Search / Assistant PerplexityBot индексирует сайт для поиска Perplexity, Perplexity-User приходит по живому запросу пользователя. Пользователи часто кликают на источники. 🟠 Лимитировать Не банить! Rate limit 60 req/min — растущий канал переходов (GEO). Учтите: Cloudflare ловила Perplexity на stealth-краулинге в обход robots.txt, лимит по UA видит только официальный трафик.
OAI-SearchBot / ChatGPT-User
OpenAI
OAI-SearchBotChatGPT-User
AI Search / Assistant OAI-SearchBot индексирует сайт для поиска ChatGPT. ChatGPT-User — маркер живого запроса пользователя, а не бот обучения. 🟠 Лимитировать Не банить! Rate limit 60 req/min, иначе выпадете из ответов ChatGPT и потеряете читателей.
Claude-User
Anthropic
Claude-User
AI Assistant Приходит по команде живого пользователя в чате Claude — прочитать страницу по ссылке или найти свежий ответ. 🟠 Лимитировать Не банить: за запросом стоит реальный человек. Rate limit 60 req/min.
Claude-SearchBot
Anthropic
Claude-SearchBot
AI Search Индексирует сайт для поиска внутри ассистента Claude — аналог поискового индекса, но для ИИ-ответов. 🟠 Лимитировать Лимитировать, если хотите попадать в ответы Claude со ссылкой на источник.
MistralAI-User
Mistral
MistralAI-User
AI Assistant Прямой поиск от имени чат-бота Le Chat (Mistral) по живому запросу пользователя в реальном времени. 🟠 Лимитировать Лимитировать по частоте, банить только при аномальной нагрузке.
Manus Bot
Manus AI
Manus Bot
AI Assistant Автономный ИИ-агент, который выполняет практические задачи пользователя, парся страницы вашего сайта. 🟠 Лимитировать Rate limit + JS-челлендж. Банить, если игнорирует лимиты.
DuckAssistBot
DuckDuckGo
DuckAssistBot
AI Assistant Ассистент DuckDuckGo: парсит сайты для генерации ответов в поиске со ссылкой на источник. 🟠 Лимитировать Не банить, лимитировать по частоте — приводит аудиторию DuckDuckGo.
Meta-ExternalFetcher
Meta
meta-externalfetcher
AI Assistant Переходит по ссылкам, которые пользователи отправили в чаты WhatsApp/Instagram и Meta AI. 🟠 Лимитировать Полная блокировка сломает превью ваших ссылок в WhatsApp. Только rate limit.
Applebot / Applebot-Extended
Apple
Applebot
AI Search Applebot индексирует сайты для Siri и Spotlight. Applebot-Extended — токен в robots.txt, запрещающий использовать данные для обучения Apple Intelligence. 🟡 Проверять Applebot оставлять ради трафика Apple. Обучение отключать строкой Applebot-Extended в robots.txt.
PerplexityBot / Perplexity-User
Perplexity AI · AI Search / Assistant
PerplexityBotPerplexity-User
🟠 Лимитировать
PerplexityBot индексирует сайт для поиска Perplexity, Perplexity-User приходит по живому запросу пользователя. Пользователи часто кликают на источники.
Рекомендация по настройке WAF:
Не банить! Rate limit 60 req/min — растущий канал переходов (GEO). Учтите: Cloudflare ловила Perplexity на stealth-краулинге в обход robots.txt, лимит по UA видит только официальный трафик.
OAI-SearchBot / ChatGPT-User
OpenAI · AI Search / Assistant
OAI-SearchBotChatGPT-User
🟠 Лимитировать
OAI-SearchBot индексирует сайт для поиска ChatGPT. ChatGPT-User — маркер живого запроса пользователя, а не бот обучения.
Рекомендация по настройке WAF:
Не банить! Rate limit 60 req/min, иначе выпадете из ответов ChatGPT и потеряете читателей.
Claude-User
Anthropic · AI Assistant
Claude-User
🟠 Лимитировать
Приходит по команде живого пользователя в чате Claude — прочитать страницу по ссылке или найти свежий ответ.
Рекомендация по настройке WAF:
Не банить: за запросом стоит реальный человек. Rate limit 60 req/min.
Claude-SearchBot
Anthropic · AI Search
Claude-SearchBot
🟠 Лимитировать
Индексирует сайт для поиска внутри ассистента Claude — аналог поискового индекса, но для ИИ-ответов.
Рекомендация по настройке WAF:
Лимитировать, если хотите попадать в ответы Claude со ссылкой на источник.
MistralAI-User
Mistral · AI Assistant
MistralAI-User
🟠 Лимитировать
Прямой поиск от имени чат-бота Le Chat (Mistral) по живому запросу пользователя в реальном времени.
Рекомендация по настройке WAF:
Лимитировать по частоте, банить только при аномальной нагрузке.
Manus Bot
Manus AI · AI Assistant
Manus Bot
🟠 Лимитировать
Автономный ИИ-агент, который выполняет практические задачи пользователя, парся страницы вашего сайта.
Рекомендация по настройке WAF:
Rate limit + JS-челлендж. Банить, если игнорирует лимиты.
DuckAssistBot
DuckDuckGo · AI Assistant
DuckAssistBot
🟠 Лимитировать
Ассистент DuckDuckGo: парсит сайты для генерации ответов в поиске со ссылкой на источник.
Рекомендация по настройке WAF:
Не банить, лимитировать по частоте — приводит аудиторию DuckDuckGo.
Meta-ExternalFetcher
Meta · AI Assistant
meta-externalfetcher
🟠 Лимитировать
Переходит по ссылкам, которые пользователи отправили в чаты WhatsApp/Instagram и Meta AI.
Рекомендация по настройке WAF:
Полная блокировка сломает превью ваших ссылок в WhatsApp. Только rate limit.
Applebot / Applebot-Extended
Apple · AI Search
Applebot
🟡 Проверять
Applebot индексирует сайты для Siri и Spotlight. Applebot-Extended — токен в robots.txt, запрещающий использовать данные для обучения Apple Intelligence.
Рекомендация по настройке WAF:
Applebot оставлять ради трафика Apple. Обучение отключать строкой Applebot-Extended в robots.txt.
Краулер (User-Agent) Категория Что делает на сайте Вердикт Рекомендация по блокировке
Googlebot
Google
Googlebot
Search Engine Crawler Индексирует страницы для классического поиска Google. Основной источник органического трафика. 🟢 Разрешить Оставлять обязательно ради поискового трафика (SEO). Проверять rDNS!
YandexBot
Yandex
YandexBot
Search Engine Crawler Главный индексатор Яндекса. Критически важен для получения поискового трафика в рунете. 🟢 Разрешить Оставлять обязательно для RU-аудитории. Проверять подлинность IP.
BingBot
Microsoft
bingbot
Search Engine Crawler Индексирует страницы для поисковой системы Bing и партнёров (Yahoo, DuckDuckGo). Индекс Bing используют и многие ИИ-поисковики. 🟢 Разрешить Оставлять для сохранения SEO-позиций и видимости в ИИ-поиске.
archive.org_bot
Internet Archive
archive.org_bot
Archiver Сохраняет копии страниц в Wayback Machine. Снимки архива принимаются судами как доказательство того, что информация была опубликована. 🔴 Блокировать Блокировать, если управляете юридическими рисками: нет снимка — нечего предъявить. UA-блок останавливает только новые обходы: старые снимки удаляются отдельным запросом в Internet Archive, а ручной Save Page Now ходит другими фетчерами.
Arquivo Web Crawler
Arquivo
arquivo-web-crawler
Archiver Португальский веб-архив, сохраняющий историю сайтов аналогично Wayback Machine. 🟢 Разрешить Безобидный архиватор, можно оставить.
Baiduspider
Baidu
Baiduspider
Search Engine Crawler Крупнейший китайский поисковый робот. Часто создает фоновую нагрузку, не принося полезной аудитории. 🟡 Проверять Блокировать, если ваш бизнес не рассчитан на аудиторию из Китая.
Terracotta Bot
Ceramic
Terracotta Bot
Search Engine Crawler Поисковый робот для децентрализованных сетей данных (Ceramic Network). 🟡 Проверять Редкий бот, блокировать при высокой нагрузке.
AhrefsBot
Ahrefs
AhrefsBot
SEO Crawler Один из самых активных краулеров мира: строит индекс обратных ссылок Ahrefs. Людей не приводит, зато кормит отчёты ваших конкурентов. 🟡 Проверять Пользуетесь Ahrefs для своих аудитов — оставляйте. Нет — закрывайте в robots.txt, он его соблюдает.
SemrushBot
Semrush
SemrushBot
SEO Crawler Собирает ссылки, позиции и данные аудита для SEO-платформы Semrush. По активности сравним с AhrefsBot. 🟡 Проверять Та же логика: свой инструмент — оставляйте, чужой — блокируйте через robots.txt.
MJ12bot
Majestic
MJ12bot
SEO Crawler Распределённый краулер ссылочного индекса Majestic. Ходит с тысяч IP обычных пользователей, из-за чего выглядит как атака. 🟡 Проверять Robots.txt соблюдает, но медленно. Не пользуетесь Majestic — блокируйте по User-Agent, по IP бесполезно.
DotBot
Moz
DotBot
SEO Crawler Краулер ссылочного индекса Moz (Domain Authority). Умеренно активен, robots.txt уважает. 🟡 Проверять Не работаете с Moz — закрывайте в robots.txt заодно с остальной SEO-четвёркой.
Googlebot
Google · Search Engine Crawler
Googlebot
🟢 Разрешить
Индексирует страницы для классического поиска Google. Основной источник органического трафика.
Рекомендация по настройке WAF:
Оставлять обязательно ради поискового трафика (SEO). Проверять rDNS!
YandexBot
Yandex · Search Engine Crawler
YandexBot
🟢 Разрешить
Главный индексатор Яндекса. Критически важен для получения поискового трафика в рунете.
Рекомендация по настройке WAF:
Оставлять обязательно для RU-аудитории. Проверять подлинность IP.
BingBot
Microsoft · Search Engine Crawler
bingbot
🟢 Разрешить
Индексирует страницы для поисковой системы Bing и партнёров (Yahoo, DuckDuckGo). Индекс Bing используют и многие ИИ-поисковики.
Рекомендация по настройке WAF:
Оставлять для сохранения SEO-позиций и видимости в ИИ-поиске.
archive.org_bot
Internet Archive · Archiver
archive.org_bot
🔴 Блокировать
Сохраняет копии страниц в Wayback Machine. Снимки архива принимаются судами как доказательство того, что информация была опубликована.
Рекомендация по настройке WAF:
Блокировать, если управляете юридическими рисками: нет снимка — нечего предъявить. UA-блок останавливает только новые обходы: старые снимки удаляются отдельным запросом в Internet Archive, а ручной Save Page Now ходит другими фетчерами.
Arquivo Web Crawler
Arquivo · Archiver
arquivo-web-crawler
🟢 Разрешить
Португальский веб-архив, сохраняющий историю сайтов аналогично Wayback Machine.
Рекомендация по настройке WAF:
Безобидный архиватор, можно оставить.
Baiduspider
Baidu · Search Engine Crawler
Baiduspider
🟡 Проверять
Крупнейший китайский поисковый робот. Часто создает фоновую нагрузку, не принося полезной аудитории.
Рекомендация по настройке WAF:
Блокировать, если ваш бизнес не рассчитан на аудиторию из Китая.
Terracotta Bot
Ceramic · Search Engine Crawler
Terracotta Bot
🟡 Проверять
Поисковый робот для децентрализованных сетей данных (Ceramic Network).
Рекомендация по настройке WAF:
Редкий бот, блокировать при высокой нагрузке.
AhrefsBot
Ahrefs · SEO Crawler
AhrefsBot
🟡 Проверять
Один из самых активных краулеров мира: строит индекс обратных ссылок Ahrefs. Людей не приводит, зато кормит отчёты ваших конкурентов.
Рекомендация по настройке WAF:
Пользуетесь Ahrefs для своих аудитов — оставляйте. Нет — закрывайте в robots.txt, он его соблюдает.
SemrushBot
Semrush · SEO Crawler
SemrushBot
🟡 Проверять
Собирает ссылки, позиции и данные аудита для SEO-платформы Semrush. По активности сравним с AhrefsBot.
Рекомендация по настройке WAF:
Та же логика: свой инструмент — оставляйте, чужой — блокируйте через robots.txt.
MJ12bot
Majestic · SEO Crawler
MJ12bot
🟡 Проверять
Распределённый краулер ссылочного индекса Majestic. Ходит с тысяч IP обычных пользователей, из-за чего выглядит как атака.
Рекомендация по настройке WAF:
Robots.txt соблюдает, но медленно. Не пользуетесь Majestic — блокируйте по User-Agent, по IP бесполезно.
DotBot
Moz · SEO Crawler
DotBot
🟡 Проверять
Краулер ссылочного индекса Moz (Domain Authority). Умеренно активен, robots.txt уважает.
Рекомендация по настройке WAF:
Не работаете с Moz — закрывайте в robots.txt заодно с остальной SEO-четвёркой.
🕵️‍♂️
По вашему запросу ничего не найдено. Проверьте опечатки или сбросьте фильтры.

Таблица открыта по лицензии CC BY 4.0: перепечатывать можно только с активной ссылкой на источник — «Денис Батранков, batrankov.ru»