Обновлено в июле 2026 · 35 юзер-агентов
Матрица веб-краулеров: кого пускать и кого блокировать
Сводный реестр ИИ-пауков, ассистентов реального времени и поисковых систем. Кликните по названию бота, чтобы скопировать его User-Agent, или воспользуйтесь генератором правил для WAF.
⚡ Экспресс-настройка WAF и Nginx
Скопируйте готовый синтаксис правил для блокировки вредных ботов в один клик
🤖 1. ИИ-пылесосы для сбора датасетов (AI Crawlers) 15
| Краулер (User-Agent) | Категория | Что делает на сайте | Вердикт | Рекомендация по блокировке |
|---|---|---|---|---|
|
ClaudeBot
Anthropic
ClaudeBot
|
AI Crawler | Скачивает весь контент сайта целиком для обучения будущих поколений языковых моделей Claude. | 🔴 Блокировать | Блокировать, если контент — ваш продукт: в модель он уйдёт без ссылки и имени. Пускать осознанно, если ставка — чтобы Claude знал вас и ваши тексты. |
|
GPTBot
OpenAI
GPTBot
|
AI Crawler | Выкачивает тексты, статьи и базы знаний для обучения будущих версий моделей GPT. | 🔴 Блокировать | Блокировать, если контент — ваш продукт. Пускать осознанно, если ставка — узнаваемость в ответах ChatGPT. |
|
Google-Extended
Google
нет собственного UA — токен robots.txt
|
AI Crawler | Токен управления сбором данных под обучение Gemini. Собственного User-Agent не имеет — использует инфраструктуру Googlebot. На SEO не влияет. | 🔴 Блокировать | Отключается ТОЛЬКО через robots.txt (User-agent: Google-Extended, Disallow: /). Блокировка в WAF бесполезна. |
|
Bytespider / TikTok Spider
ByteDance
Bytespider
|
AI Crawler | Агрессивно парсит данные для китайских ИИ-алгоритмов и рекомендательной ленты TikTok. Игнорирует robots.txt и Crawl-delay. | 🔴 Блокировать | Блокировать по ASN (ByteDance) или сигнатуре. |
|
CCBot
Common Crawl
CCBot
|
AI Crawler | Собирает открытый веб в гигантский публичный датасет, который затем бесплатно используют все ИИ-компании мира. | 🔴 Блокировать | Блокировать в WAF или через правила сервера Nginx. |
|
Amazonbot
Amazon
Amazonbot
|
AI Crawler | Собирает информацию для ответов Alexa и обучения нейросетей семейства Amazon Titan. | 🔴 Блокировать | Блокировать в WAF Cloudflare или по юзер-агенту. |
|
FacebookBot / Meta-ExternalAgent
Meta
FacebookBotmeta-externalagent
|
AI Crawler | Массово сканирует сайты для обучения открытых и закрытых языковых моделей семейства Llama. | 🔴 Блокировать | Блокировать без сожаления в WAF. |
|
Google-CloudVertexBot
Google Cloud
Google-CloudVertexBot
|
AI Crawler | Используется корпоративными клиентами платформы Google Vertex AI для сбора пользовательских датасетов. | 🔴 Блокировать | Блокировать, если у вас нет прямых B2B-контрактов на базе Vertex. |
|
Anchor Browser
Anchor
Anchor Browser
|
AI Crawler | Агентный ИИ-браузер, сканирующий контент сайтов для своих внутренних нужд. | 🔴 Блокировать | Отправлять в бан (категория AI Crawler в Cloudflare). |
|
Novellum AI Crawl
Novellum
Novellum AI Crawl
|
AI Crawler | Сборщик датасетов для обучения алгоритмов компании Novellum. | 🔴 Блокировать | Блокировать в WAF Cloudflare. |
|
Timpibot
Timpi
Timpibot
|
AI Crawler | Децентрализованный поисковик/ИИ-краулер, собирающий контент пользователей. | 🔴 Блокировать | Блокировать в WAF. |
|
Cloudflare Crawler
Cloudflare
Cloudflare Crawler
|
AI Crawler | Внутренний сканер Cloudflare. Часто используется для кэширования и AI-моделей внутри экосистемы Cloudflare. | 🟡 Проверять | Оставлять, если используете Cloudflare-кэширование или их AI-сервисы. |
|
ProRataInc
ProRata.ai
ProRataInc
|
AI Crawler | Сканирует веб-контент для оценки авторских прав и компенсационных моделей генеративного ИИ. | 🔴 Блокировать | Блокировать на уровне файрвола. |
|
PetalBot
Huawei
PetalBot
|
AI Crawler / Search | Парсит контент для поисковых систем, мобильных сервисов и ИИ-движков компании Huawei. | 🔴 Блокировать | Блокировать, если не ориентируетесь на смартфоны без Google-сервисов. |
|
Omgilibot
Webhose / SimilarWeb
omgili
|
AI Crawler | Массовый скрапер дискуссий, новостей и форумов, данные из которого потом покупают ИИ-компании. | 🔴 Блокировать | Один из старейших агрессивных парсеров — блокировать обязательно. |
ClaudeBot
Anthropic · AI Crawler
ClaudeBot
Скачивает весь контент сайта целиком для обучения будущих поколений языковых моделей Claude.
Рекомендация по настройке WAF:
Блокировать, если контент — ваш продукт: в модель он уйдёт без ссылки и имени. Пускать осознанно, если ставка — чтобы Claude знал вас и ваши тексты.
GPTBot
OpenAI · AI Crawler
GPTBot
Выкачивает тексты, статьи и базы знаний для обучения будущих версий моделей GPT.
Рекомендация по настройке WAF:
Блокировать, если контент — ваш продукт. Пускать осознанно, если ставка — узнаваемость в ответах ChatGPT.
Google-Extended
Google · AI Crawler
нет собственного UA — токен robots.txt
Токен управления сбором данных под обучение Gemini. Собственного User-Agent не имеет — использует инфраструктуру Googlebot. На SEO не влияет.
Рекомендация по настройке WAF:
Отключается ТОЛЬКО через robots.txt (User-agent: Google-Extended, Disallow: /). Блокировка в WAF бесполезна.
Bytespider / TikTok Spider
ByteDance · AI Crawler
Bytespider
Агрессивно парсит данные для китайских ИИ-алгоритмов и рекомендательной ленты TikTok. Игнорирует robots.txt и Crawl-delay.
Рекомендация по настройке WAF:
Блокировать по ASN (ByteDance) или сигнатуре.
CCBot
Common Crawl · AI Crawler
CCBot
Собирает открытый веб в гигантский публичный датасет, который затем бесплатно используют все ИИ-компании мира.
Рекомендация по настройке WAF:
Блокировать в WAF или через правила сервера Nginx.
Amazonbot
Amazon · AI Crawler
Amazonbot
Собирает информацию для ответов Alexa и обучения нейросетей семейства Amazon Titan.
Рекомендация по настройке WAF:
Блокировать в WAF Cloudflare или по юзер-агенту.
FacebookBot / Meta-ExternalAgent
Meta · AI Crawler
FacebookBotmeta-externalagent
Массово сканирует сайты для обучения открытых и закрытых языковых моделей семейства Llama.
Рекомендация по настройке WAF:
Блокировать без сожаления в WAF.
Google-CloudVertexBot
Google Cloud · AI Crawler
Google-CloudVertexBot
Используется корпоративными клиентами платформы Google Vertex AI для сбора пользовательских датасетов.
Рекомендация по настройке WAF:
Блокировать, если у вас нет прямых B2B-контрактов на базе Vertex.
Anchor Browser
Anchor · AI Crawler
Anchor Browser
Агентный ИИ-браузер, сканирующий контент сайтов для своих внутренних нужд.
Рекомендация по настройке WAF:
Отправлять в бан (категория AI Crawler в Cloudflare).
Novellum AI Crawl
Novellum · AI Crawler
Novellum AI Crawl
Сборщик датасетов для обучения алгоритмов компании Novellum.
Рекомендация по настройке WAF:
Блокировать в WAF Cloudflare.
Timpibot
Timpi · AI Crawler
Timpibot
Децентрализованный поисковик/ИИ-краулер, собирающий контент пользователей.
Рекомендация по настройке WAF:
Блокировать в WAF.
Cloudflare Crawler
Cloudflare · AI Crawler
Cloudflare Crawler
Внутренний сканер Cloudflare. Часто используется для кэширования и AI-моделей внутри экосистемы Cloudflare.
Рекомендация по настройке WAF:
Оставлять, если используете Cloudflare-кэширование или их AI-сервисы.
ProRataInc
ProRata.ai · AI Crawler
ProRataInc
Сканирует веб-контент для оценки авторских прав и компенсационных моделей генеративного ИИ.
Рекомендация по настройке WAF:
Блокировать на уровне файрвола.
PetalBot
Huawei · AI Crawler / Search
PetalBot
Парсит контент для поисковых систем, мобильных сервисов и ИИ-движков компании Huawei.
Рекомендация по настройке WAF:
Блокировать, если не ориентируетесь на смартфоны без Google-сервисов.
Omgilibot
Webhose / SimilarWeb · AI Crawler
omgili
Массовый скрапер дискуссий, новостей и форумов, данные из которого потом покупают ИИ-компании.
Рекомендация по настройке WAF:
Один из старейших агрессивных парсеров — блокировать обязательно.
⚡ 2. ИИ-поисковики и автономные ассистенты (AI Search / Assistants) 9
| Краулер (User-Agent) | Категория | Что делает на сайте | Вердикт | Рекомендация по блокировке |
|---|---|---|---|---|
|
PerplexityBot / Perplexity-User
Perplexity AI
PerplexityBotPerplexity-User
|
AI Search / Assistant | PerplexityBot индексирует сайт для поиска Perplexity, Perplexity-User приходит по живому запросу пользователя. Пользователи часто кликают на источники. | 🟠 Лимитировать | Не банить! Rate limit 60 req/min — растущий канал переходов (GEO). Учтите: Cloudflare ловила Perplexity на stealth-краулинге в обход robots.txt, лимит по UA видит только официальный трафик. |
|
OAI-SearchBot / ChatGPT-User
OpenAI
OAI-SearchBotChatGPT-User
|
AI Search / Assistant | OAI-SearchBot индексирует сайт для поиска ChatGPT. ChatGPT-User — маркер живого запроса пользователя, а не бот обучения. | 🟠 Лимитировать | Не банить! Rate limit 60 req/min, иначе выпадете из ответов ChatGPT и потеряете читателей. |
|
Claude-User
Anthropic
Claude-User
|
AI Assistant | Приходит по команде живого пользователя в чате Claude — прочитать страницу по ссылке или найти свежий ответ. | 🟠 Лимитировать | Не банить: за запросом стоит реальный человек. Rate limit 60 req/min. |
|
Claude-SearchBot
Anthropic
Claude-SearchBot
|
AI Search | Индексирует сайт для поиска внутри ассистента Claude — аналог поискового индекса, но для ИИ-ответов. | 🟠 Лимитировать | Лимитировать, если хотите попадать в ответы Claude со ссылкой на источник. |
|
MistralAI-User
Mistral
MistralAI-User
|
AI Assistant | Прямой поиск от имени чат-бота Le Chat (Mistral) по живому запросу пользователя в реальном времени. | 🟠 Лимитировать | Лимитировать по частоте, банить только при аномальной нагрузке. |
|
Manus Bot
Manus AI
Manus Bot
|
AI Assistant | Автономный ИИ-агент, который выполняет практические задачи пользователя, парся страницы вашего сайта. | 🟠 Лимитировать | Rate limit + JS-челлендж. Банить, если игнорирует лимиты. |
|
DuckAssistBot
DuckDuckGo
DuckAssistBot
|
AI Assistant | Ассистент DuckDuckGo: парсит сайты для генерации ответов в поиске со ссылкой на источник. | 🟠 Лимитировать | Не банить, лимитировать по частоте — приводит аудиторию DuckDuckGo. |
|
Meta-ExternalFetcher
Meta
meta-externalfetcher
|
AI Assistant | Переходит по ссылкам, которые пользователи отправили в чаты WhatsApp/Instagram и Meta AI. | 🟠 Лимитировать | Полная блокировка сломает превью ваших ссылок в WhatsApp. Только rate limit. |
|
Applebot / Applebot-Extended
Apple
Applebot
|
AI Search | Applebot индексирует сайты для Siri и Spotlight. Applebot-Extended — токен в robots.txt, запрещающий использовать данные для обучения Apple Intelligence. | 🟡 Проверять | Applebot оставлять ради трафика Apple. Обучение отключать строкой Applebot-Extended в robots.txt. |
PerplexityBot / Perplexity-User
Perplexity AI · AI Search / Assistant
PerplexityBotPerplexity-User
PerplexityBot индексирует сайт для поиска Perplexity, Perplexity-User приходит по живому запросу пользователя. Пользователи часто кликают на источники.
Рекомендация по настройке WAF:
Не банить! Rate limit 60 req/min — растущий канал переходов (GEO). Учтите: Cloudflare ловила Perplexity на stealth-краулинге в обход robots.txt, лимит по UA видит только официальный трафик.
OAI-SearchBot / ChatGPT-User
OpenAI · AI Search / Assistant
OAI-SearchBotChatGPT-User
OAI-SearchBot индексирует сайт для поиска ChatGPT. ChatGPT-User — маркер живого запроса пользователя, а не бот обучения.
Рекомендация по настройке WAF:
Не банить! Rate limit 60 req/min, иначе выпадете из ответов ChatGPT и потеряете читателей.
Claude-User
Anthropic · AI Assistant
Claude-User
Приходит по команде живого пользователя в чате Claude — прочитать страницу по ссылке или найти свежий ответ.
Рекомендация по настройке WAF:
Не банить: за запросом стоит реальный человек. Rate limit 60 req/min.
Claude-SearchBot
Anthropic · AI Search
Claude-SearchBot
Индексирует сайт для поиска внутри ассистента Claude — аналог поискового индекса, но для ИИ-ответов.
Рекомендация по настройке WAF:
Лимитировать, если хотите попадать в ответы Claude со ссылкой на источник.
MistralAI-User
Mistral · AI Assistant
MistralAI-User
Прямой поиск от имени чат-бота Le Chat (Mistral) по живому запросу пользователя в реальном времени.
Рекомендация по настройке WAF:
Лимитировать по частоте, банить только при аномальной нагрузке.
Manus Bot
Manus AI · AI Assistant
Manus Bot
Автономный ИИ-агент, который выполняет практические задачи пользователя, парся страницы вашего сайта.
Рекомендация по настройке WAF:
Rate limit + JS-челлендж. Банить, если игнорирует лимиты.
DuckAssistBot
DuckDuckGo · AI Assistant
DuckAssistBot
Ассистент DuckDuckGo: парсит сайты для генерации ответов в поиске со ссылкой на источник.
Рекомендация по настройке WAF:
Не банить, лимитировать по частоте — приводит аудиторию DuckDuckGo.
Meta-ExternalFetcher
Meta · AI Assistant
meta-externalfetcher
Переходит по ссылкам, которые пользователи отправили в чаты WhatsApp/Instagram и Meta AI.
Рекомендация по настройке WAF:
Полная блокировка сломает превью ваших ссылок в WhatsApp. Только rate limit.
Applebot / Applebot-Extended
Apple · AI Search
Applebot
Applebot индексирует сайты для Siri и Spotlight. Applebot-Extended — токен в robots.txt, запрещающий использовать данные для обучения Apple Intelligence.
Рекомендация по настройке WAF:
Applebot оставлять ради трафика Apple. Обучение отключать строкой Applebot-Extended в robots.txt.
🔍 3. Классические поисковые системы и архиваторы (Search Engines) 11
| Краулер (User-Agent) | Категория | Что делает на сайте | Вердикт | Рекомендация по блокировке |
|---|---|---|---|---|
|
Googlebot
Google
Googlebot
|
Search Engine Crawler | Индексирует страницы для классического поиска Google. Основной источник органического трафика. | 🟢 Разрешить | Оставлять обязательно ради поискового трафика (SEO). Проверять rDNS! |
|
YandexBot
Yandex
YandexBot
|
Search Engine Crawler | Главный индексатор Яндекса. Критически важен для получения поискового трафика в рунете. | 🟢 Разрешить | Оставлять обязательно для RU-аудитории. Проверять подлинность IP. |
|
BingBot
Microsoft
bingbot
|
Search Engine Crawler | Индексирует страницы для поисковой системы Bing и партнёров (Yahoo, DuckDuckGo). Индекс Bing используют и многие ИИ-поисковики. | 🟢 Разрешить | Оставлять для сохранения SEO-позиций и видимости в ИИ-поиске. |
|
archive.org_bot
Internet Archive
archive.org_bot
|
Archiver | Сохраняет копии страниц в Wayback Machine. Снимки архива принимаются судами как доказательство того, что информация была опубликована. | 🔴 Блокировать | Блокировать, если управляете юридическими рисками: нет снимка — нечего предъявить. UA-блок останавливает только новые обходы: старые снимки удаляются отдельным запросом в Internet Archive, а ручной Save Page Now ходит другими фетчерами. |
|
Arquivo Web Crawler
Arquivo
arquivo-web-crawler
|
Archiver | Португальский веб-архив, сохраняющий историю сайтов аналогично Wayback Machine. | 🟢 Разрешить | Безобидный архиватор, можно оставить. |
|
Baiduspider
Baidu
Baiduspider
|
Search Engine Crawler | Крупнейший китайский поисковый робот. Часто создает фоновую нагрузку, не принося полезной аудитории. | 🟡 Проверять | Блокировать, если ваш бизнес не рассчитан на аудиторию из Китая. |
|
Terracotta Bot
Ceramic
Terracotta Bot
|
Search Engine Crawler | Поисковый робот для децентрализованных сетей данных (Ceramic Network). | 🟡 Проверять | Редкий бот, блокировать при высокой нагрузке. |
|
AhrefsBot
Ahrefs
AhrefsBot
|
SEO Crawler | Один из самых активных краулеров мира: строит индекс обратных ссылок Ahrefs. Людей не приводит, зато кормит отчёты ваших конкурентов. | 🟡 Проверять | Пользуетесь Ahrefs для своих аудитов — оставляйте. Нет — закрывайте в robots.txt, он его соблюдает. |
|
SemrushBot
Semrush
SemrushBot
|
SEO Crawler | Собирает ссылки, позиции и данные аудита для SEO-платформы Semrush. По активности сравним с AhrefsBot. | 🟡 Проверять | Та же логика: свой инструмент — оставляйте, чужой — блокируйте через robots.txt. |
|
MJ12bot
Majestic
MJ12bot
|
SEO Crawler | Распределённый краулер ссылочного индекса Majestic. Ходит с тысяч IP обычных пользователей, из-за чего выглядит как атака. | 🟡 Проверять | Robots.txt соблюдает, но медленно. Не пользуетесь Majestic — блокируйте по User-Agent, по IP бесполезно. |
|
DotBot
Moz
DotBot
|
SEO Crawler | Краулер ссылочного индекса Moz (Domain Authority). Умеренно активен, robots.txt уважает. | 🟡 Проверять | Не работаете с Moz — закрывайте в robots.txt заодно с остальной SEO-четвёркой. |
Googlebot
Google · Search Engine Crawler
Googlebot
Индексирует страницы для классического поиска Google. Основной источник органического трафика.
Рекомендация по настройке WAF:
Оставлять обязательно ради поискового трафика (SEO). Проверять rDNS!
YandexBot
Yandex · Search Engine Crawler
YandexBot
Главный индексатор Яндекса. Критически важен для получения поискового трафика в рунете.
Рекомендация по настройке WAF:
Оставлять обязательно для RU-аудитории. Проверять подлинность IP.
BingBot
Microsoft · Search Engine Crawler
bingbot
Индексирует страницы для поисковой системы Bing и партнёров (Yahoo, DuckDuckGo). Индекс Bing используют и многие ИИ-поисковики.
Рекомендация по настройке WAF:
Оставлять для сохранения SEO-позиций и видимости в ИИ-поиске.
archive.org_bot
Internet Archive · Archiver
archive.org_bot
Сохраняет копии страниц в Wayback Machine. Снимки архива принимаются судами как доказательство того, что информация была опубликована.
Рекомендация по настройке WAF:
Блокировать, если управляете юридическими рисками: нет снимка — нечего предъявить. UA-блок останавливает только новые обходы: старые снимки удаляются отдельным запросом в Internet Archive, а ручной Save Page Now ходит другими фетчерами.
Arquivo Web Crawler
Arquivo · Archiver
arquivo-web-crawler
Португальский веб-архив, сохраняющий историю сайтов аналогично Wayback Machine.
Рекомендация по настройке WAF:
Безобидный архиватор, можно оставить.
Baiduspider
Baidu · Search Engine Crawler
Baiduspider
Крупнейший китайский поисковый робот. Часто создает фоновую нагрузку, не принося полезной аудитории.
Рекомендация по настройке WAF:
Блокировать, если ваш бизнес не рассчитан на аудиторию из Китая.
Terracotta Bot
Ceramic · Search Engine Crawler
Terracotta Bot
Поисковый робот для децентрализованных сетей данных (Ceramic Network).
Рекомендация по настройке WAF:
Редкий бот, блокировать при высокой нагрузке.
AhrefsBot
Ahrefs · SEO Crawler
AhrefsBot
Один из самых активных краулеров мира: строит индекс обратных ссылок Ahrefs. Людей не приводит, зато кормит отчёты ваших конкурентов.
Рекомендация по настройке WAF:
Пользуетесь Ahrefs для своих аудитов — оставляйте. Нет — закрывайте в robots.txt, он его соблюдает.
SemrushBot
Semrush · SEO Crawler
SemrushBot
Собирает ссылки, позиции и данные аудита для SEO-платформы Semrush. По активности сравним с AhrefsBot.
Рекомендация по настройке WAF:
Та же логика: свой инструмент — оставляйте, чужой — блокируйте через robots.txt.
MJ12bot
Majestic · SEO Crawler
MJ12bot
Распределённый краулер ссылочного индекса Majestic. Ходит с тысяч IP обычных пользователей, из-за чего выглядит как атака.
Рекомендация по настройке WAF:
Robots.txt соблюдает, но медленно. Не пользуетесь Majestic — блокируйте по User-Agent, по IP бесполезно.
DotBot
Moz · SEO Crawler
DotBot
Краулер ссылочного индекса Moz (Domain Authority). Умеренно активен, robots.txt уважает.
Рекомендация по настройке WAF:
Не работаете с Moz — закрывайте в robots.txt заодно с остальной SEO-четвёркой.
🕵️♂️
По вашему запросу ничего не найдено. Проверьте опечатки или сбросьте фильтры.