Веб-боты Meta за один квартал этого года отправили девять миллиардов запросов, и исходящий трафик почти никогда не возвращался на сайты, которые краулеры парсили. Cloudflare теперь по умолчанию блокирует боты обучения и агентов на любой странице, на которой размещены объявления. Линия между «поиском» и «корпусом для обучения» сместилась, и если вы управляете сайтом, вы, вероятно, хотите быть на «блокирующей» стороне этой линии.
Лучшие инструменты для блокировки веб-скреперов AI на рабочем столе в 2026 году делятся на три категории: услуги на границе сети, которые блокируют на сетевом краю перед тем, как запросы достигнут вашего origin, самостоятельно размещаемые файрволы Proof-of-Work, которые работают параллельно с вашим приложением, и правила на стороне origin, которые фильтруют запросы после их поступления. Мы выбрали семь инструментов, которые работают вместе, от простого переключателя Cloudflare до Anubis (уже развернутого исходным кодом Linux kernel, Codeberg и FFmpeg).
На что обратить внимание при выборе инструмента для блокировки AI скреперов
- Комбинированное обнаружение User-Agent и поведения. Любой инструмент, который только проверяет строку User-Agent, это просто снижение скорости, а не стена.
- Способность различать боты обучения от поисковых краулеров. Вы хотите блокировать GPTBot, но пропускать Googlebot.
- Низкий уровень ложных срабатываний на реальных людях. Сложности Proof-of-Work должны корректно работать на старых телефонах и скринридерах.
- Видимость. Панель управления, которая показывает, какие боты посещали вас на прошлой неделе, стоит больше, чем черный ящик с фразой «мы что-то заблокировали».
- Стоимость, которая соответствует вашему трафику. Личному блогу не нужен пятизначный контракт WAF.
Быстрое сравнение
| Инструмент | Лучше всего для | Бесплатный план | Платный | Развертывание |
|---|---|---|---|---|
| Cloudflare AI Crawl Control | Любой сайт за Cloudflare | Включен на всех уровнях | Входит в Cloudflare Pro/Biz | Одноклик включения |
| Dark Visitors (Known Agents) | Видимость того, какие AI боты посещают вас | Бесплатный уровень | Тарифы для команд с небольшой месячной платой | robots.txt + трекер агентов |
| Anubis | Самостоятельно размещаемая стена Proof-of-Work | Открытый исходный код, бесплатно | Только бесплатно | Обратный прокси (Go бинарник) |
| Nepenthes | Активный расход времени скреперов | Открытый исходный код, бесплатно | Только бесплатно | Контейнер тарпита |
| Fail2Ban | Блокировка по логам на стороне origin | Открытый исходный код, бесплатно | Только бесплатно | Демон сервера |
| ModSecurity + OWASP CRS | Основанный на правилах WAF на origin | Открытый исходный код, бесплатно | Бесплатно с коммерческими наборами правил | Модуль nginx/Apache |
| DataDome | Управление ботами уровня Enterprise | Только пробный период | Контракты Enterprise | Edge / API интеграция |
Инструменты
1. Cloudflare AI Crawl Control — лучший одноклик блокиратор для любого сайта
Cloudflare AI Crawl Control это самый быстрый способ остановить боты обучения AI. Любой клиент на любом уровне (включая бесплатный) может перейти в Security → Bots в панель управления и включить переключатель «AI Crawls and Scrapers». Он использует базу данных отпечатков ботов Cloudflare плюс поведенческие сигналы для идентификации GPTBot, ClaudeBot, Applebot Extended, PerplexityBot и сотен других. Начиная с 15 сентября 2026 года, новые домены по умолчанию блокируют боты обучения и агентов на страницах, которые отображают объявления.
Поскольку это работает на сетевом краю, заблокированные запросы никогда не касаются вашего origin. Это экономит пропускную способность и CPU origin, и это не имеет значения, какая технология используется на вашем сайте. Вы также можете разрешить определенные боты (Googlebot остается зеленым по умолчанию), взимать плату за доступ через программу оплаты за краулинг Cloudflare или написать пользовательские правила для более точного управления.
Где это отстает: Полезно только если ваш сайт находится за Cloudflare. Классификатор Cloudflare иногда неправильно обозначает законные исследовательские или архивные краулеры, поэтому проверьте аналитику перед тем, как оставлять его в автоматическом режиме для чего-то важного.
Цены:
- Бесплатно: Полный переключатель, списки разрешений/блокировок, аналитика
- Платный: Входит в Cloudflare Pro, Business и Enterprise
Платформы: Любой сайт, расположенный перед Cloudflare (Windows, macOS, Linux origins все работают)
Вывод: Если вы на Cloudflare, включите это перед тем как читать остальной список.
2. Dark Visitors (Known Agents) — лучший способ узнать, какие боты вас действительно посещают
Dark Visitors (переименован в Known Agents в 2026) это слой видимости, который отсутствует на большинстве сайтов. Он ведет тщательно отобранную базу данных AI агентов (боты обучения, RAG скреперы, агенты просмотра, LLM помощники) и предоставляет вам как динамически обновляемый файл robots.txt, так и панель аналитики, которая показывает, какие из них действительно приходят. Добавьте фрагмент и получите реальные числа по GPTBot, ClaudeBot, PerplexityBot и десяткам более новых агентов, о которых вы вероятно не слышали.
Бесплатный уровень охватывает основное: список агентов, файл robots.txt, отслеживание базовых посещений. Платные уровни разблокируют полную аналитику, несколько сайтов и доступ к API. Это хорошо сочетается с Cloudflare: Cloudflare говорит вам, что было заблокировано на краю, Known Agents говорит вам, что пыталось (и для всего, что Cloudflare еще не распознает) что все еще прошло.
Где это отстает: robots.txt это запрос, а не правило. Хорошо себя ведущие краулеры его уважают; плохие актеры игнорируют его. Этот инструмент говорит вам правду о том, кто игнорирует правила, но он не может заставить соответствие самостоятельно.
Цены:
- Бесплатно: Файл robots.txt, базовый трекер, один сайт
- Платный: Тарифы для команд с небольшой месячной платой за несколько сайтов, полную аналитику, API
Платформы: Любой сайт (основано на фрагменте)
Вывод: Установите это даже если у вас уже есть Cloudflare, потому что это показывает вам, какие боты становятся растущей проблемой.
3. Anubis — лучшая стена от AI скреперов с самостоятельным размещением
Anubis это самостоятельно размещаемый Web AI Firewall, написанный на Go компанией TecharoHQ. Он работает как обратный прокси перед вашим приложением и выполняет сложность JavaScript Proof-of-Work перед обслуживанием запроса. Реальные браузеры решают сложность невидимо за долю секунды; наивные скреперы зависают, потому что они не запускают JS или не хотят сжигать циклы CPU в своем масштабе.
История принятия говорит сама за себя: Codeberg, FFmpeg, исходный код Linux kernel и большинство non-Cloudflare проектов FOSS это запускают. Конфигурация это один YAML файл; вы указываете Anubis на ваш upstream, устанавливаете сложность сложности на маршрут и добавляете списки разрешений для хороших ботов (Googlebot, IA_Archiver, и т.д.).
Где это отстает: JS-выполняющие скреперы (headless Chromium, Playwright) могут также решить PoW; они просто платят небольшую стоимость CPU. Anubis это сильное сдерживающее средство, а не непроницаемая стена. Это также добавляет небольшую задержку хопа для каждого запроса.
Цены:
- Бесплатно: Полностью открытый исходный код (MIT)
- Платный: Нет; коммерческая поддержка доступна отдельно
Платформы: Linux (Docker, systemd), Windows, macOS (через Go бинарник)
Вывод: Правильный выбор когда вы управляете своей собственной инфраструктурой и не хотите маршрутировать через Cloudflare.
4. Nepenthes — лучший способ потратить время скреперов впустую
Nepenthes принимает противоположный подход: вместо блокировки скреперов, он втягивает их в бесконечный лабиринт процедурно генерируемых, правдоподобных страниц, которые никогда не заканчиваются. Результат это тарпит, который стоит скреперу CPU и пропускной способности, в то время как не возвращает никаких полезных данных обучения. Сделано специально как ответ на AI краулеры, которые игнорируют robots.txt, это подхватили администраторы, которые хотят активно повысить стоимость скрепинга, а не пассивно его отклонять.
Разверните его как Docker контейнер на поддомене или пути, добавьте директиву robots.txt, указывающую плохих ботов на него, и смотрите как краулер тратит его ресурсы впустую. Это также отравляет данные обучения немного: любой скрепер, который потребляет вывод Nepenthes, приносит шумный правдоподобный, но поддельный текст обратно в то, что его питает.
Где это отстает: Этически сомнительно для некоторых операторов; вы намеренно обслуживаете вводящие в заблуждение данные. Это влияет только на ботов, которые не уважают robots.txt в первую очередь, что это точка, но также стоит подумать.
Цены:
- Бесплатно: Открытый исходный код
- Платный: Нет
Платформы: Linux (Docker) в основном; macOS и Windows через Docker
Вывод: Добавьте это после того, как вы уже имеете блокировку и хотите сделать скрепинг активно дорогостоящим.
5. Fail2Ban — лучший инструмент блокировки по логам на стороне origin
Fail2Ban это классический инструмент для чтения логов сервера, выявления шаблонов и отправки блокировок на уровне IP в файрвол. Каждый администратор Linux это знает. Для AI скрепинга в частности, фильтр Fail2Ban может наблюдать логи nginx или Apache для User-Agent regex (GPTBot, ClaudeBot, Bytespider, и т.д.), или для поведенческих подписей (всплески запросов в секунду от одного IP), и поместить нарушителя в iptables.
Поскольку блокировка происходит в файрволе ядра, origin не тратит циклы на обслуживание скрепера вообще. Объедините это с настройкой Cloudflare на краю и Anubis посередине, и у вас есть оборона в глубину.
Где это отстает: Блокировки на основе IP хрупки против вращения жилых прокси, которые используют серьезные скреперы. И фильтры должны быть написаны и настроены; это не одноклик установка.
Цены:
- Бесплатно: Открытый исходный код, в каждом основном дистрибутиве Linux
- Платный: Нет
Платформы: Linux (родной); поддержка Windows и macOS ограничена
Вывод: Правильный выбор для системных администраторов, которые уже пишут фильтры регулярных выражений и хотят блокировку на уровне пакетов.
6. ModSecurity + OWASP CRS — лучший WAF на основе правил на origin
ModSecurity с OWASP Core Rule Set это WAF с открытым исходным кодом, которое администраторы nginx и Apache развертывают на origin, когда они не могут или не хотят использовать сервис на краю. CRS поставляется с правилами для типичных атак (SQLi, XSS, RCE), и поддерживаемые сообществом наборы правил для AI ботов добавляют фильтры User-Agent, поведенческие пороги и известные плохие IP каналы специально для AI скреперов.
Поскольку это основано на правилах, вы сохраняете полный контроль. Вы можете добавить в белый список внутренний инструмент аналитики, блокировать определенный user-agent глобально, или написать правила для каждого пути. Это также хорошо работает с Fail2Ban: ModSecurity отмечает запрос как аномальный, Fail2Ban читает отметку и блокирует источник.
Где это отстает: Правила требуют обслуживания. Ложные срабатывания происходят на пользовательских приложениях. И это встроенный модуль для nginx или Apache, поэтому контейнеризованные развертывания нуждаются в Docker образах с ним запеченным.
Цены:
- Бесплатно: Открытый исходный код
- Платный: Коммерческие наборы правил и поддержка доступны от третьих сторон
Платформы: Linux (nginx/Apache встроенный), Windows (через IIS с ограничениями)
Вывод: По умолчанию WAF на origin когда вы не за Cloudflare и хотите полную прозрачность.
7. DataDome — лучшее управление ботами уровня Enterprise
DataDome это место, где вы приземляетесь, когда личный блог масштабируется в реальный бизнес. Примерно 1,200 компаний по всей Америке и Европе запускают его WAF, и он работает более 85,000 специфичных для клиента моделей машинного обучения, что означает, что каждый защищенный сайт становится своей собственной задачей обнаружения для скрепера. Это интегрируется на краю (через CDN или DNS), и его обнаружение выходит за пределы ботов обучения AI к подбору учетных данных, мошенничеству с объявлениями и фермам скрепинга-как-услуги.
Панель управления самая сильная в этой категории, дающая вам классификацию для каждого запроса, географический взлом и оценки влияния на доход. Время отклика на обнаружение измеряется в миллисекундах. Поддержка уровня Enterprise включена.
Где это отстает: Цена не для людей; вы запрашиваете расценки. Установка требует кооперации с вашим DNS, CDN и origin, поэтому это проект, а не переключатель.
Цены:
- Бесплатно: 30-дневный пробный период
- Платный: Контракты Enterprise, пользовательские расценки
Платформы: Любой origin (Windows, macOS, Linux); развернуто на краю
Вывод: Правильный выбор когда стоимость очищенного контента или мошенничества больше, чем годовой счет управления ботами.
Как выбрать правильный инструмент
- Если вы хотите самый простой вариант и вы уже на Cloudflare: включите AI Crawl Control. Готово за 15 секунд.
- Если вы хотите увидеть правду о том, кто вас парсит: установите Dark Visitors (Known Agents) вместе со всем остальным. Видимость сначала, блокировка второй.
- Если вы самостоятельно размещаете и не хотите быть за CDN: запустите Anubis как ваш обратный прокси. Добавьте Nepenthes для отравления тех, которые проходят дальше.
- Если вы администратор Linux, который уже живет в логах nginx: подключите Fail2Ban и ModSecurity + OWASP CRS. Бесплатно, прозрачно, под вашим контролем.
- Если вы бизнес с реальным доходом в игре: получите контракт DataDome. Cloudflare охватывает массовый рынок; DataDome охватывает граничные случаи.
- Реалистичный стек для небольшого-среднего сайта в 2026: Cloudflare AI Crawl Control на краю, Dark Visitors для видимости, Anubis для всего, что Cloudflare не ловит. Эта комбинация работает за $0 в большинстве месяцев.
FAQ
Какой лучший бесплатный блокиратор AI скреперов?
Cloudflare AI Crawl Control если ваш сайт за Cloudflare (бесплатный уровень включает это). Если вы самостоятельно размещаете, Anubis это самый сильный бесплатный вариант с открытым исходным кодом. Оба решают одну проблему с разных сторон стека.
Могут ли AI боты обойти Cloudflare?
Да, некоторые могут. Классификатор Cloudflare очень хорош в блокировке на основе подписей, но изощренные скреперы используют вращение жилых прокси и headless браузеры чтобы выглядеть человеческими. Вот почему многоуровневая защита (край + origin + видимость) работает лучше чем любой отдельный инструмент.
Нужна ли мне блокировка AI ботов на личном блоге?
Это ваш выбор. Если вы хотите, чтобы ваш контент использовался для обучения коммерческих LLM, не делайте ничего. Если бы вы предпочли, чтобы этого не было, включите переключатель Cloudflare или добавьте Anubis. Самый распространенный компромисс это robots.txt Known Agents плюс блокировка Cloudflare для крупнейших краулеров обучения.
Будет ли блокировка AI ботов вредить моему рейтингу поиска?
Нет, если вы правильно настроите блокиратор. Все инструменты в этом списке могут разрешить Googlebot, Bingbot и других традиционных поисковых краулеров при блокировке ботов только для обучения, таких как GPTBot, ClaudeBot и PerplexityBot. Проверьте список разрешений перед развертыванием.
В чем разница между Anubis и Cloudflare?
Cloudflare блокирует на сетевом краю перед тем, как запросы достигнут вашего сервера. Anubis работает на вашем сервере как обратный прокси и выполняет сложность Proof-of-Work. Cloudflare проще и охватывает больше; Anubis это самостоятельное размещение, прозрачное и не требует третьих сторон.