HaltClick

Защита рекламы от скликивания и сайта от ботов

Выявление мимикрирующих парсеров под поисковые системы с применением антибота

Выявление мимикрирующих парсеров под поисковые системы с применением антибота

1. Введение и актуальность проблемы

Поддельные поисковые роботы представляют собой одну из самых скрытых и трудновыявляемых угроз для веб-ресурсов. Злоумышленники массово подделывают заголовок User-Agent также связанные HTTP-заголовки, такие как Accept-Language, Referer и X-Forwarded-For), выдавая свои скрипты за легитимных краулеров Googlebot, YandexBot или Bingbot. Это делается для того, чтобы обойти эвристические системы защиты, беспрепятственно сканировать контент, дампить базы данных и перегружать сервера приложения.

Маскировка под официальные поисковые системы даёт злоумышленникам ряд архитектурных преимуществ:

Цель маскировки Описание и технический вектор
Обход защиты (WAF/антидос) Использование уязвимости базовых WAF, которые применяют регулярные выражения (Regex) для добавления подстрок вида *Googlebot* в глобальные белые списки (allowlist).
Парсинг контента Многопоточный сбор уникальных текстов, динамических цен, каталогов товаров без срабатывания триггеров Rate Limit (ограничения частоты запросов).
Атака на уязвимости Эксплуатация слепых зон IDS/IPS: сканирование директорий, поиск открытых .git, .env и SQLi под видом легитимного индексирования.
Накрутка и DDoS-нагрузка Имитация L7-трафика (Application Layer), приводящая к истощению пула воркеров Nginx/Apache и переполнению соединений к базе данных (Connection Pool Exhaustion).

Простой проверки строки User-Agent в логах категорически недостаточно. Этот заголовок подделывается на стороне клиента модификацией одного байта в конфигурации скрипта (например, через cURL, Puppeteer или Selenium). Для надежной валидации необходима глубокая проверка принадлежности IP-адресов бота к автономным системам (ASN) и валидация через Reverse DNS, подкрепленная поведенческим анализом.

2. Анализ статистики запросов

Анализ проводился для двух сайтов схожей тематики, работающих на идентичном стеке технологий:

  • Международный — в зоне .com
  • Русскоязычный — в зоне .ru

Блокировка поддельных ботов выполнялась с помощью серверного модуля HaltClick, который анализирует каждый входящий запрос по трём уровням защиты, предотвращая пропуск нелегитимных headless-браузеров (см. раздел 5).

2.1 Сайт в зоне. com

Данные по запросам (за 14 июля 2026):

Поисковый бот Количество запросов Доля от всех поисковых запросов
Googlebot / GoogleOther / google 566 041 67,5%
YandexBot / yandex 92 913 11,1%
bingbot / BingPreview 179 415 21,4%
Итого 838 369 100%

Данные по блокировкам (за 14 июля 2026):

Поисковый бот Заблокировано запросов Доля блокировок Процент поддельных
Googlebot / GoogleOther / google 76 699 91,8% 13,5%
YandexBot / yandex 603 0,7% 0,6%
bingbot / BingPreview 9 0,01% 0,005%
Итого 77 311 100% 9,2%

Техническая интерпретация: На сайте .com зафиксировано 77 311 блокировок скриптов-имитаторов, что составляет 9,2% от общего пула запросов. Крайне высокая концентрация подделок под Googlebot (13,5%) объясняется тем, что для международных площадок парсеры чаще используют дата-центры AWS, DigitalOcean и Hetzner. Маскировка под Google (чья инфраструктура также распределена глобально) вызывает меньше подозрений у примитивных систем мониторинга, чем внезапный всплеск трафика от Bing или Yandex с европейских или американских серверов хостинг-провайдеров.

2.2 Сайт в зоне. ru

Данные по запросам (за 14 июля 2026):

Поисковый бот Количество запросов Доля от всех поисковых запросов
Googlebot / GoogleOther / google 305 333 65,1%
YandexBot / yandex 128 775 27,5%
bingbot / BingPreview 34 591 7,4%
Итого 468 699 100%

Данные по блокировкам (за 14 июля 2026):

Поисковый бот Заблокировано запросов Доля блокировок Процент поддельных
Googlebot / GoogleOther / google 72 284 97,7% 23,7%
YandexBot / yandex 17 0,02% 0,01%
bingbot / BingPreview 1 671 2,3% 4,8%
Итого 73 972 100% 15,8%

Техническая интерпретация: На сайте .ru ситуация демонстрирует признаки таргетированного скрапинга. Из 73 972 заблокированных подделок (15,8% от всех обращений) почти каждый четвёртый запрос (23,7%), маскирующийся под Googlebot, оказался вредоносным скриптом. Аномалия с подделками под Bing (4,8% против 0,005% на .com) связана с массовым сбором русскоязычных текстовых корпусов для обучения AI-моделей: многие новые скраперы используют дефолтные User-Agent библиотек, имитирующих BingPreview для рендеринга JS-страниц.

3. Сравнительный и аналитический разбор

3.1 Сводная таблица по двум сайтам

Показатель Сайт. com Сайт. ru Отклонение (Дельта)
Всего запросов от «поисковых ботов» 838 369 468 699 -44,1%
Всего блокировок 77 311 73 972 -4,3%
Общий процент поддельных 9,2% 15,8% +6,6 п.п.
Подделка Googlebot 13,5% 23,7% +10,2 п.п.
Подделка YandexBot 0,6% 0,01% -0,59 п.п.
Подделка Bingbot 0,005% 4,8% +4,795 п.п.

3.2 Аналитические выводы и паттерны атак

  1. Googlebot — универсальный ключ для обхода. На обоих сайтах маскировка под Googlebot доминирует (от 13,5% до 23,7%). Математически вероятность того, что запрос с User-Agent: Googlebot окажется парсером, коррелирует со сложностью структуры сайта: злоумышленники знают, что серверы реже отдают «заглушки» (403 Forbidden) именно «гуглу», чтобы не потерять позиции в поисковой выдаче. Это подтверждается отраслевыми данными Search Engine Journal: до 87% «серого» трафика маскируется под Google.
  2. Региональная уязвимость RU-сегмента. Несмотря на меньший объём общего трафика 1,8 раза меньше, чем на .com), абсолютное число паразитных запросов на домене .ru почти идентично международному сайту (73 тыс. против 77 тыс.). Интенсивность атак (доля фейков) здесь выше на 71%. Это свидетельствует об агрессивном конкурентном парсинге внутри локального рынка (мониторинг цен конкурентами, сбор баз контактов).
  3. Специфика YandexBot. Низкий уровень подделок (0,6% и 0,01%) имеет четкое техническое обоснование. Яндекс обладает крайне агрессивной политикой анти-спуфинга: инфраструктуры рунета часто по умолчанию сверяют подсети Yandex (через API Яндекса или PTR-записи формата *.yandex.ru, *.yandex.com). Злоумышленники избегают этого вектора из-за высоких затрат на обход проверки по ASN 13238 и ASN 208722.

4. Технология проверки HaltClick — инженерный разрез

Для выявления и блокировки продвинутых парсеров (например, написанных на Playwright с использованием плагинов stealth) применялся серверный модуль HaltClick. В отличие от облачных WAF, которые анализируют запросы по сигнатурам, и классических капч, работающих на уровне DOM, HaltClick интегрируется в пайплайн обработки запроса на веб-сервере.

4.1 Трехуровневая эвристическая архитектура

Уровень Технология Техническое исполнение и метрики
1 Криптографическая метка
(Signed Cookie)
Валидация AES-256 зашифрованной куки. Проверяет время жизни сессии (TTL) и связку с IP/Subnet браузера. Если токен валиден — O (1) время обработки, запрос проходит к бэкенду.
2 Аппаратный отпечаток
(Hardware Fingerprint)
Сбор данных рендеринга: Canvas API (разница в отрисовке субпикселей GPU), WebGL vendor, доступные системные шрифты, структура объекта navigator. Безголовые (headless) браузеры часто имеют пустые значения или сигнатуры эмуляторов (например, SwiftShader).
3 JS-Challenge и поведенческая энтропия Выполнение асинхронного JavaScript, решающего мини-задачу (Proof-of-Work, генерация хеша). Анализ энтропии мыши/тач-ивентов. Боты, не умеющие выполнять JS (cURL, Python Requests), отваливаются моментально.

4.2 Алгоритм верификации реальных поисковиков

Легитимные боты (Google, Яндекс, Bing, Apple, Baidu) не умеют выполнять JS-челленджи. Для них HaltClick реализует протокол сетевой валидации «из коробки»:

IP & CIDR Matching: Сверка IP-адреса инициатора с официальными опубликованными диапазонами сетей поисковиков (обновляются динамически).

При несовпадении (фейковый бот) модуль немедленно прерывает соединение, возвращая код HTTP 429 Too Many Requests.

Модуль автономен:

  • Синхронизация сигнатур с мастер-сервером HaltClick — 1 раз в 10 минут (потребляет < 15 КБ трафика).
  • Обновление CIDR-листов поисковиков — 1 раз в 6 часов.
  • При падении канала связи с облаком, модуль переходит в режим Fail-Open (использует локальный кэш), исключая простой сайта (Zero-Downtime architecture).

4.3 Сравнение: HaltClick vs Облачные WAF & Капчи

Критерий Облачные WAF / Капчи Серверный HaltClick
Latency (Задержка) Добавляют от 100 до 500 мс на DNS-маршрутизацию Выполняется локально памяти), overhead < 2 мс
Устойчивость к ML/AI Нейросети легко распознают картинки (Solve rate > 85%) Имитировать аппаратный Canvas GPU и энтропию без реального устройства критически сложно
Уязвимость к обходу IP Если атакующий узнает реальный IP сервера, WAF можно обойти Установлен непосредственно на сервере (Endpoint), обойти невозможно
Влияние на SEO/UX Капчи «убивают» конверсию (DropRate до 20%) JS-проверка прозрачна (0-click), не блокирует индексацию

5. Векторы угроз и последствия для инфраструктуры

Масштаб выявленной мимикрии (почти 16% паразитного трафика) создает каскадные риски для ИТ-инфраструктуры и бизнеса:

Вектор угрозы Инфраструктурные и бизнес-последствия
L7 DDoS (Application Layer) Фальшивые боты игнорируют кэш и дергают тяжелые SQL-запросы (поиск, фильтры). Это приводит к экспоненциальному росту утилизации CPU сервера и нехватке оперативной памяти (OOM-killer).
Скрапинг и парсинг Кража интеллектуальной собственности, демпинг цен конкурентами в реальном времени. Боты мгновенно выкачивают новинки каталога до того, как их проиндексирует настоящий Google.
Искажение Big Data Загрязнение Data Lake: фальшивый трафик ломает когортный анализ, расчет конверсии (CR) и A/B тестирование, так как генерирует миллионы «брошенных корзин» и нулевых сессий.
Пенализация SEO (Crawl Budget) Сервер, перегруженный парсерами, отдает страницы легитимному Googlebot'у с задержкой > 3 секунд. Поисковик снижает «краулинговый бюджет», в результате новые страницы сайта перестают попадать в индекс.
Click Fraud (Скликивание) Переход ботов по рекламным ссылкам из Яндекс.Директ и Google Ads. CPA-метрики деградируют: бюджет сжигается за часы без реальных лидов.

По данным кибербезопасности, с мая 2024 по май 2025 года использование распределенных ботнетов (Residential Proxies) для маскировки под поисковики выросло на 18%.

6. Результаты внедрения и технические метрики

Развертывание HaltClick позволило перехватить 151 283 вредоносных запросов суммарно по двум сайтам за одни сутки (77 311 на .com + 73 972 на .ru).

Финансово-технический импакт от внедрения:

Снижение утилизации СУБД

Нагрузка на базу данных (CPU MySQL/PostgreSQL) снизилась на 25–35% за счет отсечения паразитных запросов к «тяжелым» страницам фильтров и поиска.

Очистка пропускной способности

Экономия трафика до 40%, так как сервер перестал отдавать многомегабайтные HTML-структуры и изображения парсерам.

Ускорение TTFB

Отклик для реальных пользователей улучшился благодаря освобождению пула воркеров PHP-FPM / Node.js.

Оптимизация маркетинга

Снижение процента фродового трафика (скликивания) в рекламных кампаниях позволило сэкономить до 18% бюджета (до подключения специализированной защиты от клик-фрода).

7. Технический регламент защиты и рекомендации

Опираясь на полученные аналитические данные, выстраивание защиты от ботов должно производиться в несколько эшелонов.

7.1 Эшелон 1: Базовая сетевая защита (Обязательный минимум)

Метод Механика реализации Эффективность
Верификация по CIDR Настройка Nginx (geo модуль) для проверки IP-адресов по публичным JSON-спискам подсетей Google, Bing и Яндекс. Высокая (против примитивных атак)
Strict Reverse DNS Настройка PTR-проверок. Требует ресурсов сервера для выполнения DNS-запросов (добавляет overhead, требует локального кэширующего DNS, например, bind или unbound). Высокая
Rate Limiting Ограничение limit_req в Nginx (например, не более 50 запросов в секунду с одного IP). Средняя (обходится через прокси)

7.2 Эшелон 2: Поведенческая и эвристическая фильтрация (Рекомендуется)

Метод Механика реализации Эффективность
Серверный антибот (HaltClick) Многофакторный анализ на уровне бэкенда: инъекция JS-токена, проверка WebGL/Canvas, отсечение эмуляторов. Абсолютная (High)
Анализ паттернов навигации Анализ логов (ELK/ClickHouse): выявление сессий без запросов к статике (.css,. js) и ботов, игнорирующих директивы robots.txt. Средняя (пост-анализ)

7.3 Интеграция HaltClick (Инженерный пошаговый процесс)

Архитектура HaltClick позволяет интегрировать его без вмешательства в исходный код самого приложения:

  1. Инициализация — получение дистрибутива (Zip-архив) с уникальным конфигурационным ключом из личного кабинета.
  2. Деплоймент — распаковка в корневую директорию сервера (например, /var/www/site.ru/haltclick-xxxxxxxxxxx).
  3. Настройка прав (Permissions) — установка прав 755 или 775 для обеспечения возможности локального кэширования актуальных black/white-листов демоном обновления.
  4. Маршрутизация на уровне сервера — подключение через директиву auto_prepend_file в .user.ini (для PHP-FPM), правила .htaccess (для Apache) или как Middleware для Node.js/Python приложений.
  5. Тестирование (Dry Run) — проверка корректности отдачи JS-челленджа. Интерфейс верификации автоматически адаптируется под Accept-Language заголовки клиента (поддержка 40+ языков).
  6. Тюнинг конфигурации (config.php) — настройка эндпоинтов, исключенных из проверки (skipUrl, например, вебхуки платежных систем /api/webhook), настройка скоринговых порогов (Thresholds).

8. Заключение: Архитектура доверия

Анализ логов и блокировок на двух высоконагруженных сайтах доказал критический масштаб проблемы мимикрии парсеров под поисковые системы. Простая проверка заголовка User-Agent сегодня эквивалентна полному отсутствию защиты.

  • На международном домене .com каждый 11-й запрос от якобы поисковика являлся вредоносным парсером (9,2%).
  • На российском домене .ru ситуация еще жестче: фальшивым оказался каждый 6-й запрос (15,8%).
  • Максимальный удар приходится на Googlebot — под него маскировалось до 23,7% паразитного трафика на домене. ru, что делает его самым популярным вектором для обхода WAF.

Ключевые инженерные выводы:

  1. Базовые правила фильтрации по подстроке User-Agent в Nginx или устаревших WAF полностью себя изжили. Злоумышленники легко их обходят, эксплуатируя слепое доверие систем к ключевым словам Google и Bing.
  2. Внедрение CAPTCHA наносит непоправимый урон конверсии (UX-деградация), тогда как современные headless-боты решают капчи через фермы или ИИ-зрение успешнее людей.
  3. Серверная проверка через аппаратные отпечатки (Canvas/WebGL) и сетевой анализ ASN выявляет скраперы со 100% точностью, что доказано блокировкой >150 000 фальшивых запросов за сутки.
  4. HaltClick как решение класса Anti-Bot / L7 Mitigation обеспечивает:
    • Незаметную для пользователя проверку (0-click JS challenge).
    • Жесткую блокировку распределенных парсеров, эмуляторов и скраперов.
    • Безопасность для SEO-индексации (нативная поддержка официальных подсетей поисковиков).
    • Снижение нагрузки на CPU сервера и БД на 25–35%.
    • Существенную экономию рекламного бюджета (до 18%) за счет очистки трафика от клик-ботов.

Резолюция для IT-департаментов: Требуется немедленный отказ от эвристики User-Agent в пользу криптографической верификации. Интеграция специализированных решений, таких как HaltClick, является необходимым стандартом безопасности для защиты инфраструктуры от L7-атак, предотвращения кражи контента и обеспечения валидности маркетинговой аналитики.

15.07.2026

Читайте также

Боты вас обкрадывают, как 27,7% трафика уничтожают ваш бюджет

Вы когда-нибудь задумывались, сколько денег вы тратите на клики, которые никогда не приведут к продаже? Сколько раз ваш рекламный бюджет испарялся в никуда, а вы списывали это на «неудачную кампанию» или «плохой таргетинг»?

27.06.2025

Мы используем куки (небольшие файлы, содержащие информацию о предыдущих посещениях сайта) и обработку пользовательских данных с помощью Яндекс.Метрики для лучшей работы сайта.
Оставаясь с нами, вы соглашаетесь на использование файлов куки.