Защита данных
Парсинг сайта: почему IP-блокировка не работает и 4 метода обхода
IP-блокировка - популярный, но бесполезный ответ на парсинг сайта. Объясняю, как работают современные парсеры, почему они не зависят от одного IP и что делать вместо этого.

Руководители, которые узнают про парсинг своего сайта, обычно делают одно и то же: идут к IT-специалисту и просят настроить блокировки подозрительных IP-адресов. Логика понятна - если знаешь, откуда приходят чужие скрипты, закрой им дверь. Именно так защищались 10-15 лет назад, и это работало.
Сегодня не работает. Не потому что идея плохая - а потому что инструмент изменился с той стороны.
Ниже разберу, как устроены современные системы парсинга и почему IP-блокировка стала примерно такой же эффективной защитой, как замок на калитке при открытом заборе.
Если хотите разобраться в теме защиты от парсинга подробнее - начните с материала «Как закрыть сайт от парсеров конкурентов»: там про периметр целиком, не только про один инструмент.
Как IP-блокировка попала в арсенал защиты
Любой сайт видит IP-адрес каждого входящего запроса. Когда с одного IP приходит 500 запросов за минуту, это явно не человек - это скрипт. Разумная реакция: заблокировать этот адрес. Так и появились чёрные списки IP, правила в файрволах и сервисы репутации адресов.
Когда парсеры были примитивными, это работало. Парсер запускался с одного сервера, имел один IP, и блокировка его останавливала. Стоимость запуска нового сервера была заметной, каждый IP стоил денег - парсинг был дорогим, и IP-блокировка поднимала его цену.
Потом рынок облачных услуг резко подешевел. Виртуальная машина с новым IP стала стоить центы в час. Прокси-сети выросли до миллионов адресов. Написать скрипт, который использует 10 000 разных IP и ротирует их случайным образом, стало задачей выходного дня.
Сегодня IP-блокировка останавливает парсеры примерно в двух случаях: когда парсер написан очень плохо, или когда хозяин парсера вообще не задумывался об обходе защиты. Целенаправленный сбор данных она не останавливает - только немного осложняет.
Ротация IP: почему парсер не приходит с одного адреса дважды
Самый распространённый метод обхода IP-блокировки - ротирующий прокси-пул. Выглядит это так: у системы сбора данных есть доступ к сотням или тысячам IP-адресов (арендованных у прокси-провайдеров). Каждый запрос к вашему сайту идёт через другой адрес из этого пула.
С точки зрения вашего сервера ситуация выглядит так: пришёл запрос с адреса 185.x.x.x, потом запрос с 93.x.x.x, потом с 46.x.x.x. Каждый из них сделал один запрос - поведение вполне человеческое. Никакой аномалии нет, порогов не превышено, чёрный список пуст.
Если вы блокируете IP вручную после ручного анализа - конкретно тот адрес, который вы добавили в блок-лист, больше не придёт. Придут следующие 9 999 из пула.
Даже автоматические системы обнаружения ботов, основанные на частоте запросов с одного IP, работают здесь плохо. Правило «заблокировать, если больше 100 запросов в час с одного адреса» не срабатывает, когда каждый адрес делает 1-2 запроса.
Крупные прокси-провайдеры открыто продают доступ к пулам от нескольких десятков тысяч до миллиона адресов - это публичные коммерческие сервисы.
Жилые и мобильные прокси: парсер, который выглядит как ваш клиент
Обычный прокси-пул - это адреса дата-центров. Их можно идентифицировать: IP из диапазона Amazon Web Services или Hetzner имеет характерную AS (автономную систему). Умная защита умеет их отличать.
Следующий уровень - жилые прокси (residential proxies). Это настоящие IP-адреса обычных пользователей - домашних интернет-абонентов, которые установили определённые расширения для браузера или приложения и тем самым (часто не осознавая) отдали часть своего трафика в аренду. Такой IP принадлежит реальному человеку в Москве или Краснодаре. Никакой AS дата-центра, никакого диапазона хостинга.
Ещё один вариант - мобильные прокси: IP мобильных операторов. Одну точку выхода в интернет через оператора нередко разделяют десятки абонентов (это нормальная особенность мобильного NAT). Заблокировать такой адрес - значит заблокировать всех реальных пользователей, которые заходят с этой вышки.
Практический результат: системы, которые умеют работать с жилыми или мобильными прокси, снимают данные адресами, неотличимыми от реальных посетителей. Ни частотный анализ, ни репутационные базы IP здесь не помогут.
Именно поэтому защита на уровне трафика - IP-блокировки и частотные ограничения - постепенно перестаёт быть главной линией обороны. Подробнее про ограничения стандартных методов защиты - в статье «Защита от парсинга vs обычная веб-безопасность».
Headless-браузер: парсер, который проходит проверки на человека
Когда простых HTTP-запросов с ротацией IP недостаточно, подключаются headless-браузеры. Это полноценные браузерные движки (Chromium, Firefox), запущенные на сервере без графического интерфейса. Такие инструменты - Playwright, Puppeteer, Selenium - изначально разрабатывались для тестирования сайтов, но их давно освоили и для парсинга.
Что это даёт:
- 1Выполнение JavaScript. Сайты, которые рендерятся на стороне клиента (React, Vue, Angular), для обычного HTTP-запроса выдают пустой HTML. Headless-браузер дожидается полного рендеринга страницы и читает итоговый контент.
- 1Прохождение простых CAPTCHA. Часть CAPTCHA основана на поведенческих паттернах: как движется курсор, как долго пользователь смотрит на страницу, как быстро нажимает. Headless-браузеры умеют имитировать эти паттерны.
- 1Сохранение cookies и сессий. Браузер ведёт себя как долгосрочный пользователь - накапливает историю, cookie, fingerprint. Это сложнее заблокировать, чем разовый IP.
- 1Обход проверок User-Agent и заголовков. Обычный HTTP-скрипт легко опознать по нестандартным заголовкам. Headless-браузер отправляет точно такие же заголовки, как настоящий Chrome.
Есть и сервисы, которые решают задачи, с которыми headless-браузеры не справляются самостоятельно: фермы для обхода CAPTCHA, где задачи решают живые люди. Это платная услуга, но при промышленном масштабе сбора данных она окупается.
Облачные фермы и распределённые системы: тысячи машин, каждая с разным IP
Для понимания масштаба: арендовать 100 виртуальных машин в облаке на час - это несколько сотен рублей. У каждой своя история запросов, свой IP из диапазона хостинга (или жилой прокси), своё случайное время между запросами.
Распределённые системы сбора данных выглядят с точки зрения вашего сервера вот как: каждый уникальный адрес заходит 1-2 раза в день, интервалы между запросами - от 5 до 60 минут, география - разные страны и провайдеры. Это невозможно отличить от органического трафика по IP-паттернам.
Такие системы часто соблюдают правила robots.txt - потому что нарушение robots.txt само по себе сигнал для детекторов, а не из уважения к вашему сайту. Ведут себя образцово-показательно.
Важный момент: для этого не нужны ресурсы крупной компании. Готовые фреймворки для распределённого парсинга доступны бесплатно, облачная инфраструктура - копеечная. Человек с базовыми знаниями программирования настраивает такую систему за день.
Что конкурент успевает снять до первой блокировки
Это принципиальный момент, который часто упускают. IP-блокировка - это реактивная защита: сначала запрос пришёл и данные забраны, потом вы это заметили и добавили IP в блок-лист. Блокировка работает только от следующего раза - но с ротацией адресов следующего раза с того же IP не будет.
Что конкретно оказывается в базе данных конкурента после парсинга:
- Страницы с контактами сотрудников - телефоны менеджеров, email, должности.
- Формы захвата лидов - их структура, поля, валидация. Помогает автоматически подставлять данные в формы.
- Страницы с ценами и условиями - вся публичная коммерческая информация.
- Структура каталога и ссылки - карта сайта для систематического обхода.
Отдельная история с формами. Защита форм от автоматической отправки - отдельная задача, о которой многие не задумываются. Если форма слабо защищена, парсер не просто читает её структуру - он может автоматически в неё записывать. Подробнее об этом - в материале «Как автоматические системы проверяют ваши формы без вашего ведома».
Про телефоны отдельно: номера сотрудников, опубликованные в открытом доступе, попадают в базы через парсинг сайтов, сервисов типа 2GIS и профессиональных соцсетей. По этим номерам потом переманивают людей или заваливают спамом. Детально разобрали в статье «Защита номеров сотрудников от парсинга».
Где IP-блокировка всё же работает
Было бы нечестно сказать, что IP-блокировка бесполезна совсем. Она решает несколько реальных задач:
Снижение нагрузки на сервер. Массовые простые боты - поисковые индексаторы, сканеры уязвимостей, пустые запросы с известных дата-центров - создают лишнюю нагрузку. Блокировка их диапазонов снижает потребление ресурсов.
Остановка простых скриптов. Если парсинг написан неопытным человеком без ротации IP, одна блокировка его остановит. Это уберёт самый дешёвый и примитивный сбор данных.
Быстрый ответ на инцидент. Если вы зафиксировали конкретную волну запросов с конкретного диапазона - заблокировать его быстро правильно. Это не решит проблему, но уберёт конкретного актора.
Правильная аналогия: IP-блокировка - это замок на двери. Нужен. Но если злоумышленник профессиональный, он откроет замок или зайдёт через окно. Замок не заменяет систему безопасности.
Что реально работает вместо IP-блокировки
IP-блокировка - это защита на уровне запросов к вашему сайту. Она отвечает на вопрос «кто сюда приходит». Но данные конкурентам попадают не только через прямой парсинг вашего сайта - они попадают через агрегаторы, базы данных, открытые реестры, где ваши данные уже хранятся.
Логика другая: не блокировать тех, кто пытается забрать данные, а закрыть сами данные в источниках, откуда их берут.
Именно по этому принципу работает StopParsing: домены и телефоны сотрудников вносятся под защиту в системах сбора данных - как собственных источниках, так и у партнёров. Ваши данные становятся значительно труднее доступными для систем перехвата: данные закрыты в первоисточниках, до того как кто-то попытался их собрать.
Четыре шага, как это работает:
- 1Аудит периметра - проверяем, какие именно данные и через какие каналы сейчас доступны системам сбора.
- 2План защиты - видим, какие векторы закрывать и в каком объёме, считаем индивидуальную стоимость по результатам аудита.
- 3Закрытие каналов - вносим ваши домены и номера под защиту.
- 4Мониторинг периметра - отслеживаем новые векторы по мере роста бизнеса.
Это не устраняет парсинг вашего сайта как явление - и не обещает этого. Но значительно усложняет задачу тем, кто собирает данные о вашем трафике и сотрудниках.
Что важно понимать про IP-блокировку в этой картине: она остаётся полезным инструментом как один из слоёв защиты. Но рассчитывать, что она остановит целенаправленный сбор данных, не стоит - это ожидание, которое не соответствует реальным возможностям технологии.
Если хотите разобраться, как связаны IP-блокировка, 152-ФЗ и правовая сторона парсинга, - рекомендую статью «Парсинг сайтов и 152-ФЗ: что законно».
Рассчитать, какие данные вашего сайта сейчас открыты для систем сбора, поможет бесплатный аудит периметра. Передайте список ваших сайтов и телефонов сотрудников - покажем, что видно снаружи.
Запросить аудит периметра - stopparsing.ru
Источники
- Cloudflare. «Bot Management». Официальная документация cloudflare.com/learning/bots.
- OWASP. «Blocking Brute Force Attacks». OWASP Foundation, owasp.org.
- Imperva. «Bad Bot Report 2024». Отчёт по структуре бот-трафика, imperva.com.
- Bright Data. «Residential Proxies». Описание принципов работы жилых прокси, brightdata.com.
- Playwright. Официальная документация headless-браузерного фреймворка, playwright.dev.
Цифры и формулировки - из практики и базы знаний LEADLIFE. Кейсы отражают результаты конкретных клиентов и не являются гарантией аналогичного результата.
Посчитаем, сколько клиентов вы теряете
Разбор под вашу нишу: сегменты, цена контакта, что делает отдел продаж. Без обязательств.
Получить расчёт и подарокЧитать дальше
Тестовый домен читают парсеры - даже если основной закрыт
Компании закрывают основной сайт от парсинга - и не замечают, что тестовый домен по-прежнему доступен системам сбора данных с теми же формами, структурой и телефонами.
ЧитатьCallLeadСтоимость звонка вас обманывает: как считать цену встречи
Большинство компаний считают стоимость звонка. Это приятная, но бесполезная цифра. Разбираю, почему и как считать то, что на самом деле важно - стоимость встречи.
ЧитатьCallLead5 признаков, что клиент целевой: слышно за 2 минуты
Оператор слышит десятки «мне интересно» в день - и большинство из них не конвертируются. Вот 5 конкретных признаков, по которым реальный целевой клиент отличается от вежливого слушателя.
Читать