Защита данных
Защита сайта от ботов: что изменилось, когда ИИ научился решать CAPTCHA
CAPTCHA разрабатывали против скриптов 2000-х. Нейросети 2024-2026 - это другой класс угрозы. Разбираем, что из привычной защиты ещё работает и что делать с остальным.

Несколько лет назад CAPTCHA была нормальным ответом на вопрос «как защитить форму заявки от ботов». Поставил галочку или выбрал картинки с автобусами - и можно спать спокойно.
Сейчас это уже не так. Не потому что CAPTCHA плохая - она просто решает задачу 2003 года, а не 2026-го.
В этой статье разберём, что конкретно изменилось, какие три рубежа защиты ещё держатся, и что конкурент может снять с вашего сайта даже без касания формы.
Зачем вообще придумали CAPTCHA
Коротко: CAPTCHA разработана против простых скриптов, которые заполняют формы механически без участия человека. Эти скрипты не умели читать искажённый текст или выбирать нужные изображения - поэтому задача и казалась надёжной.
Механика простая. Перед отправкой формы - задание для человека. Скрипт задание проигнорировать не может, значит форму не заполнит. Спамбот не пройдёт.
Это работало. Против скриптов 2000-2010 годов CAPTCHA была вполне достаточной защитой. Стоила мало в настройке, понятна пользователю, давала ощущение контроля.
Но задачи изменились. Современный парсинг - это не спамбот, который отправляет тысячи заявок в час. Это точечный, целенаправленный сбор данных: кто заходит на ваш сайт, какие контакты там опубликованы, как устроен каталог.
И у этого класса угроз появился новый инструмент - нейросети.
Как нейросети научились обходить CAPTCHA
Коротко: современные системы компьютерного зрения решают стандартные image-CAPTCHA с точностью, сопоставимой с человеком. Это не взлом в привычном смысле - просто задача «выбрать все картинки с автобусами» стала обычной задачей распознавания образов.
Вот как это происходит на практике.
CAPTCHA с изображениями строится на том, что человек узнаёт объекты лучше компьютера. В 2012-2015 годах это было правдой. Потом появились сверточные нейронные сети, обученные на миллионах изображений, - и разрыв исчез.
Сегодня системы компьютерного зрения легко читают дорожные знаки, распознают транспортные средства и различают пожарные гидранты - именно то, что CAPTCHA использует как задание. Если такую систему подключить к автоматизированному клиенту браузера, форма с CAPTCHA решается без участия человека.
Аудиальные CAPTCHA закрыли ещё раньше - через системы распознавания речи.
reCAPTCHA v3 от Google переключилась на другой подход: анализ поведения пользователя на странице. Как двигается мышь, как быстро заполняются поля, откуда пришёл трафик. Это сложнее обойти - но и это решается эмуляцией поведения. О том, как именно боты имитируют живого пользователя, мы разбирали в отдельной статье: Как боты притворяются людьми - и почему капча не спасает.
Плюс к этому - существуют сервисы-решатели CAPTCHA, которые используют людей-операторов или ML-системы. Стоит это копейки: решение одной CAPTCHA обходится в доли цента.
Итог: CAPTCHA сегодня задерживает массовый автоматический спам. Против целенаправленного парсинга она - не барьер.
Что происходит с формами вашего сайта прямо сейчас?
Коротко: если на форме стоит только CAPTCHA, целенаправленный парсер её пройдёт. Что именно происходит после - зависит от того, что ищет конкурент.
Разберём три сценария.
Сценарий 1 - снять данные из формы. Конкурент автоматически заполняет форму заявки с поддельными данными. Цель - посмотреть, что происходит после отправки. Куда уходит заявка, в какую CRM или на какой email, как выглядит подтверждение. Добиться реального контакта здесь никто не пытается - это разведка.
Сценарий 2 - определить, кто заходит на сайт. Это другой вид угрозы. Форма здесь вообще не задействована: конкурент работает с посетителями, а не с формой. Человек зашёл на сайт, изучил предложение, ушёл. Если данные посетителей доступны системам сбора - конкурент может позвонить этому человеку раньше вас. В аналитике у вас это выглядит как обычный «отказ», хотя по факту лид перехвачен.
Сценарий 3 - собрать оргструктуру. Из открытых страниц сайта, профилей в 2ГИС, HH.ru, LinkedIn - контакты ваших менеджеров, их должности, зоны ответственности. CAPTCHA здесь совсем ни при чём: это просто парсинг публичных страниц.
Три разных угрозы - и CAPTCHA закрывает максимум одну из них, да и то не надёжно.
Если ваш сайт работает с B2B-трафиком, который вы оплачиваете через рекламу или SEO, - парсинг напрямую бьёт по бюджету. Каждый перехваченный лид означает, что вы заплатили за его привлечение, а продал кто-то другой.
StopParsing закрывает периметр целиком: и сайт, и телефоны сотрудников. Первый шаг - бесплатный аудит, который показывает, какие данные уже доступны системам сбора прямо сейчас.
Запросить аудит периметра - stopparsing.ru
Три рубежа, которые ещё держатся
Коротко: три инструмента по-прежнему работают против автоматического парсинга форм - поведенческий анализ на сервере, honeypot-поля и токены формы. CAPTCHA можно оставить как дополнение, но не как основную защиту.
Рубеж 1 - поведенческий анализ на стороне сервера.
Смотрите не только на то, прошёл ли пользователь CAPTCHA, но и на поведение на странице до отправки формы. Нормальный пользователь приходит с реального IP, проводит на странице несколько минут, прокручивает контент, заполняет поля неравномерно по времени.
Подозрительные паттерны: форма заполнена за 0.8 секунды, IP из датацентра, нестандартный User-Agent, одинаковые данные отправлены несколько раз за 10 минут.
Это работает на сервере - не на клиенте. Клиентский JS можно обойти, серверный анализ - сложнее.
Рубеж 2 - honeypot-поля.
Простой и эффективный метод. В форму добавляется скрытое поле - оно не видно человеку через CSS, но бот его читает и заполняет. Если скрытое поле заполнено - заявка автоматически отклоняется.
Человек ничего не замечает и не раздражается. Массовый бот - попадает в ловушку.
Рубеж 3 - токены формы с привязкой к сессии.
Каждый раз, когда страница с формой открывается, сервер генерирует уникальный токен и привязывает его к сессии браузера. Форма без валидного токена не принимается. Токен действует один раз и истекает через несколько минут.
Это усложняет массовую рассылку заявок: нельзя просто отправить тысячу запросов напрямую на endpoint формы.
Подробнее о практических способах защиты форм - в статье Как защитить формы захвата от автоматического сбора данных.
Почему только формы защищать недостаточно?
Коротко: форма заявки - одна из нескольких точек, через которые утекают данные. Контакты сотрудников, структура сайта, данные о звонках - всё это доступно снаружи без касания формы.
Вот четыре канала, которые часто остаются открытыми.
Канал 1 - посетители сайта. Существуют системы перехвата, которые определяют посетителей вашего сайта до того, как те оставили заявку. Человек зашёл, изучил предложение, не купил - и оказался в чужой базе. Это не про вашу форму, это про трафик в целом.
Канал 2 - телефоны сотрудников. Из открытых источников - сайт, HH.ru, 2ГИС, LinkedIn - можно собрать имена менеджеров, их должности и телефоны. По этим данным восстанавливается оргструктура компании. Конкурент знает, кому из ваших менеджеров позвонить по конкретному вопросу - и переманивает или заваливает спамом.
Канал 3 - данные о звонках. Через незащищённые каналы связи или открытые источники конкурент может узнать, кому вы звоните. Он заходит к вашим клиентам первым, а вы узнаёте об этом уже на стадии «клиент ушёл к другому поставщику».
Канал 4 - рекламный бюджет. Каждый переход с рекламы оплачен вами. Если контакт посетителя попал в базу перехвата до того, как тот оставил заявку - вы заплатили за привлечение лида, который продаст конкурент.
CAPTCHA не закрывает ни один из этих каналов. Она работает только с формой - и только если форму заполняет простой скрипт.
Какие данные конкурент снимает с вашего сайта без формы?
Коротко: открытые страницы сайта - это источник данных для автоматического сбора, а не просто витрина для покупателей. Цены, контакты, структура каталога, описания продуктов, адреса офисов - всё это доступно парсеру без CAPTCHA.
Типичный набор того, что собирается с открытых страниц:
- Контакты сотрудников из раздела «Команда» или «О нас»
- Цены и условия из каталога или прайса
- Структура ассортимента - что и в каком количестве
- Регионы присутствия, адреса офисов
- Описания услуг с SEO-ключами, которые показывают, как компания себя позиционирует
Это стандартный конкурентный мониторинг, который автоматизирован. Законодательного запрета на парсинг публичных страниц нет - это просто работа с открытыми данными.
Техническое закрытие здесь идёт через серверные настройки: блокировка bot-агентов, rate limiting, CAPTCHA перед входом в каталог, закрытие прайса за авторизацию. CAPTCHA на основной форме заявки этот слой не прикрывает никак.
Но полностью убрать сайт из зоны досягаемости парсеров нельзя - он должен быть доступен для людей и поисковых ботов. Поэтому настройка защиты требует баланса.
Как работает периметрная защита сайта?
Коротко: вместо точечной защиты одной формы - закрытие всего периметра: сайт, телефоны сотрудников, данные о звонках. Аудит сначала показывает, что уже доступно снаружи, потом под этот объём строится защита.
StopParsing работает в четыре шага.
Шаг 1 - Аудит периметра. Передаёте сайты и телефоны сотрудников. Вам показывают, какие данные уже доступны системам сбора - до того как начинать защиту. Это позволяет понять реальный масштаб проблемы, а не гадать.
Шаг 2 - План защиты. По результатам аудита фиксируются векторы угроз и объём работ. Стоимость считается индивидуально - по числу сайтов и номеров, а не «пакет вслепую» с заранее заданной ценой.
Шаг 3 - Закрываем каналы. Домены и номера сотрудников вносятся под защиту: снять данные с вашего периметра становится намного сложнее. Задействуются как собственные, так и партнёрские источники сбора данных.
Шаг 4 - Держим периметр. Мониторинг, добавление новых сайтов и номеров по мере роста, отчёты о закрытых каналах.
Важный момент: StopParsing работает строго в рамках 152-ФЗ. Защищаем только ваши данные - ваши сайты, ваших сотрудников. Не чужие.
Как выглядит аудит периметра с нуля - в статье Аудит периметра: с чего начинается защита от парсинга.
Что можно проверить прямо сейчас?
Коротко: есть несколько простых вещей, которые можно сделать самостоятельно, не дожидаясь полноценного аудита.
Проверка 1 - поищите своих сотрудников.
Зайдите в поисковик и введите имя любого вашего менеджера с названием компании. Посмотрите, что выдаётся: телефоны, должности, место работы из открытых источников. Если информация легко находится - она доступна и автоматическим системам сбора.
Проверка 2 - посмотрите в логах сервера.
Признаки автоматического сбора: аномально высокое число запросов с одного IP за короткий период, нестандартные User-Agent, запросы к страницам через прямой перебор URL (бот перебирает адреса вместо того, чтобы кликать по ссылкам), обращения в нерабочее время (ночью, в выходные).
Проверка 3 - проверьте форму без CAPTCHA.
Попробуйте заполнить и отправить форму скриптом без CAPTCHA-решателя. Если форма принимает данные без какой-либо дополнительной проверки - это открытый канал.
Если после этих трёх проверок появились вопросы - начните с бесплатного аудита периметра. Он покажет конкретные уязвимости, не общие рекомендации.
Чего не обещаем
Коротко: абсолютной защиты от парсинга не существует. Честные формулировки - «намного сложнее», «значительно труднее». Не «100% защита» и не «парсинг невозможен».
Это важно понять до начала работы.
Любую защиту можно обойти при достаточных ресурсах и мотивации. CAPTCHA - обходят через нейросети. Поведенческий анализ - через эмуляцию живого пользователя. Периметрную защиту - через технические ухищрения с достаточным бюджетом.
Что периметрная защита реально даёт - она поднимает стоимость и сложность сбора ваших данных. Для большинства конкурентных задач это достаточно: дешёвый автоматический мониторинг перестаёт работать. Целенаправленный дорогой сбор против конкретно вашей компании - другая история.
Поэтому честный ответ на вопрос «насколько это надёжно?» - намного лучше, чем ничего. Для большинства B2B-компаний это убирает типичный канал перехвата. Гарантировать абсолютный результат мы не можем - как и никто другой.
Источники
- StopParsing - сервис защиты от парсинга: stopparsing.ru
- Google reCAPTCHA v3 - официальная документация: developers.google.com/recaptcha/docs/v3
- OWASP Automated Threat Handbook - руководство по защите от автоматизированных угроз: owasp.org/www-project-automated-threats-to-web-applications
- Боты и живой пользователь - разбор механики: leadlife.pro/blog/kak-boty-imitiruyut-povedenie-zhivogo-polzovatelya-i
- Защита форм захвата - пошаговая инструкция: leadlife.pro/blog/kak-zaschitit-formy-zahvata-ot-avtomaticheskogo-sbora
Если ваш сайт работает и привлекает трафик - он уже интересен системам сбора данных. Вопрос не в том, парсят ли его, а в том, насколько легко это делается.
Слоган StopParsing точный: «Никто не уведёт то, что не смог собрать».
Начните с бесплатного аудита - он покажет, что сейчас открыто, без лишних слов.
Запросить аудит периметра - stopparsing.ru
Цифры и формулировки - из практики и базы знаний LEADLIFE. Кейсы отражают результаты конкретных клиентов и не являются гарантией аналогичного результата.
Посчитаем, сколько клиентов вы теряете
Разбор под вашу нишу: сегменты, цена контакта, что делает отдел продаж. Без обязательств.
Получить расчёт и подарокЧитать дальше
Данные о звонках утекают к конкурентам: 3 пути и как закрыть
Конкурент иногда знает, кому вы звоните - и это происходит без взлома. Разбираем 3 пути, через которые данные о звонках уходят наружу, и как эти каналы закрыть.
ЧитатьCallLeadПервый звонок решает всё: что теряется на 2-й и 3-й попытке
Когда менеджер перезванивает во второй раз, он думает - вдруг просто не слышали. Но что-то уже изменилось. Разбираем, что именно и почему первый звонок клиенту - самый ценный.
ЧитатьWantLead98% посетителей вашего сайта уходят без заявки - кто они
100 человек пришли на ваш сайт. 2 оставили заявку. 98 ушли молча. Разбираем, кто они, и почему трафик не превращается в заявки.
Читать