Купи 3000 контактов до 30.07.2026 - получи 300 в подарокОставить заявку
LEADLIFE
Все материалы

Защита данных

Защита сайта от ботов: что изменилось, когда ИИ научился решать CAPTCHA

CAPTCHA разрабатывали против скриптов 2000-х. Нейросети 2024-2026 - это другой класс угрозы. Разбираем, что из привычной защиты ещё работает и что делать с остальным.

21 июля 2026 12 мин чтения
Защита сайта от ботов: что изменилось, когда ИИ научился решать CAPTCHA

Несколько лет назад CAPTCHA была нормальным ответом на вопрос «как защитить форму заявки от ботов». Поставил галочку или выбрал картинки с автобусами - и можно спать спокойно.

Сейчас это уже не так. Не потому что CAPTCHA плохая - она просто решает задачу 2003 года, а не 2026-го.

В этой статье разберём, что конкретно изменилось, какие три рубежа защиты ещё держатся, и что конкурент может снять с вашего сайта даже без касания формы.

Зачем вообще придумали CAPTCHA

Коротко: CAPTCHA разработана против простых скриптов, которые заполняют формы механически без участия человека. Эти скрипты не умели читать искажённый текст или выбирать нужные изображения - поэтому задача и казалась надёжной.

Механика простая. Перед отправкой формы - задание для человека. Скрипт задание проигнорировать не может, значит форму не заполнит. Спамбот не пройдёт.

Это работало. Против скриптов 2000-2010 годов CAPTCHA была вполне достаточной защитой. Стоила мало в настройке, понятна пользователю, давала ощущение контроля.

Но задачи изменились. Современный парсинг - это не спамбот, который отправляет тысячи заявок в час. Это точечный, целенаправленный сбор данных: кто заходит на ваш сайт, какие контакты там опубликованы, как устроен каталог.

И у этого класса угроз появился новый инструмент - нейросети.

Как нейросети научились обходить CAPTCHA

Коротко: современные системы компьютерного зрения решают стандартные image-CAPTCHA с точностью, сопоставимой с человеком. Это не взлом в привычном смысле - просто задача «выбрать все картинки с автобусами» стала обычной задачей распознавания образов.

Вот как это происходит на практике.

CAPTCHA с изображениями строится на том, что человек узнаёт объекты лучше компьютера. В 2012-2015 годах это было правдой. Потом появились сверточные нейронные сети, обученные на миллионах изображений, - и разрыв исчез.

Сегодня системы компьютерного зрения легко читают дорожные знаки, распознают транспортные средства и различают пожарные гидранты - именно то, что CAPTCHA использует как задание. Если такую систему подключить к автоматизированному клиенту браузера, форма с CAPTCHA решается без участия человека.

Аудиальные CAPTCHA закрыли ещё раньше - через системы распознавания речи.

reCAPTCHA v3 от Google переключилась на другой подход: анализ поведения пользователя на странице. Как двигается мышь, как быстро заполняются поля, откуда пришёл трафик. Это сложнее обойти - но и это решается эмуляцией поведения. О том, как именно боты имитируют живого пользователя, мы разбирали в отдельной статье: Как боты притворяются людьми - и почему капча не спасает.

Плюс к этому - существуют сервисы-решатели CAPTCHA, которые используют людей-операторов или ML-системы. Стоит это копейки: решение одной CAPTCHA обходится в доли цента.

Итог: CAPTCHA сегодня задерживает массовый автоматический спам. Против целенаправленного парсинга она - не барьер.

Что происходит с формами вашего сайта прямо сейчас?

Коротко: если на форме стоит только CAPTCHA, целенаправленный парсер её пройдёт. Что именно происходит после - зависит от того, что ищет конкурент.

Разберём три сценария.

Сценарий 1 - снять данные из формы. Конкурент автоматически заполняет форму заявки с поддельными данными. Цель - посмотреть, что происходит после отправки. Куда уходит заявка, в какую CRM или на какой email, как выглядит подтверждение. Добиться реального контакта здесь никто не пытается - это разведка.

Сценарий 2 - определить, кто заходит на сайт. Это другой вид угрозы. Форма здесь вообще не задействована: конкурент работает с посетителями, а не с формой. Человек зашёл на сайт, изучил предложение, ушёл. Если данные посетителей доступны системам сбора - конкурент может позвонить этому человеку раньше вас. В аналитике у вас это выглядит как обычный «отказ», хотя по факту лид перехвачен.

Сценарий 3 - собрать оргструктуру. Из открытых страниц сайта, профилей в 2ГИС, HH.ru, LinkedIn - контакты ваших менеджеров, их должности, зоны ответственности. CAPTCHA здесь совсем ни при чём: это просто парсинг публичных страниц.

Три разных угрозы - и CAPTCHA закрывает максимум одну из них, да и то не надёжно.

Если ваш сайт работает с B2B-трафиком, который вы оплачиваете через рекламу или SEO, - парсинг напрямую бьёт по бюджету. Каждый перехваченный лид означает, что вы заплатили за его привлечение, а продал кто-то другой.

StopParsing закрывает периметр целиком: и сайт, и телефоны сотрудников. Первый шаг - бесплатный аудит, который показывает, какие данные уже доступны системам сбора прямо сейчас.

Запросить аудит периметра - stopparsing.ru

Три рубежа, которые ещё держатся

Коротко: три инструмента по-прежнему работают против автоматического парсинга форм - поведенческий анализ на сервере, honeypot-поля и токены формы. CAPTCHA можно оставить как дополнение, но не как основную защиту.

Рубеж 1 - поведенческий анализ на стороне сервера.

Смотрите не только на то, прошёл ли пользователь CAPTCHA, но и на поведение на странице до отправки формы. Нормальный пользователь приходит с реального IP, проводит на странице несколько минут, прокручивает контент, заполняет поля неравномерно по времени.

Подозрительные паттерны: форма заполнена за 0.8 секунды, IP из датацентра, нестандартный User-Agent, одинаковые данные отправлены несколько раз за 10 минут.

Это работает на сервере - не на клиенте. Клиентский JS можно обойти, серверный анализ - сложнее.

Рубеж 2 - honeypot-поля.

Простой и эффективный метод. В форму добавляется скрытое поле - оно не видно человеку через CSS, но бот его читает и заполняет. Если скрытое поле заполнено - заявка автоматически отклоняется.

Человек ничего не замечает и не раздражается. Массовый бот - попадает в ловушку.

Рубеж 3 - токены формы с привязкой к сессии.

Каждый раз, когда страница с формой открывается, сервер генерирует уникальный токен и привязывает его к сессии браузера. Форма без валидного токена не принимается. Токен действует один раз и истекает через несколько минут.

Это усложняет массовую рассылку заявок: нельзя просто отправить тысячу запросов напрямую на endpoint формы.

Подробнее о практических способах защиты форм - в статье Как защитить формы захвата от автоматического сбора данных.

Почему только формы защищать недостаточно?

Коротко: форма заявки - одна из нескольких точек, через которые утекают данные. Контакты сотрудников, структура сайта, данные о звонках - всё это доступно снаружи без касания формы.

Вот четыре канала, которые часто остаются открытыми.

Канал 1 - посетители сайта. Существуют системы перехвата, которые определяют посетителей вашего сайта до того, как те оставили заявку. Человек зашёл, изучил предложение, не купил - и оказался в чужой базе. Это не про вашу форму, это про трафик в целом.

Канал 2 - телефоны сотрудников. Из открытых источников - сайт, HH.ru, 2ГИС, LinkedIn - можно собрать имена менеджеров, их должности и телефоны. По этим данным восстанавливается оргструктура компании. Конкурент знает, кому из ваших менеджеров позвонить по конкретному вопросу - и переманивает или заваливает спамом.

Канал 3 - данные о звонках. Через незащищённые каналы связи или открытые источники конкурент может узнать, кому вы звоните. Он заходит к вашим клиентам первым, а вы узнаёте об этом уже на стадии «клиент ушёл к другому поставщику».

Канал 4 - рекламный бюджет. Каждый переход с рекламы оплачен вами. Если контакт посетителя попал в базу перехвата до того, как тот оставил заявку - вы заплатили за привлечение лида, который продаст конкурент.

CAPTCHA не закрывает ни один из этих каналов. Она работает только с формой - и только если форму заполняет простой скрипт.

Какие данные конкурент снимает с вашего сайта без формы?

Коротко: открытые страницы сайта - это источник данных для автоматического сбора, а не просто витрина для покупателей. Цены, контакты, структура каталога, описания продуктов, адреса офисов - всё это доступно парсеру без CAPTCHA.

Типичный набор того, что собирается с открытых страниц:

  • Контакты сотрудников из раздела «Команда» или «О нас»
  • Цены и условия из каталога или прайса
  • Структура ассортимента - что и в каком количестве
  • Регионы присутствия, адреса офисов
  • Описания услуг с SEO-ключами, которые показывают, как компания себя позиционирует

Это стандартный конкурентный мониторинг, который автоматизирован. Законодательного запрета на парсинг публичных страниц нет - это просто работа с открытыми данными.

Техническое закрытие здесь идёт через серверные настройки: блокировка bot-агентов, rate limiting, CAPTCHA перед входом в каталог, закрытие прайса за авторизацию. CAPTCHA на основной форме заявки этот слой не прикрывает никак.

Но полностью убрать сайт из зоны досягаемости парсеров нельзя - он должен быть доступен для людей и поисковых ботов. Поэтому настройка защиты требует баланса.

Как работает периметрная защита сайта?

Коротко: вместо точечной защиты одной формы - закрытие всего периметра: сайт, телефоны сотрудников, данные о звонках. Аудит сначала показывает, что уже доступно снаружи, потом под этот объём строится защита.

StopParsing работает в четыре шага.

Шаг 1 - Аудит периметра. Передаёте сайты и телефоны сотрудников. Вам показывают, какие данные уже доступны системам сбора - до того как начинать защиту. Это позволяет понять реальный масштаб проблемы, а не гадать.

Шаг 2 - План защиты. По результатам аудита фиксируются векторы угроз и объём работ. Стоимость считается индивидуально - по числу сайтов и номеров, а не «пакет вслепую» с заранее заданной ценой.

Шаг 3 - Закрываем каналы. Домены и номера сотрудников вносятся под защиту: снять данные с вашего периметра становится намного сложнее. Задействуются как собственные, так и партнёрские источники сбора данных.

Шаг 4 - Держим периметр. Мониторинг, добавление новых сайтов и номеров по мере роста, отчёты о закрытых каналах.

Важный момент: StopParsing работает строго в рамках 152-ФЗ. Защищаем только ваши данные - ваши сайты, ваших сотрудников. Не чужие.

Как выглядит аудит периметра с нуля - в статье Аудит периметра: с чего начинается защита от парсинга.

Что можно проверить прямо сейчас?

Коротко: есть несколько простых вещей, которые можно сделать самостоятельно, не дожидаясь полноценного аудита.

Проверка 1 - поищите своих сотрудников.

Зайдите в поисковик и введите имя любого вашего менеджера с названием компании. Посмотрите, что выдаётся: телефоны, должности, место работы из открытых источников. Если информация легко находится - она доступна и автоматическим системам сбора.

Проверка 2 - посмотрите в логах сервера.

Признаки автоматического сбора: аномально высокое число запросов с одного IP за короткий период, нестандартные User-Agent, запросы к страницам через прямой перебор URL (бот перебирает адреса вместо того, чтобы кликать по ссылкам), обращения в нерабочее время (ночью, в выходные).

Проверка 3 - проверьте форму без CAPTCHA.

Попробуйте заполнить и отправить форму скриптом без CAPTCHA-решателя. Если форма принимает данные без какой-либо дополнительной проверки - это открытый канал.

Если после этих трёх проверок появились вопросы - начните с бесплатного аудита периметра. Он покажет конкретные уязвимости, не общие рекомендации.

Чего не обещаем

Коротко: абсолютной защиты от парсинга не существует. Честные формулировки - «намного сложнее», «значительно труднее». Не «100% защита» и не «парсинг невозможен».

Это важно понять до начала работы.

Любую защиту можно обойти при достаточных ресурсах и мотивации. CAPTCHA - обходят через нейросети. Поведенческий анализ - через эмуляцию живого пользователя. Периметрную защиту - через технические ухищрения с достаточным бюджетом.

Что периметрная защита реально даёт - она поднимает стоимость и сложность сбора ваших данных. Для большинства конкурентных задач это достаточно: дешёвый автоматический мониторинг перестаёт работать. Целенаправленный дорогой сбор против конкретно вашей компании - другая история.

Поэтому честный ответ на вопрос «насколько это надёжно?» - намного лучше, чем ничего. Для большинства B2B-компаний это убирает типичный канал перехвата. Гарантировать абсолютный результат мы не можем - как и никто другой.

Источники

  • StopParsing - сервис защиты от парсинга: stopparsing.ru
  • Google reCAPTCHA v3 - официальная документация: developers.google.com/recaptcha/docs/v3
  • OWASP Automated Threat Handbook - руководство по защите от автоматизированных угроз: owasp.org/www-project-automated-threats-to-web-applications
  • Боты и живой пользователь - разбор механики: leadlife.pro/blog/kak-boty-imitiruyut-povedenie-zhivogo-polzovatelya-i
  • Защита форм захвата - пошаговая инструкция: leadlife.pro/blog/kak-zaschitit-formy-zahvata-ot-avtomaticheskogo-sbora

Если ваш сайт работает и привлекает трафик - он уже интересен системам сбора данных. Вопрос не в том, парсят ли его, а в том, насколько легко это делается.

Слоган StopParsing точный: «Никто не уведёт то, что не смог собрать».

Начните с бесплатного аудита - он покажет, что сейчас открыто, без лишних слов.

Запросить аудит периметра - stopparsing.ru

Цифры и формулировки - из практики и базы знаний LEADLIFE. Кейсы отражают результаты конкретных клиентов и не являются гарантией аналогичного результата.

Посчитаем, сколько клиентов вы теряете

Разбор под вашу нишу: сегменты, цена контакта, что делает отдел продаж. Без обязательств.

Получить расчёт и подарок
ПозвонитьЗаявка