Правовые аспекты веб-скрейпинга: GDPR, 152-ФЗ и robots.txt
Юридический гид по веб-скрейпингу в 2026 году: что говорит закон, как соблюдать GDPR и российский 152-ФЗ, роль robots.txt и лучшие практики для легального сбора данных.
Команда InfraProxy
5 февраля 2026 г.
Почему это важно
Легальный веб-скрейпинг — это автоматизированный сбор публично доступной информации из открытых источников в интернете, не нарушающий авторские права, условия пользовательских соглашений (Terms of Service) и законы о защите персональных данных, такие как европейский GDPR и российский 152-ФЗ.
Веб-скрейпинг — мощный инструмент для бизнеса, но он находится на пересечении технологий и права. Неправильный подход может привести к судебным искам, штрафам и репутационным потерям. Понимание правовых рамок — необходимость, а не опция.
Хорошая новость: сбор публично доступных данных в большинстве юрисдикций является легальным при соблюдении определённых правил. Разберём их подробно.
Международная практика
Судебная практика зависит от страны, типа данных, способа доступа и условий использования источника. Публичная доступность страницы сама по себе не отменяет авторское право, требования к персональным данным и договорные ограничения.
Перед регулярным сбором проверьте ToS, robots.txt, лицензию данных и применимое право. Для персональных данных, материалов за авторизацией и коммерческого использования нужна отдельная юридическая оценка.
GDPR (Европейский союз)
Регламент GDPR (General Data Protection Regulation) — самый строгий закон о защите персональных данных в мире. Он применяется, если:
- Вы собираете данные граждан ЕС
- Ваша компания находится в ЕС
- Вы предлагаете товары/услуги гражданам ЕС
Что считается персональными данными по GDPR
- Имена и фамилии
- Email-адреса
- Номера телефонов
- IP-адреса (!)
- Фотографии
- Местоположение
- Любые данные, позволяющие идентифицировать человека
Ключевые принципы
- Законное основание: у вас должно быть основание для сбора данных (согласие, законный интерес, исполнение договора и т.д.)
- Минимизация данных: собирайте только то, что действительно нужно
- Ограничение хранения: не храните данные дольше, чем необходимо
- Право на удаление: субъект данных может потребовать удалить свои данные
Штрафы
До 20 млн евро или 4% мирового годового оборота — в зависимости от того, что больше. Штрафы не теоретические: в 2023-2025 годах были вынесены десятки решений на сотни миллионов евро.
152-ФЗ (Россия)
Федеральный закон №152-ФЗ «О персональных данных» — российский аналог GDPR. Он регулирует сбор, хранение и обработку персональных данных граждан РФ.
Что считается персональными данными
Определение шире, чем в GDPR:
- ФИО
- Дата и место рождения
- Адрес
- Семейное, социальное и имущественное положение
- Образование, профессия
- Доходы
- Любая информация, относящаяся к определённому или определяемому физическому лицу
Ключевые требования
- Согласие на обработку: как правило, требуется согласие субъекта. Но есть исключения — например, обработка общедоступных данных (данных, которые субъект сам сделал общедоступными).
- Локализация: базы персональных данных граждан РФ должны храниться на территории России.
- Уведомление Роскомнадзора: оператор персональных данных обязан уведомить РКН о начале обработки.
- Обеспечение безопасности: необходимо принять технические и организационные меры защиты.
Штрафы
С 2024 года штрафы за нарушение 152-ФЗ существенно увеличены:
- Для юридических лиц — до 18 млн руб. за первичное нарушение
- За утечку данных — оборотные штрафы до 3% выручки
Что можно собирать без ограничений
- Публичные бизнес-данные: цены, ассортимент, описания товаров, характеристики
- Открытую корпоративную информацию: реквизиты компаний из ЕГРЮЛ/ЕГРИП
- Агрегированные данные: статистика без привязки к конкретным лицам
- Общедоступные данные: информация из публичных реестров, открытых API
robots.txt
Файл robots.txt — это текстовый файл в корне сайта, который указывает ботам, какие разделы сайта можно и нельзя сканировать.
Юридическая сила
В разных юрисдикциях robots.txt имеет разную юридическую силу:
- США: прямой юридической силы не имеет, но его нарушение может быть использовано как аргумент в суде
- ЕС: может рассматриваться как выражение воли владельца сайта
- Россия: не имеет прямой юридической силы, но может считаться добросовестной практикой
Рекомендация
Даже если robots.txt формально не обязателен — уважайте его. Это демонстрирует добросовестность и снижает юридические риски. Если robots.txt запрещает сканирование определённого раздела — лучше не собирать оттуда данные.
Пользовательские соглашения (Terms of Service)
Многие сайты в условиях использования запрещают автоматизированный сбор данных. Юридическая сила таких запретов различается:
- Если вы не создавали аккаунт — вы формально не принимали условия, и их сила ограничена
- Если вы авторизовались — вы приняли условия, и их нарушение может иметь юридические последствия
Общее правило: собирайте только то, что доступно без авторизации.
Лучшие практики легального скрейпинга
Что делать
- Собирайте только публичные данные — информацию, доступную любому посетителю без входа в аккаунт
- Проверяйте robots.txt перед началом сбора
- Не перегружайте серверы — ограничивайте частоту запросов, чтобы не влиять на работу сайта
- Не собирайте персональные данные без законного основания
- Храните данные безопасно — шифрование, ограничение доступа
- Документируйте — фиксируйте, какие данные, откуда и зачем вы собираете
- Используйте данные ответственно — только для заявленных целей
Чего не делать
- Не обходите авторизацию — не используйте чужие учётные записи
- Не собирайте защищённые данные — медицинские, финансовые, данные несовершеннолетних
- Не перепродавайте персональные данные
- Не используйте данные для спама, мошенничества или дискриминации
- Не игнорируйте запросы на удаление данных
Чек-лист перед запуском скрейпинга
- Данные публично доступны (без авторизации)?
- Проверен robots.txt?
- Не собираются персональные данные?
- Частота запросов не перегружает сервер?
- Есть документация целей и методов сбора?
- Данные хранятся в соответствии с требованиями 152-ФЗ/GDPR?
- Есть план реагирования на запросы об удалении?
Читайте также
Перед рабочим запуском проверьте задачу на разрешённом источнике: возможности Scraper API.
Этичность и ограничения
Перед сбором проверьте официальный API, robots.txt и условия использования источника. Соблюдайте Disallow и Crawl-delay, ограничивайте параллельность, используйте backoff на 429/503 и кэшируйте ответы. Собирайте только публичные данные: без обхода логина и paywall, без персональных данных и перепубликации чужих текстов. Используйте честный User-Agent и обрабатывайте запросы на удаление данных.
Нужно получать публичные данные без поддержки собственной инфраструктуры?
Посмотрите возможности Scraper API, условия теста и примеры интеграции.
Перейти к Scraper APIЧитайте также
Сбор данных из веба в России: 152-ФЗ и легальные способы
Правовые аспекты сбора данных для AI в России: 152-ФЗ, персональные данные, публичная информация, robots.txt. Чек-лист легального краулинга для бизнеса.
БизнесВеб-скрейпинг для научных исследований: методы и лучшие практики
Как дата-сайентисты и исследователи используют веб-скрейпинг в академии: сбор Big Data, этические протоколы, обработка ограничений и обеспечение воспроизводимости.
БизнесАвтоматизация маркетинговых исследований с помощью веб-скрейпинга
Как автоматизировать маркетинговые исследования: построение дата-пайплайнов, анализ тональности, конкурентное картирование и мониторинг трендов через веб-скрейпинг.