Об автоматическом сканировании
Эта страница — адрес, указанный в user-agent нашего робота. Если вы нашли «GDPRScanMD» в логах своего сервера, здесь написано, кто мы, что именно мы сделали на вашем сайте и как нас остановить.
28 июля 2026 года
1. Кто запускает робота
Оператор: MEGA PROMOTING S.R.L., IDNO 1019600021765, юридический адрес: sat. Dănceni, r-nul Ialoveni, MD-6814, Republica Moldova.
Технический контакт: oleg@megapromoting.com · +373 60 456 690.
Робот входит в состав сервиса GDPR Scan MD, который проверяет публичную поверхность сайта на готовность к Закону № 195/2024. Сканирования приходят из двух источников, и мы объявляем оба. Подавляющее большинство запускает человек, введя адрес в публичную форму. Кроме того, мы проводим периодическое статистическое исследование по перечню сайтов Республики Молдова — не чаще одного раза в месяц для каждого адреса; что обрабатывается, на каком основании и как попросить об исключении, изложено на странице «Статистическое исследование». Никаких других обходов мы не делаем.
2. Как узнать нас в логах
Полная строка user-agent: GDPRScanMD/1.0 (+https://ongdpr.md/despre-scanare)
Токен для robots.txt: GDPRScanMD
IP-адрес источника: 141.227.180.10 (OVHcloud, București, România (UE)). Запросы приходят с одной машины. Мы не используем резидентные прокси, ротацию адресов и другие способы маскировки.
Мы не выдаём себя за человека. Фальшивый user-agent «Chrome» и параметры, скрывающие автоматизацию, были удалены намеренно: сервис, который продаёт соответствие требованиям, не может маскировать собственного робота.
3. Что именно делает сканирование
Мы открываем ту публичную страницу, адрес которой вы ввели в форму, — именно её — в настоящем Chromium, при разрешении 1920×1080, с чистым профилем, без предыдущих cookie и без авторизованной сессии. Общий бюджет сканирования — 45 секунд.
Кроме неё мы открываем не более трёх внутренних страниц того же сайта, выбранных из ссылок указанной вами страницы: не более одной страницы контактов, одной страницы «о нас» и одной страницы политики конфиденциальности. Причина в том, что формы и информирование обычно находятся именно там, а не на главной, и отчёт, который их не видит, говорит немного. Только тот же сайт, никогда сторонний домен и никогда другой поддомен; без файлов, лент и документов; у каждой внутренней страницы 6 секунд на переход и не более 1,5 секунды ожидания, а у всех трёх вместе — бюджет 10 секунд. Они читаются только как текст: без снимка экрана, без TLS-пробы и без чтения хранилищ. Дальше них мы не идём — найденные там ссылки не открываются.
Правила ниже применяются к каждой внутренней странице так же, как к стартовой: мы заново проверяем /robots.txt для её адреса и повторяем проверку против SSRF, а не предполагаем, что проверка стартовой страницы их покрывает.
Помимо страниц мы делаем не более трёх дополнительных запросов: файл /robots.txt того же источника; один GET-запрос к странице политики конфиденциальности, найденной на странице (бюджет 10 секунд, без перехода по редиректам); и отдельное TLS-соединение на порт 443, чтобы прочитать сертификат.
Все запросы — GET. Мы не отправляем POST, PUT, PATCH или DELETE. Мы не заполняем и не отправляем формы. Мы не пытаемся авторизоваться, не перебираем параметры, не сканируем порты и не ищем скрытые файлы.
4. Единственное взаимодействие со страницей
Если мы находим баннер согласия с видимым элементом отказа, мы нажимаем его один раз и записываем последующие сетевые запросы. Это и есть проверка того, действительно ли кнопка «Отклонить» останавливает отслеживание или является декоративной.
Мы не нажимаем «Принять». Мы не нажимаем другие кнопки и не ходим по сайту кликами. Не более трёх внутренних страниц из пункта 3 открываются напрямую, по адресу, а не через взаимодействие со страницей.
5. Мы соблюдаем robots.txt
Прежде всего мы читаем /robots.txt целевого источника и применяем правила для токена GDPRScanMD по RFC 9309: выигрывает наиболее специфичная группа, а при совпадении одинаковой длины Allow имеет приоритет над Disallow.
Если адрес запрещён, мы не сканируем его вовсе и сообщаем об этом человеку, который запросил проверку. В публичном интерфейсе нет опции, позволяющей обойти эту проверку.
Если robots.txt прочитать невозможно — его нет, истекло время ожидания или сервер ответил ошибкой — мы продолжаем сканирование. Недоступный файл не является запретом.
6. Как часто мы можем к вам обращаться
Один хост получает не более одного свежего сканирования раз в 15 минут. Запросы, поступившие раньше, получают предыдущий результат из памяти, и ваш сайт при этом не затрагивается.
Кроме того, с одного IP-адреса заказчика можно запустить не более 5 сканирований за 10 минут, и одновременно выполняется только одно.
В худшем случае это означает одну загрузку страницы раз в 15 минут.
7. Что мы загружаем и сколько храним
Во время сканирования мы загружаем страницу вместе с её подресурсами, как обычный посетитель: скрипты, стили, изображения, шрифты, фреймы и запросы, которые страница делает сама. Ничто из этого не сохраняется целиком.
На диске остаются только три артефакта: снимок страницы, снимок баннера согласия (если он найден) и журнал сетевых запросов до согласия. Все они удаляются автоматически через 7 дней.
В отчёте сохраняются находки и текстовые доказательства: адреса запросов, имена cookie, HTTP-заголовки. Мы не храним копию исходного кода вашего сайта и не распространяем его.
Полные сроки по категориям — на странице «Хранение данных».
8. Как запросить исключение
Способ, который гарантирован кодом, действует сразу и не требует писать нам: добавьте в /robots.txt своего сайта группу «User-agent: GDPRScanMD» и строку «Disallow: /». Начиная со следующего запроса сканирование будет отклонено ещё до обращения к вашей странице.
Если нужно письменное подтверждение или исключение всего домена, напишите на oleg@megapromoting.com с адреса на этом домене либо с другим доказательством контроля над ним. Мы отвечаем не более чем за 2 рабочих дня.
Говорим прямо: список исключений на уровне приложения, независимый от robots.txt, ещё не реализован. До этого robots.txt остаётся механизмом, который действительно применяет код, а запросы по электронной почте мы подтверждаем письменно и применяем вручную.
Вы, разумеется, можете заблокировать 141.227.180.10 на межсетевом экране. Мы не считаем это инцидентом и не пытаемся обойти блокировку.
Если сканирование создало вам конкретную проблему — нагрузку, срабатывание оповещений, отчёт, который вы считаете ошибочным — напишите нам адрес и примерное время. У нас есть логи, и мы ответим тем, что действительно выполнялось.
9. Чего мы не делаем
Мы не обходим анти-бот защиту и не подделываем заголовки, чтобы пройти через межсетевой экран приложения. Мы не повторяем автоматически сканирование, в котором нам отказали.
Мы не индексируем отчёты: страницы отчётов помечены «noindex» и запрещены в нашем собственном robots.txt — именно потому, что отчёт называет реальную компанию.
Публичная статистика, которую мы показываем, агрегирована: число различных доменов и доля несоответствующих. Списки названий просканированных сайтов мы не публикуем.
10. Основание и право на жалобу
Сканирование наблюдает информацию, которую сайт публикует намеренно: HTTP-заголовки, cookie, сетевые запросы и текст политик. Мы не собираем персональные данные посетителей вашего сайта и не заходим в защищённые разделы.
Если вы всё же считаете, что обработка касается вас и нарушает ваши права, напишите на oleg@megapromoting.com. Вы также можете обратиться в Национальный центр по защите персональных данных (CNPDCP) — https://datepersonale.md.