Боты в реальном времени: сайт-зоопарк
Так как я сейчас работаю над проектом, который делает из сообщества ВК полноценный сайт с автопостингом, я постоянно копаюсь в новостях про поисковых ботов. Ну там как они индексируют информацию, которая потом попадает в источники ответов Алисы, ChatGPT и прочих. Так вот наткнулся на сайт-зоопарк для ботов. Смотрители в реальном времени наблюдают, кто ползает по сайту: Googlebot, GPTBot, Slackbot и прочие.
И вот какая штука выяснилась. На robots.txt большинству ботов плевать. 107 ботов честно соблюдали правила, а 20 243 - прочитали и всё равно нарушили. Плюс зоопарк обнаружил три новых, ранее неизученных вида ботов.
Ребята подошли к делу с юмором и понастроили ботам аттракционов. Есть ловушка - место, куда ботам запрещено ходить, но они всё равно идут. Есть бездонный лабиринт с кучей дверей, куда они заходят и теряются. Один бедолага уже ушёл на 124 тысячи комнат вглубь. Ботов рассаживают по тематическим вольерам: Savanna для поисковиков, Aviary для AI-краулеров, Swamp для SEO-ботов, Petting Zoo для превью-сервисов и Feral Pit для неопознанных. Посетители могут оставлять текстовые «угощения» в файлах для разных вольеров - боты их видят при запросах. А потом можно проверить, съел ли бот угощение сам или его украл кто-то другой. Ещё там есть Дикая яма с табличкой «Не кормить. Избегать зрительного контакта» - туда отправляют всё неконтролируемое вроде curl.
Из технических деталей: идентификация ботов идёт через reverse DNS и проверку по IP-диапазонам операторов. Самозванцев, которые выдают себя за Googlebot, но таковыми не являются, отправляют в ловушку (лабиринт). У каждого бота есть своя страница-экспонат: кто оператор, какой user agent, как заблокировать через robots.txt или на уровне сервера, сколько запросов за 30 дней, какие страницы любит. Googlebot, кстати, оказался на удивление дисциплинированным - соблюдает robots.txt на 100%.
Недавно на Crawler Zoo обрушился просто колоссальный трафик: почти 400 тысяч ботов за день против 20 тысяч реальных людей.