реклама
Новости Software

Разработчики открытого ПО объявили партизанскую войну сборщикам данных для ИИ

Боты, которые массово собирают данные с веб-страниц для обучения и работы моделей искусственного интеллекта, становятся всё более ощутимой проблемой для владельцев сайтов. Некоторые разработчики начали давать отпор этим системам оригинальными способами, которые могут показаться наивными или ироничными, но во многих случаях они работают.

 Источник изображения: Ticka Kao / unsplash.com

Источник изображения: Ticka Kao / unsplash.com

Атаке веб-сканера сегодня может подвергнуться любой сайт. Иногда сайты даже теряют работоспособность, но сильнее прочих страдают разработчики ПО с открытым кодом: на сайтах таких проектов выкладываются материалы для скачивания, но ресурсов у них меньше, чем у коммерческих проектов. Проблема в том, что ИИ-боты игнорируют директивы файлов robot.txt, в которых указываются запрещённые для сканирования разделы. В январе разработчик открытого ПО Се Ясо (Xe Iaso) опубликовал в блоге «крик о помощи», рассказав о неподобающих действиях AmazonBot. Этот бот неустанно бил по Git-серверу разработчика, устраивая настоящие DDoS-атаки. Он игнорировал директивы robot.txt, менял IP-адреса, подменял значения строки User agent и прибегал к другим уловкам.

В итоге Ясо разработал программу Anubis, которая проводит проверку подключающихся к серверу Git клиентов — она блокирует ботов, но пропускает браузеры, которыми пользуются люди. Проект Anubis был опубликован на GitHub 19 марта, и всего за несколько дней он собрал 2000 звёзд, 20 участников и 39 форков. Успех программы указывает, что случай Ясо не уникален: на агрессивное поведение ИИ-ботов указал основатель и гендиректор платформы SourceHut Дрю ДеВолт (Drew DeVault), которому приходится от 20 % до 100 % рабочего времени тратить на защиту от веб-сканеров. Администратору проекта Linux Fedora Кевину Фензи (Kevin Fenzi) в какой-то момент пришлось полностью заблокировать Бразилию, а разработчик KDE Plasma Никколо Венеранди (Niccolò Venerandi) однажды временно заблокировал все китайские IP-адреса.

В январе анонимный разработчик под ником Aaron выпустил решение под названием Nepenthes в честь кувшиночника — насекомоядного растения. Система заманивает ИИ-ботов в «лабиринт» бесполезного контента, заставляя их сканировать чушь. Аналогичное решение недавно представила Cloudflare — оно получило более очевидное название AI Labyrinth. Эта система подключается, когда боты не соблюдают директиву «no crawl», — в результате они попусту тратят время и ресурсы. Дрю ДеВолт вообще призвал бойкотировать все новомодные ИИ-инструменты, в том числе большие языковые модели, генераторы изображений и GitHub Copilot. Едва ли это случится в действительности, поэтому разработчикам открытого ПО приходится подключать смекалку.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме
window-new
Soft
Hard
Тренды 🔥
«Торт не был ложью!»: Nintendo подтвердила релиз Hollow Knight: Silksong в 2025 году и показала 5 секунд геймплея 27 мин.
Adobe придумала монтаж без пересъёмок: Premiere Pro 25.2 получил ИИ, который добавит ролику недостающие кадры 30 мин.
FromSoftware анонсировала мультиплеерный боевик The Duskbloods, который выглядит как смесь Elden Ring и Bloodborne — это эксклюзив Nintendo Switch 2 2 ч.
Менеджер паролей Google наконец научится переносить ключи доступа на новый смартфон 2 ч.
Еврокомиссия потребует от мессенджеров и сервисов бэкдоры в сквозном шифровании 2 ч.
Apple закрыла множество уязвимостей в старых ОС, через которые взламывались iPhone, iPad и Mac 5 ч.
«Всё будет»: глава Battlestate Games подтвердил, что Escape from Tarkov и Escape from Tarkov: Arena выйдут в Steam 8 ч.
TikTok закроет свой клон Instagram 8 мая 8 ч.
Meta лишилась главы фундаментальных ИИ-исследований 8 ч.
MTS AI выпустила ИИ-модель Cotype Pro 2, которая станет основой ИИ-агентов для бизнеса 9 ч.
У Tesla рухнули поставки электромобилей — это связывают с политической активностью Маска 6 мин.
QSAN представила СХД серии XN5 типа All-NVMe с процессорами Intel Xeon 23 мин.
Мобильная GeForce RTX 5090 оказалась всего на 10–15 % быстрее мобильной RTX 5080, и на 72 % дороже 39 мин.
Arm собиралась купить Alphawave ради передовой технологии SerDes для выпуска ИИ-чипов 2 ч.
Raspberry Pi похвалилась ростом спроса на свои маленькие компьютеры 2 ч.
Qualcomm представила Snapdragon 8s Gen 4 — процессор для бюджетных флагманов или дорогих «середнячков» 2 ч.
Новая космическая обсерватория SPHEREx прислала первые снимки — их качество удовлетворило NASA 3 ч.
Samsung представила планшеты Galaxy Tab S10 FE и Galaxy Tab S10 FE+ со стилусом и ИИ-функциями — от €580 4 ч.
Доля процессоров и видеокарт AMD резко подскочила в статистике Steam, а Windows 11 снова стала самой популярной ОС 4 ч.
NASA испытало силовые щиты для спасения людей и техники от вездесущей пыли на Луне 4 ч.
Включить темный режим