реклама
Новости Software

Сборщики данных для ИИ оказались виновниками массового замедления сайтов по всему интернету

Платформа Git-хостинга открытых проектов SourceHut заявила, что работа её сервисов замедлилась из-за веб-сканеров, которые запускают компании — разработчики систем искусственного интеллекта. Похожие жалобы всё чаще поступают и от владельцев других ресурсов.

 Источник изображения: Kai Wenzel / unsplash.com

Источник изображения: Kai Wenzel / unsplash.com

Чтобы ограничить трафик от ИИ-ботов, SourceHut пришлось развернуть Nepenthes — средство защиты от недобросовестно работающих веб-сканеров, собирающих данные для обучения моделей ИИ. Администрация платформы в одностороннем порядке целиком заблокировала диапазоны адресов нескольких облачных провайдеров, в том числе Google Cloud и Microsoft Azure, из-за чрезмерных объёмов трафика от развёрнутых в их сетях ботов. Владельцам добросовестно работающих сервисов на этих инфраструктурах рекомендовали связываться с администрацией SourceHut в индивидуальном порядке, чтобы добавлять их в исключения. В 2022 году SourceHut также пострадала из-за слишком частых обращений к её ресурсам от службы Google Go Module Mirror.

В 2023 году OpenAI заверила, что её боты будут выполнять директивы из файлов robots.txt, указывающих правила обработки данных с сайтов веб-сканерами. Аналогичные обязательства взяли на себя и другие разработчики ИИ, но жалобы на злоупотребления продолжают поступать. Летом минувшего года сайт iFixit, в частности, подвергся нашествию со стороны бота Anthropic Claudebot. В декабре хостер Vercel сообщил о значительном присутствии ИИ-сканеров в его инфраструктуре: OpenAI GPTbot отправил в его сеть 569 млн запросов, Anthropic Claude — 370 млн. В совокупности они достигли около 20 % от 4,5 млрд запросов Googlebot, который используется для индексации ресурсов в Google.

 Источник изображения: Kai Wenzel / unsplash.com

Источник изображения: Kai Wenzel / unsplash.com

Тогда же разработчик распределённой соцсети Diaspora Деннис Шуберт (Dennis Schubert) пожаловался, что за предшествующие 60 дней на ИИ-ботов пришлись 70 % трафика на его сервер. Публикация обрела вирусную популярность, и активность ИИ-сканеров резко сократилась; однако сетевые хулиганы устроили на его ресурс массовое нашествие запросов от клиентов со значением строки user-agent, совпадающим с OpenAI GPTbot. Вот только настоящий ИИ-бот OpenAI отправляет запросы из инфраструктуры Microsoft Azure, а в случае с сервером Diaspora они исходили с адресов AWS и даже от американских интернет-провайдеров.

Иногда ситуация осложняется тем, что некоторые боты имеют несколько предназначений. Так, Meta AI bot и AppleBot собирают данные исключительно для обучения ИИ, тогда как GoogleBot служит и для ИИ, и для индексации в поиске. Чтобы избежать путаницы, Google в 2023 году добавила отдельное значение Google-Extended для инструментов обучения ИИ.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме
window-new
Soft
Hard
Тренды 🔥
«Что случилось с ARK 2?»: анонс дополнения к ARK: Survival Ascended вызвал вопросы о ходе разработки второй части 2 ч.
Состоялся релиз RuBackup OneClick — решения для защиты IT-инфраструктур малого и среднего бизнеса 3 ч.
Сборщики данных для ИИ оказались виновниками массового замедления сайтов по всему интернету 3 ч.
Новая демоверсия амбициозного симулятора жизни Inzoi выйдет 20 марта, но не для всех 4 ч.
250-килограммовый логотип-птичку Twitter со штаб-квартиры соцсети выставили на аукцион 4 ч.
Минторг США запретил сотрудникам использовать DeepSeek на рабочих устройствах 4 ч.
Веб-поиск на основе ИИ убил классические «десять синих ссылок» Google 5 ч.
Создатели пошаговой ролевой игры Shadow of the Road анонсировали открытую «альфу» — тестирование пройдёт в Steam, причём уже очень скоро 6 ч.
Матрица импортозамещения от СТРИМ Консалтинг: «Базис» — лидер рынка виртуализации 7 ч.
OpenAI протестирует подключение ChatGPT к «Google Диску», чтобы он мог покопаться в документах 15 ч.
Samsung наконец научилась выпускать память HBM3E, пригодную для ИИ-чипов Nvidia — сертификация завершится к лету 52 мин.
Учёные США научились производить ядерное топливо для модульных АЭС на расплавах солей, но это не точно 2 ч.
GTA VI и Nintendo Switch 2 станут главными драйверами роста рынка видеоигр до 2027 года 3 ч.
Xiaomi выпустила 200 000-й электромобиль — это заняло меньше года 3 ч.
Первый складной iPhone может оказаться вдвое дороже iPhone 16 Pro Max 5 ч.
Apple iPhone 16e показал стойкость в суровых испытаниях на прочность 5 ч.
Абсолютный успех: научный зонд Blue Ghost навсегда заснул на Луне после продуктивной двухнедельной работы 6 ч.
Китай ограничит доступ США и других стран к технологиям производства литиевых батарей и компонентов для них 6 ч.
Микроконтроллер Raspberry Pi RP2350 поступил в продажу по цене от $0,8 6 ч.
ExxonMobil развернёт суперкомпьютер Discovery 6 с суперчипами NVIDIA GH200 6 ч.