реклама
Теги → сми

Разработчиков ИИ уличили в сборе данных с сайтов СМИ вопреки прямым запретам

Несколько компаний, занимающихся разработкой систем искусственного интеллекта, игнорируют принятый отраслью веб-стандарт, который позволяет издателям блокировать сбор своего контента с целью его последующего включения в массивы для обучения генеративного ИИ. Об этом сообщает Reuters.

 Источник изображений: Gerd Altmann / pixabay.com

Источник изображений: Gerd Altmann / pixabay.com

Информация о неправомерных действиях разработчиков ИИ в отношении сайтов СМИ появилась в рамках публичного разбирательства ИИ-стартапа Perplexity и ресурса Forbes, при этом компании, предположительно оказавшиеся правонарушителями и пострадавшими, не называются. Деловое издание публично обвинило Perplexity в плагиате материалов своих расследований — в составляемых генеративным ИИ сводках оказываются материалы Forbes без запросов разрешения и ссылок на авторов. Поисковый веб-сканер Perplexity, вероятно, игнорирует директивы, которые указываются издателями в файле robots.txt — распространённый стандарт помогает администраторам сайтов определять, какие разделы разрешено сканировать поисковым роботам.

О проблеме сообщила компания TollBit — стартап, выступающий посредником между испытывающими потребность в обучающих материалах ИИ-компаниями и открытыми для заключения лицензионных соглашений издателями. Perplexity — не единственный нарушитель, который предположительно игнорирует директивы robots.txt, считают в TollBit. Сейчас в базе посредника значатся 50 издателей, и «чем больше журналов издателей мы принимаем, тем больше проявляется эта закономерность».

Протокол robots.txt был создан в середине девяностых годов, чтобы защитить сайты от перегрузок из-за поисковых роботов. Чёткого механизма правового принуждения соблюдать директивы файла не существует, но исторически они соблюдались добровольно. Недавно robots.txt стал основным инструментом, который издатели использовали, чтобы не допустить бесплатного включения их контента в массив данных для генеративного ИИ. Этот контент используется как для обучения ИИ, так и для создания сводок информации на его основе в режиме реального времени.

Некоторые издатели, включая New York Times, пытаются засудить разработчиков ИИ за нарушение авторских прав в связи с использованием материалов для этих целей. Другие подписывают с создателями ИИ лицензионные соглашения. Стороны часто расходятся во мнениях относительно ценности материалов — некоторые разработчики даже утверждают, что не нарушают законов, получая доступ к материалам СМИ бесплатно.

Новостные и социальные сайты требуют от OpenAI платить за обучение ChatGPT на их публикациях

Несколько крупных представителей СМИ и информационных онлайн-платформ ведут переговоры с компанией OpenAI, создавшей популярного ИИ-чат-бота ChatGPT, по поводу доступа к их ресурсам на платной основе. Эти ресурсы представляют собой важнейший источник информации, на основе которой обучаются большие языковые модели.

 Источник изображения: Rolf van Root / unsplash.com

Источник изображения: Rolf van Root / unsplash.com

Как пишет издание The Washington Post, такие технологические компании как OpenAI годами пользовались на бесплатной основе новостными онлайн-ресурсами и использовали их материалы для обучения своих ИИ-моделей. В последнее время в сфере генеративного ИИ наблюдается значительный рост доходов. По оценкам некоторых экспертов, опрошенных Bloomberg, выручка данного сегмента вырастет к 2032 году до $1,3 триллиона. Информационные издания и платформы претендуют на часть этих денег.

С августа текущего года как минимум 535 ведущих изданий, включая York Times, Reuters и The Washington Post, установили на свои онлайн-ресурсы специальные блокираторы, которые не позволяют собирать информацию для обучения ChatGPT. Отмечается, что издатели ведут переговоры с OpenAI по вопросу предоставления чат-боту ChatGPT платного доступа к конкретным отдельным опубликованным материалам. Издатели считают, что такая схема взаимодействия имеет два неоспоримых плюса: информационные платформы будут получать дополнительный доход за каждый отдельный опубликованный материал, а также смогут потенциально увеличить объём трафика на свои веб-сайты.

В июле OpenAI заключила сделку с информационным агентством Associated Press. Технологическая компания может использовать публикации ресурса без ограничений для обучения своих ИИ-моделей. По словам источников The Washington Post, такая схема взаимодействия также рассматривается в переговорах между OpenAI и другими изданиями. Однако последние больше склоняются в пользу предоставления доступа только к отдельным материалам, которые могли бы отображаться в ответах на запросы пользователей того же ChatGPT.

Источники The Washington Post отмечают, что другие онлайн-платформы, представляющие информационный интерес для обучения чат-ботов, например, Reddit, выросшая из небольшой и простой доски объявлений в огромную социальную платформу, тоже ищет способы дополнительной монетизации за свои публикации. Источники Washington Post утверждают, что представители платформы вели переговоры с ведущими компаниями в разработке генеративного ИИ по вопросам оплаты публикаций, которые могут использоваться для обучения ИИ-моделей. Если такой договорённости достигнуть не получится, то Reddit готова рассмотреть возможность ввода страницы авторизации на свою платформу, без прохождения которой контент не будет отображаться для её посетителей.

Переход в разряд закрытой платформы может лишить Reddit поисковой выдачи в Google, сократив количество посетителей сайта по переходам из поиска. Однако по словам анонимного источника The Washington Post, в Reddit считают, что этого того стоит, и платформа «сможет выжить и без поиска». Публично представители Reddit такие заявления отрицают: «Ничего не меняется», — заявила представитель платформы Кортни Гиси-Дорр (Courtney Geesey-Dorr) в разговоре с изданием The Verge, попросившем прокомментировать сообщение The Washington Post.

В апреле социальная сеть X (бывший Twitter) начала взимать с исследователей 42 000 долларов за предоставление доступа к подробной статистике и публикациям на платформе. Ранее такой доступ предоставлялся бесплатно, однако по словам владельца соцсети Илона Маска (Elon Musk), компании, занимающиеся разработкой искусственного интеллекта, незаконно использовали данные платформы для обучения своих ИИ-моделей.

 D koi / unsplash.com

D koi / unsplash.com

Учитывая, что генеративный искусственный интеллект способен изменить взаимодействие пользователей с Интернетом, многие издатели и другие компании считают введение оплаты за свою информацию справедливой мерой, рассматривая этот вопрос как экзистенциальную проблему. Например, через месяц после того, как OpenAI запустила продвинутую ИИ-модель GPT-4, трафик сообщества программистов Stack Overflow снизился на 15 %, поскольку люди стали чаще обращаться к ИИ в вопросах, связанных с кодированием, а не к популярной веб-платформе. Об этом в разговоре с The Washington Post сообщил исполнительный директор Stack Overflow Прашант Чандрасекар (Prashanth Chandrasekar). Он также добавил, что чат-бот OpenAI также обучался и на основе их данных. На этой неделе Stack Overflow сократила свой персонал на 28 %.

Помимо требований об оплате за используемую для обучения ИИ информацию, ведущие компании, занимающиеся искусственным интеллектом, сталкиваются с множеством исков от отдельных авторов книг, художников и программистов, требующих возмещения ущерба за нарушение их авторских прав, а также, чтобы эти компании поделились с ними долей прибыли. Как сообщает издание Reuters, на этой неделе против Meta, Microsoft и Bloomberg был подан коллективный иск. Его инициаторы утверждают, что для обучения своих систем искусственного интеллекта указанные компании использовали пиратские онлайн-библиотеки.

По мнению экспертов, готовность OpenAI вести переговоры с издателями может говорить о желании компании заключить сделки для легального использования контента и усилить свою юридическую базу до того, как в дело вступят суды, которые определят есть ли у технологических компаний четкие юридические обязательства лицензировать контент и платить за его использование.

В OpenAI подтвердили, что компания ведет переговоры с издателями. Однако предмет разговора не связан с контентом, на базе которого её ИИ-модели уже были обучены. Компания также утверждает, что всю информацию для обучения своих моделей она получила законным путём. «Ни одна наша практика не нарушает закон об авторском праве», — заявил представитель OpenAI. По его словам, в рамках диалога с издателями компания обсуждает вопросы, связанные с новым контентом, доступ к которому был бы невозможен без официальных соглашений.

Роскомнадзор заблокировал 135 млн мошеннических звонков

Роскомнадзор сообщил результаты работы системы «Антифрод», которая мешает злоумышленникам осуществлять мошеннические звонки с подменных номеров. По данным ведомства, в период с декабря 2022 года по март 2023 года было предотвращено 135 млн мошеннических звонков.

 Источник изображения: Pixabay

Источник изображения: Pixabay

Отмечается, что до конца текущего года к системе «Антифрод» должны подключиться все операторы связи. В настоящее время это требование выполнила только большая четвёрка — «Мегафон», МТС, «билайн» и Tele2. В сообщении сказано, что в декабре прошлого года система «Антифрод» помогла предотвратить 600 тыс. мошеннических звонков, в январе это значение увеличилось до 26,7 млн вызовов, в феврале — до 47,8 млн вызовов, а в марте — до 60 млн вызовов.

Не позднее марта 2024 года к системе «Антифрод» присоединятся ещё 2464 российских оператора связи. Подключение к системе заявляется как бесплатное. Малые операторы связи могут выбрать один из трёх вариантов: облачное подключение, адаптация специального ПО на сервере оператора и аппаратное присоединение к узлу взаимодействия.

Также стало известно, что Роскомнадзор заблокировал около 3,5 тыс. «зеркал» сайтов СМИ, которые были признаны Минюстом РФ иностранными агентами. По данным ведомства, с момента обнаружения зеркального сайта до его блокировки проходит около трёх часов. В Роскомнадзоре сообщили, что крупные «антироссийские ресурсы» создают новое «зеркало» раз в сутки, преимущественно используя для этого хостинги американских компания Cloudflare, Amazon и Google.

Илон Маск считает Twitter более оперативным в подаче новостей, чем традиционные СМИ

На прошлой неделе Twitter лишил официальный аккаунт газеты The New York Times лишился синей галочки верификации после её отказа вносить ежемесячную плату за статус верифицированного пользователя. А некоммерческая организация National Public Radio, тоже отказавшаяся платить за галочку верификации, получила в Twitter статус государственной. В то же время владелец сервиса микроблогинга Илон Маск (Elon Musk) раскритиковал СМИ за неточность и медлительность.

 Источник изображения: Pixabay

Источник изображения: Pixabay

Сам Илон Маск считает Twitter серьёзным конкурентом традиционным СМИ, пишет деловая газета The Wall Street Journal. Спустя несколько недель после того, как в он возглавил Twitter, Маск предупредил о возможном конфликте с традиционными СМИ. «Поскольку Twitter преследует цель поднять гражданскую журналистику, медиаэлита сделает всё возможное, чтобы этого не произошло, — сообщил он в Twitter. — Основные СМИ по-прежнему будут процветать, но усиление конкуренции со стороны граждан заставит их быть более точными, так как их информационная олигополия разрушена».

В отличие от традиционных СМИ, у Twitter нет новостного отдела с репортёрами и редакторами, занимающимися написанием статей. Вместо этого Маск полагается на пользователей и их твиты, а также на систему проверки фактов, направленную на обеспечение точности отображения информации. И всё это происходит в «прямом эфире».

«Сравним это с тем, что происходит в газете: там должны изучить информацию, предложить статью своему редактору, получить его одобрение, написать статью, отредактировать её, выяснить, в какой день она будет опубликована», — рассказал Маск в прошлом месяце. По его словам, в итоге новость сообщают с опозданием на три, четыре дня, иногда на неделю.

Также на минувшей неделе Twitter начал маркировать ссылки на сервис Substack как потенциально небезопасные. Эксперты это связывают с тем, что Substack представил приложение Notes с похожей на Twitter функциональностью.

Многие рыночные наблюдатели считают, что разногласия Маска с медиакомпаниями и другими известными пользователями могут оттолкнуть их от Twitter, что опять же грозит потерей аудитории и рекламных поступлений. «Причина, по которой команда Twitter Media существовала, заключалась в том, что (почти всё) взаимодействие в Twitter происходит с твитами от высокопоставленных людей/организаций из правительства, спорта, музыки, бизнеса, новостей, кем бы ни были Кардашьян и т.д. — написал Натан Хаббард (Nathan Hubbard), бывший вице-президент компании по глобальной коммерции и СМИ в прошлом месяце. — Они — жизненная сила платформы».

window-new
Soft
Hard
Тренды 🔥
Новая статья: Верные спутники: 20+ полезных Telegram-ботов для путешественников 20 мин.
Итоги Golden Joystick Awards 2024 — Final Fantasy VII Rebirth и Helldivers 2 забрали больше всех наград, а Black Myth: Wukong стала игрой года 2 ч.
В программу сохранения классических игр от GOG вошли S.T.A.L.K.E.R. Shadow of Chernobyl и Call of Pripyat, а Clear Sky — на подходе 3 ч.
Star Wars Outlaws вышла в Steam с крупным обновлением и дополнением про Лэндо Калриссиана 5 ч.
Рекордная скидка и PvP-режим Versus обернулись для Warhammer: Vermintide 2 полумиллионом новых игроков за неделю 6 ч.
Новый трейлер раскрыл дату выхода Mandragora — метроидвании с элементами Dark Souls и нелинейной историей от соавтора Vampire: The Masquerade — Bloodlines 7 ч.
В Японии порекомендовали добавить в завещания свои логины и пароли 9 ч.
Обновления Windows 11 больше не будут перезагружать ПК, но обычных пользователей это не касается 9 ч.
VK похвасталась успехами «VK Видео» на фоне замедления YouTube 11 ч.
GTA наоборот: полицейская песочница The Precinct с «дозой нуара 80-х» не выйдет в 2024 году 12 ч.
Представлен внешний SSD SanDisk Extreme на 8 Тбайт за $800 и скоростной SanDisk Extreme PRO с USB4 2 ч.
Представлен безбуферный SSD WD_Black SN7100 со скоростью до 7250 Мбайт/с и внешний SSD WD_Black C50 для Xbox 2 ч.
Новая статья: Обзор ноутбука ASUS Zenbook S 16 (UM5606W): Ryzen AI в естественной среде 2 ч.
Redmi показала флагманский смартфон K80 Pro и объявила дату его премьеры 4 ч.
Астрономы впервые сфотографировали умирающую звезду за пределами нашей галактики — она выглядит не так, как ожидалось 7 ч.
Представлена технология охлаждения чипов светом — секретная и только по предварительной записи 8 ч.
Японская Hokkaido Electric Power намерена перезапустить ядерный реактор для удовлетворения потребности ЦОД в энергии 8 ч.
Грузовик «Прогресс МС-29» улетел к МКС с новогодними подарками и мандаринами для космонавтов 8 ч.
Meta планирует построить за $5 млрд кампус ЦОД в Луизиане 9 ч.
Arm задаёт новый стандарт для ПК, чтобы навязать конкуренцию x86 9 ч.