Новостные издания ограничивают доступ к Internet Archive из-за опасений по ИИ

Крупные медиакомпании, такие как The Guardian и The New York Times, начали пересматривать доступ к своим цифровым архивам, опасаясь, что ИИ может использовать их для обучения своих моделей.

Internet Archive сохраняет снимки веб-страниц и предоставляет их через Wayback Machine. Однако рост ИИ-ботов, собирающих данные для тренировки моделей, превращает цифровые библиотеки в потенциальную угрозу для издателей. The Guardian заметил, что их контент активно индексировался архивом, и решил ограничить доступ к статьям через API Internet Archive, оставив доступ к главным страницам и тематическим разделам.

Руководитель отдела лицензирования The Guardian Роберт Хан выразил озабоченность тем, что структурированные базы данных из архивов могут быть легко использованы ИИ-компаниями для массового скачивания контента. При этом Wayback Machine считается менее рискованной, так как данные там не структурированы.

Financial Times также блокирует любые боты, пытающиеся получить доступ к платному контенту, включая боты OpenAI, Anthropic, Perplexity и Internet Archive. Большинство статей FT остаются платными, поэтому в Wayback Machine обычно отображаются только открытые материалы.

Как отмечает профессор Майкл Нельсон, сервисы вроде Common Crawl и Internet Archive считаются добрыми проектами, но иногда страдают от действий компаний, использующих их данные в обход правил.

The Guardian предпринимает меры превентивно, сотрудничая с Internet Archive. Полного блокирования ботов пока нет, чтобы не препятствовать миссии архивного проекта - свободному доступу к информации.

New York Times пошла дальше и внесла бота archive.org_bot в файл robots.txt, полностью запрещая доступ к своему контенту через Wayback Machine. Аналогичные шаги предпринял Reddit, ограничив архивирование своих форумов и комментариев, чтобы защитить пользователей.

Основатель Internet Archive Брюстер Кейл предупреждает, что ограничения доступа могут снизить общественный доступ к историческим материалам. В то же время архив внедряет собственные системы лимитирования и фильтрации, чтобы ограничить массовую загрузку контента.

Анализ прошлых данных показывает, что Wayback Machine уже использовалась для обучения крупных языковых моделей, включая Google T5 и Meta LLaMA. В 2023 году C4 dataset показал, что домен web.archive.org занимал 187-е место по количеству включений.

Таким образом, баланс между свободой информации и защитой интеллектуальной собственности становится всё более сложным для медиакомпаний и архивов.

Источник: NiemanLab

Похожие статьи

Рекомендательные технологии Подробнее
Технологии и IT-новости 7 месяцев назад

Radiant Nuclear запускает переносные микрореакторы мощностью 1 МВт

Radiant Nuclear привлекла $300 млн для производства переносных микрореакторов мощностью 1 МВт, которые могут заменить дизель-генераторы и поставляться полностью готовыми к эксплуатации.

Технологии и IT-новости 5 месяцев назад

Самый энергоэффективный радиоуправляемый дрон в мире пролетел 3,5 часа без подзарядки

Южноафриканский инженер Люк Белл создал квадрокоптер, который пролетел рекордные 3,5 часа на одном заряде благодаря оптимизации всех компонентов и новейшим батареям. Эта разработка показывает пределы эффективности современных электрических дронов и их потенциал.

Технологии и IT-новости 7 месяцев назад

Микророботы, которые могут изменить медицину

Маленькие автономные роботы, способные двигаться, "думать" и действовать без внешнего управления. Они могут иметь важные применения в медицине и других областях, но пока работают при световом питании и в токсичных растворах.

Кибербезопасность 6 месяцев назад

Claude Opus 4.6 обнаружила 500+ серьёзных уязвимостей в ключевых open-source библиотеках

Новая модель Claude Opus 4.6 от Anthropic обнаружила более 500 ранее неизвестных критических уязвимостей в популярных open-source библиотеках, продемонстрировав способность AI проводить глубокий анализ кода и помогать в улучшении безопасности ПО.