Для обучения нейросетей разработчики ИИ массово уничтожают редкие книги
Стремительное внедрение во все большие сферы человеческой жизни искусственного интеллекта приводит к довольно неожиданным побочным эффектам. Одним из них стала массовая скупка компаниями, работающими в сфере создания ИИ-моделей, раритетных печатных изданий. О необычных последствиях этого тренда с тревогой пишет американское интернет-издание 404 Media.
Американские технологические гиганты для обучения разрабатываемых ими нейросетей используют электронные копии редких и авторских печатных изданий, некоторые из которых сохранились в ограниченном количестве экземпляров. Для создателей больших языковых моделей книги — всего лишь расходный материал для обучающих датасетов.
Их скупают на аукционах или напрямую у букинистов, в том числе через специализированные компании, такие как онлайн-агрегатор книжных данных ISBNdb. Когда-то он помогал библиотекам, дистрибьюторам и книжным магазинам находить и продавать книги. Теперь же помогает ИИ-компаниям массово закупать от 1000 до миллиона книг за один заказ.
Далее печатные издания ждет незавидная судьба. К примеру, разработчик семейства больших языковых моделей под общим названием Claude американская компания Anthropic использует по сути варварскую технологию оцифровки печатных изданий. При помощи гидравлического резака страницы книг аккуратно отделяются от основы. Затем их сканируют на промышленном оборудовании, а после выбрасывают.
Этот процесс опирается на юридическую доктрину «первой продажи» (first-sale doctrine), которая позволяет покупателю делать с приобретенным экземпляром что угодно без согласия правообладателя. Даже издания, защищенные авторскими правами, могут быть таким образом оцифрованы, после чего становятся частью базы данных нейросетей, а исходники идут в утиль.
Автор: Alnik53