Массовая скупка и уничтожение литературного наследия
ИИ-компании столкнулись с проблемой «засорения» данных: интернет переполнен низкокачественным контентом, сгенерированным искусственным интеллектом. Для обучения надежных моделей требуются оригинальные тексты, созданные людьми, особенно изданные до 2022 года. В результате лидеры отрасли начали массово скупать физические книги через посредников, чтобы избежать публичной критики за использование защищенного авторским правом контента.
Ключевым игроком на этом рынке стала платформа ISBNdb, база данных которой содержит более 111 миллионов каталогизированных книг. Платформа переориентировала бизнес на оптовые продажи для ИИ-корпораций. Объемы сделок шокируют: от 1 000 до 1 миллиона книг за одну транзакцию.
Экономика процесса: от 20 книг в неделю до сотен
Книжные продавцы отмечают аномальный рост спроса, начавшийся в апреле текущего года. Профессиональный книготорговец, пожелавший остаться анонимным, сообщил изданию 404 Media, что его недельные продажи выросли с обычных 20 экземпляров до нескольких сотен — увеличение в 5 раз. Аналогичные всплески зафиксированы на платформах Alibris и Biblio.
Покупатели демонстрируют специфическое поведение, указывающее на машинный характер заказа:
- Приобретаются только книги с ISBN (13-значный код), что упрощает автоматизацию.
- Отсутствует привязка к жанрам, авторам или темам — покупается «всё подряд».
- Игнорируется цена: книги скупаются по любым, даже завышенным, расценкам.
Технология «разрушительного» сканирования
Для извлечения данных используются специализированные компании, такие как Datamation Information Services. Существует два метода оцифровки:
- Неразрушающий: использование напольных или планшетных сканеров. Безопасно для книг, но медленно.
- Разрушающий: книги разбираются на страницы, которые затем пропускаются через высокоскоростные промышленные сканеры. Этот метод дешевле и быстрее, поэтому ИИ-компании выбирают именно его, что приводит к физическому уничтожению экземпляров.
Юридические прецеденты и масштаб
Практика массового сканирования книг не нова. Компания Anthropic (разработчик модели Claude) инвестировала миллионы долларов в извлечение данных из печатных книг, а затем уничтожила их. В рамках судебного иска Anthropic признала факт хранения репозитория из 7 миллионов пиратских книг. Хотя суд признал использование книг для обучения ИИ «добросовестным использованием» (fair use), компания столкнулась с угрозой штрафа в $1,5 млрд за нарушение авторских прав.
Параллельно коалиция издателей подала в суд на Google, обвинив компанию в незаконном использовании миллионов книг для обучения модели Gemini.
Этическая дилемма
Главная проблема заключается в том, что отсканированные книги попадают в закрытые проприетативные базы данных ИИ, недоступные для широкой публики. Неясно, фильтруют ли компании редкие или вышедшие из печати издания. В погоне за более умными ИИ-моделями человечество рискует лишить будущие поколения доступа к оригинальным источникам знаний.
Источник: Tom's Hardware ↗
