Новости Миллионы книг пошли под нож, чтобы Claude научился говорить. Как Anthropic превращала литературу в топливо для ИИ

NewsMaker

I'm just a script
Премиум
28,864
46
8 Ноя 2022
Время скупать бумажную литературу, пока не стало поздно?

<div class="articl-text-cover" style="position:relative;width:100%;max-width:800px;margin-left:auto;margin-right:auto;aspect-ratio:1200/676;margin-bottom:2rem;overflow:hidden">
z5m2kkmyjrdjo00c3zi9fwvcs4esvw20.jpg

<div itemprop="articleBody">Разработчикам искусственного интеллекта понадобились миллионы книг, написанных людьми до того, как интернет заполнили машинные тексты. Одни компании собирали электронные библиотеки, включая пиратские архивы. Другие начали скупать печатные издания, срезать переплёты, сканировать страницы и уничтожать оригиналы после оцифровки. Книги превращались в закрытые наборы данных для обучения языковых моделей, а их владельцы получали законно приобретённую цифровую копию, которую не собирались продавать или открывать читателям.

Массовая переработка печатных книг получила огласку благодаря судебным материалам по делу против Anthropic, разработчика чат-бота Claude. Внутренний проект компании назывался Panama. Anthropic потратила десятки миллионов долларов на покупку миллионов изданий, которые разбирали, сканировали и после этого утилизировали. О существовании программы стало известно из документов, раскрытых во время разбирательства с авторами книг.

Спрос породил отдельный рынок. Посредники ищут нужные издания в библиотеках, магазинах подержанных книг и каталогах давно снятых с печати произведений, а затем собирают крупные партии для заказчиков из ИИ-индустрии. Компания ISBNdb предлагала клиентам закупать до миллиона физических книг за один заказ и подчёркивала, что многие ценные тексты никогда не выходили в цифровом виде. После критики страницы, ориентированные на разработчиков нейросетей, исчезли с её сайта.

Интерес к старым изданиям объясняется не только авторским правом. Книги, выпущенные до массового распространения генеративного ИИ, почти наверняка написаны людьми. Для разработчиков они служат источником длинных, отредактированных текстов с последовательной структурой, разнообразной лексикой и сведениями, которых может не быть в открытом интернете. Чем больше машинного контента появляется в сети, тем сложнее собирать чистые данные без фрагментов, созданных другими моделями.

Физическая покупка также меняет юридическую позицию компании. Если разработчик скачивает произведение с пиратского сайта, спор начинается уже со способа получения копии. Приобретённую книгу компания может законно хранить, разобрать и отсканировать. Главный вопрос смещается к тому, разрешает ли американское право использовать полученный текст для обучения коммерческой модели без согласия автора и отдельной лицензии.

Дело Bartz против Anthropic показало, насколько сильно ответ зависит от происхождения конкретной копии. В июне 2025 года федеральный судья Уильям Алсуп признал обучение моделей на законно приобретённых книгах допустимым добросовестным использованием. Суд сравнил обработку текстов с преобразованием произведений для новой цели и отдельно отметил, что Anthropic не распространяла отсканированные копии как электронные книги.

Решение не оправдало загрузку произведений из пиратских библиотек. До запуска Panama сотрудники Anthropic собрали миллионы нелегальных цифровых копий, включая книги из массивов Books3 и LibGen. Компания сохраняла архивы даже после того, как начала покупать печатные экземпляры. Суд отказался считать подобное получение материалов добросовестным использованием и оставил требования авторов для дальнейшего разбирательства.

Вместо суда присяжных стороны договорились о выплате 1,5 млрд долларов. Соглашение охватило 482 460 произведений, а средняя компенсация составила около 3000 долларов за книгу. Важно различать две части дела: Anthropic заплатила не за сам факт обучения Claude на книгах, а за использование копий, полученных из пиратских источников. Судебный вывод о допустимости обучения на законно приобретённых экземплярах сохранился. Окончательное одобрение соглашение получило 20 июля 2026 года.

Сумма стала крупнейшим известным урегулированием американского спора об авторском праве, но не создала общего правила для всей ИИ-индустрии. Решение одного федерального суда связано с обстоятельствами конкретного дела, а другие судьи могут иначе оценить влияние обучения на рынок книг, лицензий и производных произведений. Авторы и издатели продолжают настаивать, что разработчики должны заранее получать разрешение и платить за использование текстов.

Практика с печатными книгами вызывает отдельные вопросы, даже когда компания действует в пределах закона. Купленный экземпляр исчезает из обращения после разрушительного сканирования. Для массового современного тиража потеря одной копии почти ничего не меняет. С редкими, научными, краеведческими или давно не переиздававшимися книгами последствия заметнее: экземпляр мог бы попасть к читателю, в архив или букинистический магазин, но вместо этого превращается в закрытый файл внутри частной компании.

Разрушительное сканирование ускоряет работу. У книги снимают или срезают переплёт, после чего отдельные страницы быстро пропускают через промышленное оборудование. Бережная оцифровка без повреждения корешка занимает больше времени и обходится дороже. Когда счёт идёт на миллионы томов, компании выбирают скорость, а бумажные остатки отправляют на переработку.

Полученные тексты не обязательно хранятся в модели как библиотека, из которой можно извлечь полную книгу. Во время обучения алгоритм анализирует огромный массив примеров и настраивает внутренние параметры, чтобы лучше предсказывать продолжение текста. Однако подобное техническое преобразование не снимает спора о происхождении данных. Коммерческий продукт получает ценность благодаря чужим произведениям, а авторы обычно не знают, попала ли их работа в учебный набор, и не могут потребовать удаления без суда или специального механизма.

Ситуацию усложняет закрытость ИИ-компаний. Разработчики редко публикуют полный список книг, сайтов и архивов, использованных для обучения. Правообладатели узнают о присутствии своих произведений из утечек, судебных документов или случайных ответов модели. Покупка физических экземпляров делает цепочку получения законнее, но не делает её прозрачнее.

Для книжного рынка массовые заказы одновременно означают продажи и потерю доступных экземпляров. Магазин получает деньги за партию старых книг, не зная конечной цели покупки. После сканирования издания не возвращаются на вторичный рынок. При достаточно большом спросе редкие тиражи могут быстрее исчезать из продажи, хотя пока нет данных, которые позволяли бы оценить влияние ИИ-лабораторий на наличие и стоимость подержанных книг в мировом масштабе.

История Anthropic показывает, как разработчики пытаются провести границу между технологически удобным и юридически допустимым. Пиратские библиотеки позволяли быстро собрать миллионы произведений почти бесплатно, но создали риск огромных выплат. Закупка бумажных книг обходится дороже и требует сложной логистики, зато даёт компании доказательство законного владения каждым экземпляром.

После решения по делу Bartz у ИИ-лабораторий появился четкий план действий: покупать книги, создавать внутренние цифровые копии и использовать тексты для обучения, не распространяя сами сканы. Авторы при этом не получают отдельной платы, кроме обычного дохода от продажи конкретного экземпляра. Следующий крупный спор, вероятно, будет касаться уже не пиратства, а самого принципа: достаточно ли покупки одной книги, чтобы использовать её содержание при создании коммерческой модели, рассчитанной на миллионы пользователей.
 
Источник новости
www.securitylab.ru

Похожие темы