Миллионы книг были разрезаны и уничтожены для обучения ИИ-модели Claude

Внутренние документы, раскрытые в ходе судебного разбирательства с писателями, показывают, как гигант в сфере ИИ приобретал миллионы книг, разбирал и сканировал их, а затем выбрасывал физические копии. Цель: создать огромную базу качественного человеческого текста для обучения Claude.

WallaАвтор: Инон Бен-Шошан
Источник
Миллионы книг были разрезаны и уничтожены для обучения ИИ-модели Claude
Фото: צילום: Walla.co.il

Новые подробности об одном из необычных проектов компании Anthropic раскрываются в издании The Guardian вслед за внутренними документами компании, представленными в рамках судебного разбирательства с писателями в США. Согласно документам, компания, разрабатывающая модель искусственного интеллекта Claude, приобретала миллионы печатных книг, разбирала их, сканировала страницы, а затем уничтожала физические копии. Операция получила кодовое название «Project Panama», и во внутренней служебной записке от апреля 2024 года ее цель была определена словами, которые трудно истолковать иначе: «наши усилия по деструктивному сканированию всех книг в мире». Секретность также была намеренной. В документе было написано, что компания использует кодовое название, поскольку не хочет, чтобы стало известно, что она работает над этим проектом, и сотрудников просили не говорить о нем публично.

За проектом стояла центральная проблема компаний в сфере искусственного интеллекта: для обучения такой модели, как Claude, требуются огромные объемы качественного текста. Anthropic искала, в частности, книги периода, предшествовавшего распространению ИИ-моделей, поскольку они содержат человеческий текст, на который не повлиял контент, уже созданный с помощью искусственного интеллекта. С точки зрения компании, книги были особенно качественным материалом для обучения благодаря длинным и сложным текстам, которые они содержат. В судебных документах было написано, что Anthropic особенно ценила «хорошо курируемые факты, организованный анализ и захватывающие художественные повествования», содержащиеся в книгах — контент, который может научить Claude писать более точно и убедительно.

Чтобы получить этот материал, Anthropic потратила миллионы долларов на покупку книг и обращалась к дистрибьюторам и розничным продавцам, чтобы покупать их в больших количествах, включая подержанные экземпляры. Затем книги передавались сторонним поставщикам, которые удаляли обложки, разрезали корешки книг и отделяли страницы, чтобы быстро пропустить их через сканеры. Из каждой книги создавался PDF-файл, включающий отсканированные страницы наряду с текстом, который компьютер может читать и обрабатывать. По завершении процесса бумажные копии выбрасывались или отправлялись на переработку. Именно в этом заключается смысл «деструктивного сканирования»: вы не сканируете книгу и не храните ее на полке, а физически разбираете ее, чтобы превратить в цифровой файл — и оригинальная копия не переживает этот процесс.

Однако книги, приобретенные законным путем, были лишь частью базы данных Anthropic. Согласно документам, компания также использовала огромные количества книг, поступивших из пиратских хранилищ: около пяти миллионов копий из LibGen, около двух миллионов из Pirate Library Mirror и около 183 тысяч из Books3. Anthropic также рассматривала возможность получения упорядоченных лицензий от правообладателей, но внутри компании юридический, деловой и практический процесс, связанный с этим, был описан как громоздкий. Использование пиратских книг впоследствии стало центральной частью судебного разбирательства с писателями, и компания достигла внесудебного соглашения на сумму 1,5 миллиарда долларов в отношении пиратских материалов.

Суд, однако, провел четкое различие между книгами, которые Anthropic купила, и копиями, полученными из пиратских источников. Судья Уильям Алсап постановил, что использование книг, приобретенных законным путем, для обучения ИИ-модели может считаться «добросовестным использованием» — то есть использованием, которое разрешено в определенных случаях даже без дополнительного разрешения от правообладателя. Согласно решению, Claude не распространял книги повторно, а учился на тысячах произведений грамматике, структуре и способам письма для создания нового текста. Превращение печатных книг, приобретенных законным путем, в цифровые файлы для исследовательской библиотеки Anthropic также не было сочтено нарушением. Напротив, что касается пиратских книг, судья был однозначен: скачивание книги с пиратского сайта само по себе является нарушением авторских прав.

Подробности, раскрывающиеся сейчас, иллюстрируют прежде всего то, насколько компании в сфере искусственного интеллекта все еще зависят от человеческого творчества для создания систем, которые должны конкурировать с ним. Согласно судебным документам, Anthropic стремилась создать центральную исследовательскую библиотеку «всех книг в мире», которая будет храниться «вечно» и позволит ей выбирать из нее различные книжные базы для обучения будущих моделей. Компания сообщила, что ее планы по сбору данных не включают покупку и уничтожение «редких» или «древних» книг. Однако проект оставляет после себя более широкий вопрос: когда миллионы печатных книг становятся для ИИ-индустрии сырьем, которое можно купить, разрезать, отсканировать, а затем выбросить — «Project Panama» может быть не только историей о том, как обучался Claude, но и взглядом на то, как гонка за данными для ИИ меняет отношение к самим книгам.

Читайте также