Компании, разрабатывающие ИИ, начали массово скупать печатные книги, чтобы оцифровывать их содержимое и использовать полученные тексты для обучения моделей.
Одной из компаний, прибегнувших к такой практике, стала Anthropic.
Она закупала книги у продавцов подержанной литературы, срезала страницы с помощью гидравлического оборудования, а затем сканировала их на промышленных установках.
В результате книги фактически уничтожались в процессе оцифровки.
Особенно ценными считаются книги, выпущенные до массового распространения больших языковых моделей.
В отличие от современного интернета и некоторых новых изданий, они гарантированно не содержат текстов, созданных генеративным ИИ.
Компания ISBNdb, располагающая крупной базой данных книг, утверждает, что печатные издания, выпущенные до 2022 года, являются «структурно чистыми» от подобного загрязнения.
ISBNdb помогает ИИ-компаниям закупать от тысячи до миллиона книг за один заказ и обещает сохранять личности покупателей в тайне.
Некоторые продавцы подержанных книг также сообщают о резком росте крупных и необычных заказов.
Один из них рассказал, что прежде продавал не более 20 книг в неделю, но затем объемы внезапно выросли до нескольких сотен.
По случайному набору заказанных изданий он предполагает, что покупателями могут быть ИИ-лаборатории.
При этом среди таких заказов встречаются редкие и давно не переиздававшиеся книги.
Продавцы опасаются, что при таком раскладе могут уничтожаться некоторые из немногих экземпляров, еще остающихся в печатном виде.
Для массовой оцифровки используется так называемое разрушительное сканирование: у книг срезают переплет, после чего отдельные страницы пропускают через высокоскоростные промышленные сканеры.
Такой способ значительно быстрее и дешевле бережного и ручного сканирования, однако после процедуры восстановить книгу уже невозможно.
