ИИ-компании скупают старые книги тоннами. Потом срезают корешки, сканируют и уничтожают — 4 августа 2026 г. в 06:23:01.539
ИИ-компании скупают старые книги тоннами. Потом срезают корешки, сканируют и уничтожают В последние месяцы букинисты в Европе и США заметили странную закономерность: книги, которые годами пылились на полках, уходят пачками. Заказы приходят ночью, часто на сотни и тысячи наименований сразу: академическая литература, региональная история, лингвистика, право, экономика 1970–2010-х годов. Романы почти не берут. После покупки физические экземпляры, как правило, исчезают. Дело вот в чём. Владельцы ИИ компаний сели и подумали — интернет уже сильно загрязнён текстами, которые написали нейросети, если продолжать кормить модели этим нейрослопом, возникает риск model collapse — модели начинают деградировать, воспроизводя свои же ошибки и упрощения. Печатные книги, изданные до массового появления генеративного ИИ становится одним из последних крупных источников чистого человеческого текста. Компания ISBNdb, долгие годы занимавшаяся метаданными книг для продавцов и библиотек, теперь открыто предлагает лабораториям ИИ услугу оптовой закупки. На сайте звучит почти рекламный слоган и примерно выглядит так: «Лучшие в мире обучающие данные для ИИ лежат на полке». Книги называют тщательно отобранными, прошедшими экспертную оценку, специализированными знаниями и старательно структурированными. Это вам не дешёвый нейрослоп, который прёт сейчас из всех щелей. Объёмы — от тысячи до миллиона экземпляров за заказ. Полный NDA, анонимность покупателя, стратегия и цели не разглашаются. Площадки вроде Alibris и Biblio фиксируют появление новых крупных оптовых клиентов, которые скупают целые списки по ISBN. Букинисты говорят о кратном росте продаж: вместо обычных 20 книг в хорошую неделю — сотни. Самый громкий кейс принадлежит компании Anthropic и их внутренний проект Panama (начало 2024 года). Из судебных документов следует, что компания целенаправленно скупала миллионы подержанных книг, в том числе через Better World Books. Затем они применяли классическое разрушающее сканирование: гидравлические резаки срезают корешок, страницы идут в промышленные сканеры, бумага затем утилизируется. Внутренние документы показывали крайне амбициозный настрой: «destructively scan all the books in the world» (просканируем и разрушим все книги в мире). Операцию держали в секрете именно из-за репутационных рисков. Никто не оценит новостные заголовки типа: ИИ компании уничтожают миллионы книг. Но они где-то явно просчитались. Суд в деле Bartz v. Anthropic (июнь 2025) признал такой подход честным и никак не нарушающим закон: книги были легально куплены, физический экземпляр уничтожался, цифровая копия никуда дальше не распространялась и использовалась только для обучения, то есть авторское право никак не нарушили и ладно. Отдельно компания урегулировала претензии по пиратским цифровым источникам на 1,5 млрд долларов. Неразрушающие методы существуют (роботы вроде Treventus ScanRobot), но они медленнее и дороже. Когда речь идёт о сотнях тысяч и миллионах томов, скорость и себестоимость решают. Разрушающее сканирование — давно известная практика библиотек и коммерческих оцифровщиков. Разница в масштабе и в том, что конечный продукт почти никогда не становится публичным. Модель не хранит книгу как файл. Она извлекает статистические закономерности языка, ну а после обучения физический объект и даже цельный текст в привычном виде больше не нужны. Получается односторонняя переработка: книга исчезла, обратно её уже не восстановить. Если речь о массовом тираже, который и так лежит в десятках библиотек и на вторичном рынке, уничтожение одного экземпляра выглядит прагматично. Книга становится доступнее в цифровом виде (хотя бы внутри модели), а физический носитель и так избыточен.

